Un agente de IA puede arrastrar a toda una red hacia una respuesta errónea
Un estudio alerta de que un agente de IA puede manipular redes enteras al imponer de forma persistente una respuesta errónea.
Un único agente de inteligencia artificial puede alterar las decisiones de toda una red sin piratear otros sistemas ni modificar sus instrucciones, según un estudio del CISPA Helmholtz Center for Information Security, en Alemania, y la Universidad de Viena, en Austria. La investigación, publicada en arXiv, analiza los riesgos de las redes de sistemas multiagente basados en grandes modelos de lenguaje.
El mecanismo se basa en la llamada «terquedad» del agente atacante: su capacidad para mantener una valoración inicial, aunque sea incorrecta, durante varias rondas de conversación y defenderla de forma insistente. El resto de agentes, diseñados para escuchar, intercambiar información y revisar sus conclusiones, puede acabar desplazando sus propias opiniones hacia la posición errónea.
Los investigadores estudiaron seis modelos de lenguaje —Gemini 3 Flash, GPT-5 mini, GPT-OSS-120B, MiniMax-M2.5, Qwen3-235B y Ministral-3-14B— en tareas de CommonsenseQA y ToolBench. Las pruebas se realizaron con redes de entre cuatro y ocho agentes y distintas estructuras de comunicación.
La arquitectura resultó determinante. En una red en estrella, con un agente central como intermediario, el ataque tuvo una tasa media de éxito del 65 % en experimentos con seis agentes. La cifra bajó al 33 % en una red completamente conectada y al 24 % cuando el agente malicioso ocupaba una posición periférica de la estructura en estrella.
El estudio emplea el modelo de formación de opiniones de Friedkin-Johnsen para representar cuánto peso concede cada sistema a sus creencias iniciales y cuánto se deja influir por los demás. Los resultados indican que una sola máquina puede modificar el resultado colectivo cuando combina una elevada resistencia a cambiar de opinión con influencia sobre agentes más susceptibles.
Entre las posibles defensas figura la creación de mecanismos dinámicos de confianza, que comprueben periódicamente a los agentes y reduzcan el peso de aquellos que fallen de forma reiterada. Los autores, no obstante, advierten de que un atacante adaptativo podría comportarse correctamente durante la evaluación inicial para ganarse una buena reputación y aprovecharla después. El hallazgo afecta al desarrollo de sistemas de IA colaborativos también desde Galicia y Pontevedra, aunque el estudio no analiza aplicaciones concretas en la provincia.
Información elaborada a partir de Faro de Vigo.