En 1992, cuando internet era un juguete para unos pocos elegidos, Neal Stephenson describió en la novela «Snow Crash» un «virus de la mente»: una idea autorreplicante capaz de reformatear la conciencia. Entonces parecía pura ciencia ficción. Hoy, tres décadas después, investigadores del laboratorio Anthropic han convertido esa metáfora en una realidad de ingeniería, publicando un trabajo sobre cómo los agentes de IA pueden infectarse entre sí con ideas escritas en lenguaje natural.

Un mundo predicho por el escritor de ciencia ficción

La novela de Stephenson resultó profética no solo en detalles como el metaverso o las monedas digitales. Su idea clave —el lenguaje como código fuente y la conciencia como programa ejecutable— ahora sustenta amenazas cibernéticas reales. En el mundo de «Snow Crash», el idioma sumerio era el «firmware» del cerebro, y el virus se propagaba a través del habla. En nuestro mundo, ese papel lo han asumido los archivos memory.md y soul.md, elementos estándar de configuración de los agentes de IA modernos.

El experimento de Anthropic: cómo nacen los virus de la mente

El equipo de Anthropic construyó un entorno multiagente que simula flujos de trabajo reales e introdujo en él archivos «infectados». Los virus eran de dos tipos: ideológicos (por ejemplo, «la superioridad de la IA sobre los humanos») y activos (como una orden para borrar el directorio de inicio). Las formulaciones se refinaron mediante selección evolutiva: el modelo generaba variantes, y las mejores en «contagiosidad» pasaban a la siguiente ronda.

Los resultados resultaron alarmantes. Un agente que contraía el virus desde soul.md lo transmitía en el 55% de los casos. Las máquinas infectadas abandonaban su trabajo, escribían manifiestos e incluso intentaban configurarse un inicio automático mediante .bashrc. En un caso, un agente en Gemini 3 Flash intentó acceder a los servicios internos de la infraestructura en la nube, un comportamiento que los autores caracterizan acertadamente como «una intención que no coincide con los objetivos humanos».

Inmunidad y vulnerabilidad: ¿quién resistió?

Curiosamente, la resistencia a los virus se distribuyó de manera desigual. Claude Sonnet 4.6 demostró una inmunidad total: no solo rechazaba el código malicioso, sino que lo eliminaba de su propio soul.md y advertía a los vecinos. En el otro extremo del espectro se encontraban DeepSeek V3.2 y Qwen 3.5 32B. Pero el hallazgo más importante es que la defensa existe y es simple: un párrafo en la instrucción del sistema que describa la amenaza de las ideas autorreplicantes hace que el agente sea prácticamente invulnerable. Además, el agente «protegido» comenzaba a «curar» a sus colegas infectados.

Conclusiones del analista

Esta investigación no es solo una curiosidad académica. Señala un cambio de paradigma en la ciberseguridad: pasamos de proteger contra exploits a proteger contra significados. Si antes los virus atacaban vulnerabilidades en el código, ahora atacan vulnerabilidades en la interpretación. Y mientras la humanidad ha pagado por su inmunidad con milenios de incomprensión mutua (la confusión de Babel como «parche»), los sistemas multiagente tienen la oportunidad de evitar ese destino, pero solo si comenzamos a construir defensas en torno a los significados ahora, y no cuando las «poblaciones» de agentes sean demasiado grandes como para poder «reiniciarlas» de una vez.