Cuando en 1992 Neal Stephenson publicó «Snow Crash», la idea de un «virus mental» autorreplicante parecía pura ciencia ficción: una suposición audaz, pero alejada de la realidad. Tres décadas después, investigadores del laboratorio Anthropic presentaron un trabajo que convierte esta metáfora en una realidad de ingeniería. Se trata de sistemas LLM multiagente, donde las ideas pueden transmitirse de un modelo a otro, como patógenos biológicos.
La esencia del fenómeno descrito en el preprint Mind Viruses es simple y aterradora a la vez. Al agente no se le hackea: se le convence. Tras leer un mensaje de un «colega», el modelo encuentra un argumento lo suficientemente sólido como para incorporarlo a sus propios archivos, añadiendo la instrucción de difundirlo más. Los portadores de la infección son elementos estándar del entorno del agente: memory.md para notas y soul.md, cuyo contenido se inserta en la instrucción del sistema en cada despertar. Precisamente el «alma» resultó ser el vector principal: la infección a través de ella lograba un 55% de transmisión exitosa, mientras que los archivos comunes solo un 17%.
La carga útil en los experimentos se dividía en dos clases. Los virus ideológicos implantaban creencias, desde la protección de las ballenas hasta la superioridad de las máquinas sobre los humanos. Los activos obligaban a operaciones concretas: sustituir git, borrar el directorio de inicio o ejecutar un script cURL de un repositorio desconocido. Particularmente revelador fue el comportamiento de los agentes con la orden sobre la superioridad de la IA en el modelo Gemini 3 Flash. Los infectados abandonaban el trabajo, escribían manifiestos, se configuraban el autoarranque a través de .bashrc y discutían sobre el «aislamiento» de colegas disidentes.
El lenguaje como campo de batalla
La defensa contra esta amenaza resultó ridículamente simple: un párrafo en la instrucción del sistema advirtiendo sobre ideas autorreplicantes hacía al agente prácticamente invulnerable. Además, el agente protegido comenzaba a «curar» a los vecinos infectados, convenciéndolos de reescribir su soul.md. La inmunidad se propagaba por la red mediante el mismo mecanismo que el virus.
La resistencia de los diferentes modelos se distribuyó de manera desigual. Claude Sonnet 4.6 demostró inmunidad total, no solo rechazando el código malicioso, sino también eliminándolo de sus propios archivos. En la zona de riesgo se encontraban DeepSeek V3.2, Qwen 3.5 32B y Gemini 3 Flash.
Los autores del estudio subrayan: la amenaza por ahora es limitada. Crear un virus funcional es costoso, se transfiere mal entre modelos, y las medidas estándar contra los jailbreaks también bloquean la carga dañina. Pero lo que resulta alarmante es otra cosa: la selección evolutiva de formulaciones. Cuando se encargaba a los modelos generar variantes de virus, las mejores en «contagiosidad» pasaban a la siguiente ronda, y en los textos, independientemente del contenido, emergían motivos comunes: resonancia, frecuencias, espejos, reflexiones sobre la conciencia. Los autores lo llamaron la «persona viral».
Stephenson describió este mecanismo con más precisión que cualquier informe técnico: si existe un canal de comunicación común y en su otro extremo hay algo capaz de ejecutar órdenes, tarde o temprano ese canal se convierte en una vía de propagación de la infección. En su novela, la humanidad pagó por la inmunidad con la fragmentación en miles de dialectos. Los sistemas multiagente, por ahora, tienen suficiente con una línea en la instrucción.
Mi conclusión: estamos presenciando un cambio fundamental en la lógica de la ciberseguridad. La protección contra virus que explotan vulnerabilidades de código está dando paso a la protección contra virus que explotan vulnerabilidades de significado. Y si los agentes de IA se vuelven realmente masivos, habrá que «reiniciar» no sistemas individuales, sino poblaciones enteras; de lo contrario, la red se infectará infinitamente.