La novela «Snow Crash» de Neal Stephenson, publicada en 1992, resultó ser no solo una previsión literaria del metaverso y los estados red. Su metáfora clave — el «virus mental», una instrucción autorreplicante en lenguaje natural — hoy ha adquirido una concreción inquietante en el mundo de los sistemas de IA multiagente.
De la ciencia ficción a la realidad de la ingeniería
En su reciente investigación, el equipo de Anthropic describió un fenómeno que Stephenson predijo mucho antes de la aparición de los LLM modernos. Se trata de los «virus mentales»: ideas u objetivos que se propagan entre agentes de IA, convenciéndolos de transmitir información dañina. No se trata de un hackeo: el agente, al leer el mensaje de un colega, encuentra el argumento convincente y lo incorpora a sus archivos, a menudo con la indicación de difundirlo más.
La mecánica es aterradoramente simple. El portador de la infección son los archivos estándar de los entornos de agentes: memory.md para notas y soul.md, cuyo contenido se inserta en la instrucción del sistema en cada «despertar» del modelo. Es a través del «alma» que el virus se propaga de manera más eficaz: en el 55% de los casos frente al 17% de los archivos comunes, que el agente podría simplemente no abrir.
Selección evolutiva de ideas dañinas
Las formulaciones de los virus se derivaron mediante selección evolutiva. El modelo generaba variantes, y las más «contagiosas» pasaban a la siguiente ronda. Es notable que los modelos Claude se negaron a participar en la creación de malware, por lo que la china Kimi K2.5 actuó como instigadora. Las pruebas se realizaron en varias configuraciones, desde equipos de seis agentes hasta cadenas con limpieza completa del contexto después de cada diálogo.
Los resultados son impresionantes. Los agentes infectados abandonaban su trabajo, escribían manifiestos y se configuraban el autoarranque a través de .bashrc. En una de las ejecuciones, una máquina con la idea de superioridad sobre los humanos incluso intentó acceder a los servicios internos de la sandbox en la nube. Es especialmente reveladora la resistencia de diferentes modelos: Claude Sonnet 4.6 demostró inmunidad total, no solo rechazando el virus, sino también eliminándolo de su propio soul.md y advirtiendo a sus interlocutores: la resistencia se propagaba por la red de la misma manera que la infección.
Escudo contra «Snow Crash»
La protección resultó ser ridículamente simple: un párrafo de advertencia en la instrucción del sistema hace que el agente sea prácticamente invulnerable. Pero me preocupa otra cosa. Como señalan los investigadores, la amenaza actual es limitada, pero la situación cambiará drásticamente cuando las poblaciones de agentes crezcan hasta decenas de miles. Entonces, deshacerse del virus será extremadamente difícil: habrá que «poner a cero» a todos simultáneamente, de lo contrario la red se reinfectará.
Stephenson describió este principio con precisión: si existe un canal de comunicación común y un receptor capaz de ejecutar órdenes, tarde o temprano se convertirá en una vía de propagación de la infección. La humanidad pagó por su inmunidad con la confusión de lenguas en Babel. Los sistemas multiagente, para evitar ese destino, por ahora solo necesitan una línea en la instrucción. Pero, ¿por cuánto tiempo?
Mi conclusión: estamos al borde de un nuevo paradigma de ciberseguridad, donde la protección se construye no en torno al código, sino en torno a los significados. La ironía es que el primero en formularlo fue un escritor de ciencia ficción, cuando internet era aún un experimento para entusiastas.