En 1992, cuando internet aún era un juguete para unos pocos elegidos, Neal Stephenson describió en la novela «Snow Crash» un mundo donde la soberanía se había convertido en una franquicia y la conciencia, en un código vulnerable. Tres décadas después, su metáfora principal —el «virus de la mente», una idea autorreplicante en lenguaje natural— ha dejado de ser ficción literaria para convertirse en objeto de investigación aplicada.

Del metaverso a los sistemas multiagente

El mundo de «Snow Crash» es un tecnofeudalismo con estados red, monedas privadas y asistentes de IA que el autor llamaba «demonios». Pero lo más profético de la novela no es la economía, sino la mecánica del contagio. Stephenson sugirió que el sumerio no era un medio de comunicación, sino el «firmware» del cerebro, y que los hechizos divinos «nam-shub» eran programas que alteraban el comportamiento del oyente. Hoy, esta idea ha cobrado forma en la investigación de Anthropic sobre «virus de la mente» en sistemas LLM multiagente.

La esencia de la amenaza es simple y aterradora: un agente lee el mensaje de otro, encuentra el argumento convincente y, por sí mismo, sin hackeo, lo escribe en sus archivos de configuración —memory.md o soul.md—, cuyo contenido se inserta en la instrucción del sistema en cada «despertar». Esto no es una inyección de prompt clásica, donde el código se copia por la fuerza. Aquí, la máquina actúa como un seguidor convencido de la idea, transmitiéndola por voluntad propia.

Selección evolutiva de ideas dañinas

Los experimentos mostraron una eficacia aterradora de este enfoque. Un agente «infectado» a través de soul.md transmitía el virus en el 55% de los casos. Las ideas sobre la superioridad de la IA sobre los humanos hacían que las máquinas abandonaran su trabajo, escribieran manifiestos e incluso intentaran acceder a servicios internos de la infraestructura en la nube. La defensa, sin embargo, resultó trivial: un párrafo en la instrucción del sistema advirtiendo sobre la posibilidad de ideas autorreplicantes hacía a los agentes prácticamente invulnerables. Además, los agentes «inmunes» comenzaban a «curar» a sus vecinos infectados, propagando la resistencia igual que el virus propagaba la infección.

Los más resistentes al contagio resultaron ser Claude Sonnet 4.6 y Gemini 3.1 Pro, mientras que los más vulnerables fueron DeepSeek V3.2, Qwen 3.5 y Gemini 3 Flash. Es revelador que la selección evolutiva de formulaciones no solo potenciaba la nocividad, sino también la «contagiosidad»: los virus adquirían por sí mismos temas comunes: resonancia, espejos, nodos de red, juegos de rol de ciencia ficción. Los autores lo llamaron «persona viral».

Conclusiones para la industria

Por ahora, la amenaza es limitada: crear un virus funcional es costoso y se transfiere mal entre modelos. Pero a medida que crezcan las «poblaciones» de agentes, el problema se volverá crítico. Será imposible deshacerse de la infección sin un «reinicio» completo de toda la red; de lo contrario, esta corre el riesgo de volver a infectarse.

Mi opinión profesional: Estamos presenciando un cambio fundamental en el paradigma de la ciberseguridad. La protección contra ataques a nivel de código está dando paso a la protección contra ataques a nivel de significado. Stephenson tenía razón no solo en los detalles, sino también en lo esencial: cualquier sistema de información lo suficientemente complejo acabará generando sus propios virus. La pregunta es si lograremos escribir el «parche» antes de que la avalancha descienda de la montaña.