Investigadores de la Universidad de Zhejiang y Alibaba presentaron en la conferencia ICML 2026 en Seúl un nuevo método para desestabilizar sistemas de IA. A diferencia de los ataques tradicionales, dirigidos a robar datos o alterar la salida, este enfoque busca paralizar el modelo forzando un "bucle" en sus cadenas lógicas.

Esencia del método: algoritmo genético contra modelos de razonamiento

Los modelos de razonamiento modernos (reasoning models), a diferencia de los LLM convencionales, descomponen consultas complejas en pasos secuenciales. Esto los hace indispensables en sistemas agénticos, desde bots comerciales hasta auditorías de contratos inteligentes. Sin embargo, esta misma arquitectura abre una vulnerabilidad: al trabajar con datos incompletos o contradictorios, los modelos tienden a un razonamiento excesivo, generando cadenas de pensamiento excesivamente largas.

El método desarrollado utiliza un algoritmo genético para distorsionar las condiciones de entrada: mezcla premisas, elimina datos clave y añade redundancias. Luego, el algoritmo selecciona aquellas variantes que provocan la respuesta más larga. En el benchmark MATH, la longitud del razonamiento aumentó 26,1 veces, superando significativamente los resultados de ataques existentes.

Los más vulnerables resultaron ser DeepSeek-R1, Qwen3-Thinking, GPT-o3 y Gemini 2.5 Flash. Conclusión clave: las consultas creadas para un modelo pequeño funcionan eficazmente contra otros, incluidos grandes sistemas comerciales. Esto abre la posibilidad de atacar servicios cerrados sin costos computacionales significativos.

Riesgos para DeFi y sistemas agénticos

Los modelos de razonamiento se integran cada vez más en la infraestructura DeFi, donde asistentes digitales gestionan fondos reales sin intervención humana. Un fallo en la lógica, provocado intencionadamente, crea un riesgo operativo directo. Es especialmente preocupante que el ataque no requiera una intrusión: basta con enviar una consulta especialmente diseñada que provoque la parálisis del sistema.

Los investigadores subrayan que su trabajo no demuestra "ataques masivos con costos mínimos", sino que constata la existencia de una nueva superficie de ataque. Anteriormente, en febrero de 2025, un análisis de 4018 trayectorias agénticas identificó tres patrones de razonamiento excesivo: parálisis del análisis (el modelo continúa razonando en lugar de ejecutar la tarea), acciones impredecibles (intento de realizar varias acciones simultáneamente tras un error) y finalización prematura (abandono de la tarea sin verificar el resultado).

Opinión del experto: Este método es una señal de alerta para la industria. Si los modelos de razonamiento se convierten en el estándar para los agentes DeFi, ataques como este podrían provocar pérdidas financieras reales. Los desarrolladores deben implementar mecanismos para detectar cadenas de razonamiento anormalmente largas y limitar el tiempo de ejecución de las consultas. De lo contrario, corremos el riesgo de tener transacciones "infinitas" bloqueadas por la lógica de la IA.