En la conferencia ICML 2026 en Seúl, un grupo de investigadores de la Universidad de Zhejiang y Alibaba presentó un tipo de ataque fundamentalmente nuevo contra sistemas de inteligencia artificial. A diferencia de los métodos tradicionales, dirigidos a robar datos o vulnerar el modelo, este ataque busca hacer que la IA sea inútil, obligándola a procesar solicitudes de forma indefinida.
Mecanismo del ataque: cómo hacer que la IA «se sobrecaliente»
Los modelos de razonamiento (reasoning models), a diferencia de los LLM comunes, dividen tareas complejas en pasos secuenciales, lo que los hace ideales para análisis de múltiples etapas. Sin embargo, al trabajar con datos incompletos o contradictorios, estos modelos tienden a la «reflexión excesiva», generando cadenas de razonamiento extremadamente largas.
Los investigadores desarrollaron un método que utiliza un algoritmo genético para provocar intencionadamente este comportamiento. El algoritmo mezcla las condiciones de las tareas, elimina premisas clave y añade datos superfluos, seleccionando variantes que generan la respuesta más larga posible. En el benchmark MATH, la longitud del razonamiento aumentó 26,1 veces, superando significativamente los métodos existentes de este tipo de impacto.
Modelos como DeepSeek-R1, Qwen3-Thinking, GPT-o3 y Gemini 2.5 Flash resultaron vulnerables. Es notable que las solicitudes creadas para un modelo pequeño resultaron efectivas contra otros sistemas, incluidos grandes proyectos comerciales. Esto abre la posibilidad de ataques a servicios cerrados con costos mínimos.
«Nuestro objetivo no es demostrar que los ataques a gran escala son posibles con costos mínimos, sino documentar que esta superficie de ataque existe», señaló uno de los investigadores, Wei Cao.
Por qué esto es crítico para la criptoindustria
Los modelos de razonamiento se integran cada vez más en sistemas de agentes de IA, incluidos bots de trading, herramientas de auditoría de contratos inteligentes e infraestructura descentralizada. En DeFi, los asistentes digitales basados en IA gestionan fondos reales sin intervención humana. Un fallo en la lógica, provocado intencionadamente, crea un riesgo operativo directo.
Este trabajo se basa en una característica ya conocida de los modelos de razonamiento: su tendencia a la reflexión excesiva. En febrero de 2025, un grupo de investigadores analizó 4018 trayectorias de agentes e identificó patrones recurrentes:
- Parálisis del análisis — el modelo continúa razonando en lugar de ejecutar la tarea.
- Acciones impredecibles — tras un error, intenta realizar varias acciones simultáneamente.
- Finalización prematura — detiene la ejecución de la tarea sin verificar el resultado.
Los modelos de razonamiento resultaron más propensos a la reflexión excesiva, y cuanto más pronunciado es este efecto, menor es el rendimiento.
Mi experiencia: Esto no es solo un hallazgo académico. Para los protocolos DeFi, donde cada segundo de retraso puede costar millones, estos ataques son una amenaza directa. La vulnerabilidad de los modelos de razonamiento a trampas lógicas pone en duda su uso en trading de alta frecuencia y gestión automatizada de activos. Inversores y desarrolladores deberían reconsiderar la arquitectura de los sistemas de agentes, implementando mecanismos de tiempo de espera forzado y verificación de datos.