En la conferencia ICML 2026 en Seúl, investigadores de la Universidad de Zhejiang y Alibaba presentaron una clase fundamentalmente nueva de ataques contra modelos de IA razonadores. A diferencia de los vectores tradicionales, dirigidos al robo de datos o la toma de control, este método vuelve inútil a la red neuronal, obligándola a gastar enormes recursos computacionales en el procesamiento de consultas.

Mecanismo del ataque: cómo hacer que el modelo «piense demasiado»

Los modelos razonadores (reasoning models) se diferencian de los LLM comunes en que dividen cada tarea en pasos lógicos secuenciales. Esto los hace indispensables para el análisis complejo de múltiples etapas, pero también abre una vulnerabilidad: al trabajar con datos incompletos o contradictorios, estos modelos tienden a la «reflexión excesiva»: la generación de cadenas de razonamiento excesivamente largas.

El método desarrollado utiliza un algoritmo genético para provocar intencionadamente este comportamiento. Los investigadores mezclan las condiciones de las tareas, eliminan premisas clave y añaden otras superfluas, y luego seleccionan las variantes que provocan la respuesta más larga. Los resultados son impresionantes: en el benchmark MATH, la longitud de las cadenas de razonamiento aumentó 26,1 veces.

Los modelos clave del mercado se vieron afectados: DeepSeek-R1, Qwen3-Thinking, GPT-o3 y Gemini 2.5 Flash. Es notable que las consultas creadas para un modelo pequeño resultaron efectivas contra sistemas comerciales más grandes. Esto significa que los ataques pueden prepararse en equipos baratos y luego aplicarse contra servicios cerrados.

Uno de los autores del estudio, Wei Cao, destacó: «Nuestro objetivo no es demostrar que los ataques a gran escala son posibles con un costo mínimo, sino constatar que esta superficie de ataque existe».

Por qué esto es crítico para la industria cripto

Los modelos razonadores se están integrando cada vez más en los sistemas de IA agentiva de DeFi: bots de trading, herramientas de auditoría de contratos inteligentes e infraestructura descentralizada. Los asistentes digitales basados en IA ya gestionan fondos reales sin intervención humana. Una falla inducida intencionadamente en la lógica es un riesgo operativo directo.

Anteriormente, en febrero de 2025, un grupo de investigadores analizó 4018 trayectorias de agentes e identificó tres patrones de reflexión excesiva:

  • parálisis del análisis — el modelo continúa razonando en lugar de ejecutar la tarea;
  • acciones impredecibles — tras un error, intenta realizar varias acciones simultáneamente;
  • finalización prematura — detiene la ejecución de la tarea sin verificar el resultado.

Cuanto más pronunciado es el efecto, menor es el rendimiento. El nuevo método hace que estos patrones sean controlables.

Mi evaluación experta: El mercado de DeFi y los sistemas de IA agentiva está al borde de un desafío serio. Mientras los desarrolladores se centran en la funcionalidad y la velocidad, la seguridad de la arquitectura de razonamiento sigue siendo un «punto ciego». Ataques como este podrían convertirse en un nuevo vector DoS para la infraestructura cripto, donde el tiempo de procesamiento de una consulta se convierte directamente en pérdidas financieras. Inversores y desarrolladores deberían priorizar la auditoría de las cadenas lógicas de los agentes de IA.