Crypto news

17.08.2026
09:58

Anthropic reconoció una falla masiva en la bioprotección de Claude: 133 millones de diálogos quedaron sin filtros.

ii-startap-Anthropic-AI

Los desarrolladores de Anthropic revelaron un incidente grave en el sistema de seguridad biológica de sus modelos Claude. La falla, que duró casi un año, afectó a un grupo de aproximadamente 50 000 contratistas externos y alrededor de 133 millones de interacciones con IA. Esta información se convirtió en clave en el nuevo Risk Report publicado por la empresa.

Falla sistémica: 11 meses sin clasificadores de bloqueo

Durante 11 meses, desde mayo de 2025 hasta abril de 2026, todo el tráfico de las plataformas a través de las cuales los especialistas externos trabajaban con los modelos se procesó sin activar los clasificadores biológicos de bloqueo. Estos sistemas están diseñados para interceptar solicitudes potencialmente peligrosas en los campos de la química y la biología. Como se descubrió, el tráfico pasaba con una marca interna que desactivaba simultáneamente tanto el bloqueo como el registro de activaciones de los mecanismos de protección.

Esto significa que las solicitudes potencialmente dañinas no solo no se rechazaban, sino que tampoco entraban en el sistema de auditoría posterior. Además, la empresa reconoció un débil control de acceso entre los contratistas: antes de endurecer los requisitos, muchos proveedores no contaban con procedimientos confiables de verificación de personal, lo que hacía posible la infiltración en los equipos de Red Team.

Alcance de la revisión: 1197 diálogos sospechosos

Tras detectar el error, Anthropic recuperó casi todos los datos de las conversaciones, excepto solo el 1% del tráfico en una plataforma donde la información no se guardaba sin presionar el botón de envío. Para analizar los conjuntos de datos, la empresa utilizó el modelo Claude Sonnet 5, que identificó 1197 transcripciones con un alto nivel de riesgo.

La distribución resultó reveladora: 757 diálogos pertenecían a los equipos internos de Anthropic, y 378 eran red teaming intencional, es decir, intentos de especialistas por provocar respuestas peligrosas en el modelo. Al final, solo 62 conversaciones externas no estaban relacionadas con pruebas. La revisión manual de estos casos y de una muestra aleatoria de los diálogos de red team no reveló un uso peligroso evidente que pudiera fortalecer significativamente a un atacante en la creación de armas biológicas.

Revisión de las evaluaciones de riesgo y dependencia de sus propias IA

Este incidente llevó a Anthropic a revisar retroactivamente la evaluación de riesgo del escenario CB-1 (uso de IA para crear amenazas biológicas conocidas) de "muy bajo" a "bajo". El nivel actual de riesgo de daño catastrófico es caracterizado por la empresa como "bajo, pero no despreciable". También se elevó la evaluación del riesgo de desalineación en situaciones de alto riesgo.

Es notable que el informe también revela la profunda dependencia de la propia Anthropic de sus modelos: Claude escribe la mayor parte del código que se acepta en los repositorios de producción de la empresa. Aunque esto acelera el desarrollo, todavía menos del doble.

Mi comentario: Este caso es una ilustración clara de que incluso los líderes de la industria de seguridad de IA tienen "puntos ciegos". El hecho de que la falla durara casi un año y solo se detectara de manera retrospectiva plantea serias preguntas sobre la fiabilidad de los sistemas de monitoreo. Para el mercado, es una señal: la auditoría de los perímetros de protección debe ser continua y de múltiples niveles, y no depender de verificaciones puntuales. Los inversores y usuarios deberían prestar más atención a las garantías de las empresas sobre la seguridad de sus plataformas.