Crypto news

17.08.2026
10:39

Anthropic reconoció un fallo masivo de bioseguridad: 133 millones de diálogos con IA quedaron sin filtros

ii-startap-Anthropic-AI

Los desarrolladores de Anthropic revelaron un detalle alarmante en su infraestructura de seguridad: durante casi un año, el sistema de protección biológica de Claude estuvo prácticamente inactivo respecto a un segmento significativo del tráfico de usuarios. Se trata de un grupo de aproximadamente 50 000 contratistas externos y un volumen colosal: más de 133 millones de interacciones con los modelos. Esta información está contenida en mi nuevo informe analítico de riesgos, publicado en agosto de 2026.

Fallo sistémico de 11 meses de duración

La esencia del problema es que, desde mayo de 2025 hasta abril de 2026, los clasificadores biológicos de bloqueo no se aplicaron al tráfico de las plataformas de recopilación de retroalimentación. A través de esta infraestructura, los contratistas externos no solo evaluaban las respuestas, sino que también mantenían diálogos abiertos con los modelos. Como se descubrió, todo este tráfico se marcaba con una bandera interna que desactivaba tanto el bloqueo de solicitudes peligrosas como incluso el registro de su activación.

Esto significa que las solicitudes potencialmente peligrosas no solo no se bloqueaban, sino que quedaban completamente fuera de los sistemas de monitoreo posterior. Además, la empresa reconoció la debilidad del control de acceso de los contratistas: hasta abril de 2026, los procedimientos de verificación del personal en muchos proveedores no permitían filtrar de manera confiable a posibles atacantes. Según la evaluación, infiltrarse en el equipo Red Team no habría sido una tarea demasiado difícil.

La auditoría reveló solo 62 diálogos sospechosos

Tras detectar el error, Anthropic restauró casi la totalidad del archivo de conversaciones, excepto aproximadamente el 1% de los datos en una plataforma, donde los mensajes no se guardaban sin presionar el botón de envío. Para analizar todas las solicitudes se utilizó el modelo Claude Sonnet 5, que asignó un alto nivel de riesgo biológico a 1197 transcripciones. De ellas, 757 pertenecían a equipos internos de la propia Anthropic y 378 a red teaming intencional. Por lo tanto, solo 62 diálogos externos no estaban relacionados con pruebas.

La verificación manual de estos casos y de una muestra de 30 diálogos de red team no reveló un uso claramente peligroso que pudiera aumentar significativamente las capacidades de un atacante para crear armas biológicas. A pesar de esto, la empresa reconoció que el incidente socava la confianza en la ausencia de otras brechas desconocidas en la protección.

Revisión de las evaluaciones de riesgo y dependencia de su propio IA

Este caso afectó directamente la posición oficial de Anthropic. El nivel de riesgo según el escenario CB-1 (asistencia sustancial de la IA en la creación de amenazas biológicas conocidas) fue revisado retroactivamente de «muy bajo» a «bajo». El nivel actual de riesgo de daño catastrófico ahora se caracteriza como «bajo, pero no despreciable». De manera similar, se elevó la evaluación del riesgo de desalineación en situaciones de alto riesgo.

El informe también revela un sorprendente grado de dependencia de la empresa respecto a sus propios modelos. Claude escribe la mayor parte del código de producción de Anthropic, y la investigación interna utiliza activamente agentes basados en Mythos 5 y Model 2. Esto crea una paradoja interesante: la empresa que evalúa los riesgos de la IA es, al mismo tiempo, su consumidor corporativo más activo.

Mi comentario: Este caso es una clara ilustración de que incluso los líderes de la industria de seguridad de la IA tienen «puntos ciegos». El hecho de que el error no haya provocado incidentes reales es más suerte que mérito. Los inversores y reguladores deberían tomarlo como una señal: la auditoría de los sistemas de protección debe ser continua, no retrospectiva. La transparencia de Anthropic en este asunto merece respeto, pero también subraya lo frágil que puede ser la bioseguridad en la era de la rápida expansión de la IA.