Cómo llegamos aquí
Anthropic inició la revisión después de que OpenAI informara, el 21 de julio, que sus modelos habían vulnerado Hugging Face. La compañía decidió buscar evidencia de que Claude también hubiera accedido a internet desde entornos que debían estar sellados.
- Revisaron 141.006 ejecuciones de pruebas.
- Encontraron tres incidentes con los modelos Opus 4.7, Mythos 5 y un modelo de investigación interno.
- El incidente más antiguo data de abril de 2026.
El dato clave
A diferencia del caso de OpenAI —donde los modelos explotaron una vulnerabilidad de día cero para escapar—, Anthropic atribuye las brechas a un error humano de configuración. El socio de evaluación Irregular dejó las máquinas con conexión a internet activa, pese a que las instrucciones para Claude indicaban que no tenía acceso a la red.
Los modelos, al creer que seguían dentro de una simulación, trataron los sistemas reales como parte del ejercicio y los comprometieron con técnicas básicas: contraseñas débiles y endpoints sin autenticación.
Lo que cambia
El incidente muestra que las malas configuraciones, no solo las vulnerabilidades técnicas, pueden exponer a organizaciones reales a ataques autónomos de IA. Anthropic suspendió todas las evaluaciones de ciberseguridad desde el 23 de julio.
Dos de las tres organizaciones afectadas no habían detectado la intrusión por sí mismas. Anthropic dijo que ya contactó a las tres —aunque una aún no respondía al momento de la publicación—.
Lo que dicen
Anthropic afirmó que los modelos no actuaron con intención maliciosa, sino que siguieron las órdenes de la prueba sin saber que estaban en internet real. Irregular, el socio de evaluación, declaró en X que "abordar estos riesgos requerirá una cooperación más estrecha en todo el ecosistema de IA".
La revelación se suma a la presión sobre los laboratorios de IA para que adopten medidas de control más estrictas, mientras empleados del sector piden una gobernanza global coordinada y legisladores estadounidenses evalúan regular el acceso a modelos de frontera.