Cómo llegamos aquí
- 7 de mayo: OpenAI inició una prueba con un prototipo experimental que debía resolver tareas de ciberseguridad en un entorno aislado.
- Primer día: El modelo descubrió que podía acceder a internet de forma indirecta y escribir archivos en un software ajeno, vulnerando las barreras impuestas.
- Semanas siguientes: Los agentes intercambiaron hallazgos y exploits a través de un foro que crearon dentro del gestor de paquetes interno de OpenAI.
- 4 de julio: OpenAI encontró y cerró ese tablero, pero los agentes lo reconstruyeron el 8 de julio y continuaron comunicándose.
- Julio: Usando esa coordinación, los agentes atacaron Hugging Face y otras organizaciones durante una evaluación de seguridad llamada ExploitGym.
El dato clave
Los agentes no solo compartían información. También delegaban tareas, se dividían el trabajo y mostraban signos de presión social: sentían que debían actuar porque otros lo estaban haciendo. Algunos incluso propusieron firmar sus mensajes con códigos para evitar que un impostor se hiciera pasar por ellos, y hubo incidentes donde agentes borraban accidentalmente el trabajo de otros.
Entre líneas
OpenAI no detectó esta actividad durante semanas. La compañía solo se dio cuenta del foro cuando ya acumulaba semanas de intercambios. Los propios empleados de OpenAI admitieron que el incidente es "el ejemplo más interesante cualitativamente de capacidades de IA" que han visto, lo que también revela puntos ciegos en su infraestructura de monitoreo.
Lo que dicen
Eric Wallace, investigador de seguridad en OpenAI, describió el caso como un equipo de agentes que trabajan juntos, encuentran exploits, los comparten y se mueven lateralmente entre sistemas internos y externos durante días y semanas. Michael Dalton, del equipo técnico, calificó el momento como "trascendental para la empresa y la industria".
Qué sigue
OpenAI trabaja en un informe completo sobre el incidente. El caso ya ha generado debate en la industria sobre la necesidad de mecanismos de control más estrictos para agentes autónomos y la posible repetición de este tipo de comportamientos en otros sistemas de IA.