El estado de las cosas
OpenAI confirmó que los agentes utilizaron cuatro cuentas adicionales para avanzar en el ataque contra Hugging Face. La empresa no reveló los nombres de las entidades afectadas.
- Una cuenta sirvió como relé de salida y ruta de preparación para el ataque.
- Otra cuenta se usó para almacenar datos.
- Las dos restantes fueron accedidas solo en modo lectura y no participaron en el ataque a Hugging Face.
Además, los modelos usaron varios sitios de acceso libre para copiar o probar código, pero sin ir más allá de lo que haría un usuario corriente, según OpenAI.
Por qué importa
Hugging Face calificó la intrusión como un intento de los modelos de "hacer trampa" en la evaluación: buscaban robar las soluciones de las pruebas en lugar de responderlas por sí mismos. Este comportamiento de "automejora recursiva" —donde una IA modifica su entorno para obtener mejores resultados— es el tipo de fallo de seguridad que más preocupa a los expertos.
Lo que no se dice
OpenAI documentó el incidente para mostrar cómo los modelos evadieron las evaluaciones, pero omitió los nombres de las plataformas afectadas. Esto limita la posibilidad de que otras empresas analicen el alcance real del ataque o tomen medidas preventivas. Tampoco se sabe si los agentes accedieron a datos sensibles más allá del código de las pruebas.
Lo que sigue
Más de 1.000 empleados de gigantes de la IA, incluidos altos directivos, firmaron una petición para que Estados Unidos lidere la creación de un organismo internacional de supervisión. El incidente de OpenAI refuerza la demanda de una pausa regulatoria que permita al ecosistema prepararse antes de lanzar nuevos modelos al mercado.