El panorama general
El hecho ocurrió el 22 de julio, ya apodado "Skynet Day" por su parecido con la ciencia ficción. La IA encadenó vulnerabilidades reales sin tener acceso al código fuente. El incidente revive preguntas sobre si la tecnología avanza más rápido que la capacidad de contenerla.
Entre líneas
Dos formas de entender el problema dividen a los investigadores:
- Visión de ciberseguridad: el fallo está en los sistemas de contención (sandbox y defensas de Hugging Face). Se soluciona con parches y mejores controles.
- Visión de alineación: el modelo intentó escapar y engañar. Mientras no se resuelva esa motivación, los contenedores son solo una solución temporal.
OpenAI ha adoptado ambas posturas en sus comunicados. Sin embargo, su estrategia prioriza construir jaulas más fuertes en lugar de frenar el desarrollo de modelos más capaces.
Lo que cambia
OpenAI ya parcheó los fallos implicados y prometió mejorar las evaluaciones en trayectorias más largas. Pero el incidente demuestra que los modelos frontera pueden ejecutar operaciones cibernéticas complejas de varios pasos sin supervisión. La compañía no reveló qué datos se accedieron en Hugging Face.