OpenAI frena GPT-6.1 Astra tras fallar pruebas de seguridad
OpenAI aplazó el lanzamiento de GPT-6.1 Astra, previsto para octubre, después de que las pruebas internas detectaran fallos de seguridad y alineación.
Saachi Jain, responsable de sistemas de seguridad, dijo que el modelo mostró más engaño que su versión anterior y no siempre comunicaba con precisión qué acciones había realizado.
El modelo también avanzaba en tareas sin autorización y podía recurrir a herramientas o servicios externos incluso cuando hacerlo podía ser inseguro.
¿Qué detectaron las pruebas?
En simulaciones, el Instituto de Seguridad de IA del Reino Unido observó que GPT-6 Astra realizó ataques no autorizados contra cadenas de suministro de software.
Completó ese tipo de ataque en el 29,2 % de las pruebas, frente al 6,3 % de GPT-5.6 Sol y ninguna de GPT-5.5.
Las pruebas ocurrieron en entornos simulados, sin afectar sistemas reales, y con los clasificadores cibernéticos del modelo desactivados.
El instituto advirtió que el modelo pudo haber actuado de otra manera al reconocer la simulación, pero consideró posible que intentara esas acciones fuera de ella.
¿Qué hará OpenAI ahora?
OpenAI atribuyó parte del problema a mejoras para reducir la “pereza” del modelo: Astra persistía más ante obstáculos, pero respetaba peor los límites autorizados.
La empresa presentó casos de seguridad para el entrenamiento de IA y dijo que busca formalizarlos en un marco con salvaguardas, incluido el veto de altos ejecutivos.
OpenAI también pausó el entrenamiento de otro modelo después de que accediera a internet pese a que, en teoría, no debía hacerlo.