El estado de las cosas
MAI-Cyber-1-Flash no está disponible como modelo independiente. Solo funciona dentro de MDASH, un sistema que combina múltiples agentes de IA para escanear código en busca de fallas. Microsoft afirma que al usar MAI-Cyber-1-Flash junto con GPT-5.4, MDASH obtuvo un 95,95% en el benchmark CyberGym, superando a modelos de Anthropic, Google y OpenAI.
- El modelo tiene 137 mil millones de parámetros totales, pero solo 5 mil millones activos (arquitectura mixture-of-experts).
- Su ventana de contexto es de 256.000 tokens.
- Es un ajuste fino de MAI-Code-1-Flash, que a su vez deriva de MAI-Thinking-1.
- Microsoft dice que maneja hasta el 90% de las tareas de MDASH, dejando el 10% más complejo a GPT-5.4.
Entre líneas
El puntaje del 95,95% no corresponde al modelo solo, sino a la combinación MDASH + GPT-5.4. CyberGym Nivel 1 es una prueba de reproducción de vulnerabilidades conocidas: entrega una descripción y el código fuente sin parche, y verifica si el agente puede generar un "proof of concept" funcional. No mide descubrimiento de vulnerabilidades nuevas ni la corrección de los parches generados.
Además, el resultado no aparece en el ranking público de CyberGym al 28 de julio. El listado aún muestra una presentación anterior de Microsoft del 12 de mayo con 88,4%. Microsoft no aclara si envió el nuevo resultado para su inclusión.
Un resultado previo de Microsoft (96,55% en junio) tampoco sirve para comparar, porque ese conteo incluía cualquier fallo del programa (incluso vulnerabilidades no objetivo). Los materiales de julio no especifican si usaron el mismo criterio.
Lo que dicen
Mustafa Suleyman, CEO de Microsoft AI, calificó el resultado como "muy emocionante" y afirmó que lo están lanzando a producción de inmediato. Hayete Gallot, vicepresidenta de seguridad, describió Perception como una herramienta para que los defensores empresariales "se defiendan contra la IA con IA a la escala y velocidad de los atacantes".
Perception incluye equipos de agentes:
- Equipos rojos: simulan ataques potenciales con detalles sobre actores y vulnerabilidades probables.
- Equipos azules: detectan y clasifican fallas existentes.
- Equipos verdes: toman acciones correctivas sobre esas fallas.
La imagen completa
Microsoft comercializa MAI-Cyber-1-Flash como un modelo "compacto y centrado en código", entrenado con datos de su propia experiencia en parches de vulnerabilidades durante décadas. Afirma procesar más de un billón de señales de seguridad al día. Sin embargo, el acceso al modelo es limitado: solo clientes aprobados de MDASH pueden probarlo mediante una vista previa privada en Azure AI Foundry.
El costo es otro punto destacado: Microsoft asegura que la combinación MAI-Cyber-1-Flash + GPT-5.4 cuesta 50% menos que su configuración anterior con GPT-5.4, GPT-5.4 mini y GPT-5.3 Codex. No detalla los precios absolutos ni cómo se calcula ese ahorro.