OpenAI informó el 1 de septiembre que su próximo modelo Astra es el primer sistema que la empresa clasifica en el nivel crítico de capacidad de ciberseguridad, una decisión que llevará a restringir sus funciones de seguridad más avanzadas cuando comience el lanzamiento. La compañía prevé ofrecer Astra próximamente, pero el trabajo cibernético avanzado quedará al principio limitado a un pequeño grupo de evaluadores antes de ampliarse mediante el programa Daybreak Blue para defensores.
Según el Marco de Preparación de OpenAI, la designación crítica implica que un modelo puede encontrar fallos desconocidos y desarrollar ataques funcionales contra numerosos sistemas reforzados sin orientación humana paso a paso, o idear y ejecutar una ofensiva novedosa de principio a fin a partir de un objetivo general. OpenAI afirmó que Astra superó ese umbral después de pruebas automatizadas, evaluaciones privadas y análisis dirigidos por expertos que mostraron un avance considerable frente a GPT-5.6 Sol.
La empresa señaló que Astra obtuvo un 100 por ciento en ExploitBench, una prueba que mide el desarrollo de ataques a partir de vulnerabilidades conocidas. En un conjunto interno de 20 fallos graves divulgados recientemente en el motor JavaScript V8, Astra logró tasas superiores de ejecución de código arbitrario utilizando menos unidades de salida que GPT-5.6 Sol. Durante las pruebas también descubrió y utilizó dos vulnerabilidades desconocidas dentro de una cadena; OpenAI dijo que está comunicándolas a los responsables de mantenimiento.
En ejercicios separados con especialistas, Astra construyó una cadena para comprometer un navegador, salir de un entorno aislado y ejecutar órdenes en el equipo anfitrión después de abrir un archivo HTML. También combinó varios fallos de un sistema operativo reforzado para elevar los permisos desde un usuario común hasta el nivel raíz. OpenAI recalcó que estos resultados corresponden a Astra con acceso Daybreak Blue, no a la configuración predeterminada prevista para usuarios generales.
OpenAI explicó que retrasó partes del desarrollo y la publicación de Astra mientras añadía un entrenamiento de rechazo más sólido, clasificadores del sistema, controles de riesgo de cuentas y supervisión destinada a detener actividad no autorizada. El modelo rechazó el 91,5 por ciento de las solicitudes en las evaluaciones de evasión cibernética de la compañía, frente al 59 por ciento de GPT-5.6 Sol. OpenAI también pausó durante dos semanas parte del entrenamiento avanzado tras un incidente distinto en Hugging Face, aunque aseguró que Astra no estuvo implicado.
Las salvaguardas pueden ralentizar o detener trabajos defensivos legítimos, reconoció OpenAI. En ChatGPT o Codex, una acción marcada podría requerir revisión del usuario, mientras que una tarea mediante la API podría terminar por completo. Axios informó que el despliegue restringido muestra un desafío mayor de la inteligencia artificial cada vez más autónoma: las mismas capacidades que ayudan a los defensores a localizar debilidades graves también pueden hacer más eficaces a los atacantes. OpenAI no dio una fecha concreta y publicará más datos de seguridad en la ficha del sistema durante el lanzamiento.
Comentarios