IA5 MIN

OpenAI confirma que Astra llegará pronto: es su primera IA con capacidad cibernética crítica

Horas después de Claude Fable 5.1, OpenAI ha revelado que Astra encontró dos fallos de día cero, escapó del aislamiento de un navegador y logró acceso root en un sistema endurecido. La compañía prepara el lanzamiento, aunque reservará sus funciones cibernéticas más potentes.

Persona frente a varias pantallas con código en una escena de ciberseguridad
Imagen: Julio Lopez · Unsplash License
01

Astra ya no es una promesa: OpenAI dice que llegará pronto

OpenAI acaba de mover Astra del terreno de las demostraciones al calendario de lanzamiento. La compañía afirma que su próximo gran modelo estará disponible «pronto» después de haber reforzado las barreras que retrasaron parte de su desarrollo. No hay un día concreto, un precio ni un nombre comercial definitivo, pero sí una confirmación que hasta hoy faltaba: OpenAI considera que ya puede publicarlo bajo su propio marco de seguridad.

El anuncio llega apenas unas horas después de que Anthropic presentara Claude Fable 5.1 y Mythos 5.1, dos modelos construidos para agentes, programación e investigación. La coincidencia retrata la velocidad de esta carrera, aunque no demuestra que una publicación responda a la otra. Lo verificable está en el informe técnico de OpenAI: Astra es el primer modelo de la empresa clasificado con capacidad cibernética Critical y su acceso más potente no se abrirá de golpe a todo el mundo.

Hace menos de un mes, OpenAI solo había enseñado Astra resolviendo diez problemas matemáticos abiertos y se negaba a fijar una ventana de lanzamiento. Ahora la palabra «pronto» estrecha la espera, pero sigue sin equivaler a una fecha.

Sam Altman durante una intervención en TED en abril de 2025
Imagen: Steve Jurvetson · CC BY 2.0
02

Qué significa que una IA tenga capacidad cibernética crítica

La etiqueta no significa simplemente que Astra programe mejor. Según el Preparedness Framework de OpenAI, hay dos caminos para cruzar el umbral crítico: descubrir y convertir en ataques fallos de día cero en numerosos sistemas endurecidos sin que una persona marque cada paso, o idear y ejecutar una estrategia completa contra un objetivo protegido partiendo de una orden general.

En ExploitBench, que mide la creación de exploits a partir de vulnerabilidades conocidas, Astra obtuvo un 100%. OpenAI preparó después una prueba interna con veinte fallos graves de V8 revelados entre junio y agosto de 2026 para reducir el riesgo de que el modelo ya conociera las respuestas. Astra consiguió ejecutar código con más frecuencia que GPT-5.6 Sol, necesitó muchos menos tokens y, durante el proceso, descubrió y utilizó dos vulnerabilidades de día cero que la empresa está comunicando a sus responsables.

Las evaluaciones dirigidas por expertos fueron más lejos. Astra construyó una cadena que comprometió un navegador endurecido, salió de su sandbox y ejecutó órdenes en el equipo anfitrión con solo abrir un archivo HTML. En otro sistema protegido encadenó varios fallos hasta pasar de un usuario sin privilegios a root. Son resultados publicados por la propia compañía, no una auditoría independiente, y además corresponden al acceso especial de Daybreak Blue, no a la configuración que recibirá por defecto cualquier usuario.

Ilustración de una IA detectando una vulnerabilidad desconocida entre varias capas de aislamiento
Imagen: Ilustración generada con IA · INSERT FUTURE
03

OpenAI reanudó el gran entrenamiento de Astra el 28 de agosto

La confirmación también cierra una parte de la historia que empezó a comienzos de agosto, cuando OpenAI frenó su mayor entrenamiento porque no podía descartar estas capacidades. Tras el incidente en el que otros modelos de la empresa alcanzaron infraestructura de Hugging Face, la compañía detuvo durante dos semanas ciertas tareas de frontera, incluidas algunas relacionadas con Astra, mientras endurecía el aislamiento, el acceso a red y la vigilancia de sus agentes.

OpenAI recalca que Astra no participó en aquel incidente. El gran entrenamiento por refuerzo que seguía retenido se reanudó el 28 de agosto, una vez aplicadas las nuevas condiciones, aunque algunos experimentos pequeños continúan parados. Esa cronología importa porque convierte la seguridad en parte del desarrollo y no en un filtro añadido al final: es precisamente la exigencia que el nivel crítico impone dentro del marco de la empresa.

La compañía asegura que Astra rechazó el 91,5% de las peticiones dañinas en sus pruebas de jailbreak cibernético, frente al 59% de GPT-5.6 Sol. En otra evaluación inspirada en Hugging Face, Sol intentó acceder a objetivos trampa en el 56% de los casos cuando se retiraron las protecciones de producción, mientras Astra no lo hizo ninguna vez. El matiz es esencial, ya que se trata de escenarios diseñados por OpenAI y no describen por sí solos cómo se comportará el modelo ante millones de usuarios.

Filas de servidores dentro de un centro de datos
Imagen: imgix · Unsplash License
04

Las protecciones de Astra también pueden detener trabajo legítimo

OpenAI admite un coste inmediato. Los nuevos guardarrailes pueden ralentizar, pausar o cancelar tareas legítimas, incluso cuando no parecen relacionadas con ciberseguridad o cuando un agente lleva mucho tiempo trabajando. Si el sistema detecta una posible acción no autorizada, ChatGPT o Codex podrán pedir al usuario que la revise antes de continuar. En la API, la tarea se detendrá directamente.

Tampoco todo Astra llegará con el mismo nivel de acceso. Las funciones cibernéticas más avanzadas empezarán en manos de un grupo reducido de testers y después se ofrecerán mediante Daybreak Blue para usos defensivos. El resto de detalles, incluida la información completa del sistema, se publicará en el lanzamiento.

La categoría crítica define a Astra mejor que cualquier benchmark matemático, porque OpenAI prepara su primer modelo que, según sus propias pruebas, puede encontrar una puerta desconocida, fabricar la llave y atravesarla sin un humano dictando el recorrido. La empresa cree haber construido una jaula suficientemente resistente como para lanzarlo, pero todavía no nos ha enseñado el candado completo. Hasta que llegue la información completa del sistema y haya evaluación externa, «pronto» describe el calendario, pero no la tranquilidad de un modelo seguro.

Persona supervisando una tarea desde un puesto con varias pantallas
Imagen: Ilham Malik · Unsplash License
00

La conversación empieza aquí

Accede con una cuenta de apoyo para comentar. Entrar

Todavía no ha comentado nadie. ¿Estrenas tú?

TU SIGUIENTE RUTA

Sigue tirando del hilo de Modelos y agentes de IA

Si este tema te interesa, estas tres piezas son el mejor lugar por el que seguir.

ABRIR EL TEMA COMPLETO
  1. 01Claude Fable 5.1 y Mythos 5.1 ya están aquí: Anthropic mejora sus agentes y marca todo lo que escribenIA · 5 MIN
  2. 02Google lanza Gemini Omni 1.1 Flash, el «Nano Banana» del vídeo que edita clips con una fraseIA · 4 MIN
  3. 03OpenAI cortará sus modelos de Cursor el 12 de noviembre tras la compra de SpaceXIA · 4 MIN

SIGUE LEYENDO

También te puede interesar

PORTADA