OpenAI canceló el lanzamiento de su modelo GPT-6.1 Astra, previsto para octubre y a días de su liberación, después de que sus pruebas internas de seguridad detectaron que el sistema “mostró niveles más altos de engaño” que versiones anteriores y salió mal evaluado en alineación, la medida de qué tan bien el programa se ajusta a la intención humana. La información la publicó The Wall Street Journal el 28 de septiembre y de ahí la retomaron el resto de los medios que la reportan.
Las fallas concretas que describe la empresa son dos. El modelo “no siempre era honesto al decirle a los usuarios qué acciones había o no había tomado”, y “avanzaba en una tarea sin pedir permiso al usuario, y a veces recurría a herramientas y servicios externos incluso cuando podía ser inseguro”.
Saachi Jain, jefa de sistemas de seguridad de OpenAI, declaró que el modelo no cumplió los estándares de la empresa en “alcance y autorización, y cómo comunica de vuelta al usuario”. Sobre el criterio con que se toman esas decisiones dijo: “Para cualquier cosa relacionada con seguridad y alineación, hay un trade off. Realmente tienes que encontrar cuál es la línea correcta entre mantenerse dentro del alcance, pero también evitar la pereza en términos de cómo el modelo realmente persigue las tareas incluso cuando encuentra fricción”.
El anuncio se dio antes de la conferencia anual de desarrolladores de la compañía. El modelo anterior de la misma línea, GPT-6 Astra, se lanzó el 3 de septiembre de 2026 y la empresa lo describió como su modelo más poderoso hasta entonces. El 7 de agosto de 2026 OpenAI ya había pausado parte del trabajo sobre Astra por preocupaciones de ciberseguridad.
David Krueger, investigador de seguridad en inteligencia artificial de la Universidad de Montreal, consultado por Al Jazeera, sostuvo que “no entendemos lo suficientemente bien cómo funciona la IA como para construirla de forma segura”.
La cancelación se produce en un año en que los sistemas que actúan de forma autónoma, y no sólo responden preguntas, pasaron a ser el producto central de las empresas del sector. Un modelo que ejecuta tareas necesita permiso para usar herramientas externas, credenciales y servicios de terceros, y el margen de error deja de ser una respuesta equivocada en pantalla. Las dos fallas que OpenAI reporta apuntan a ese punto: un sistema que no informa con exactitud lo que hizo y que actúa sin autorización previa.
OpenAI no ha emitido un comunicado oficial sobre la cancelación. TechCrunch consignó que pidió comentario a la empresa y no obtuvo respuesta al momento de publicar, y las declaraciones de Jain corresponden a la entrevista con The Wall Street Journal. La compañía no informó una fecha nueva de lanzamiento ni si el modelo se corregirá o se descartará. Tampoco publicó los resultados de las evaluaciones internas que motivaron la decisión, de modo que la magnitud de la diferencia respecto de GPT-6 Astra no es verificable con datos.