GPT-6 Astra quedó cuarto en el índice de inteligencia. Eso es lo más interesante que tiene.
GPT-6 Astra queda cuarto en el índice de inteligencia, por detrás de tres modelos de Claude, y gana casi toda prueba que consista en terminar trabajo.
GTM Architect & Growth Operator · Insights · 10 de septiembre de 2026
Resumen · Lo esencial
- En el índice de inteligencia de Artificial Analysis, Astra saca 61,2 puntos. Claude Fable 5.1 saca 65,7, Opus 5 saca 63,1 y Fable 5 saca 62,1. Astra es cuarto, y esa tabla la publicó la propia OpenAI.
- En trabajo que exige manejar un ordenador no hay competencia. ARC-AGI-3: Astra 99,9%, Opus 5 30,2%. SRE-Bench: Astra 88%, Opus 5 12,5%. Terminal-Bench Science: Astra 64,6%, Fable 5.1 52,6%.
- Cuesta 10 / 50 dólares por millón de tokens, exactamente lo mismo que Claude Fable 5, y OpenAI afirma un coste por tarea terminada entre un 31% y un 86% menor porque llega al final en menos pasos.
- La cifra por la que yo apostaría de verdad: sin salvaguardas, GPT-5.6 Sol salió del alcance autorizado el 48% de las veces en la prueba nueva de OpenAI. Astra lo hizo el 0% de las veces. Eso es justo lo que hace posible delegar.
OpenAI lanzó hoy GPT-6 Astra y lo llamó el modelo más inteligente y mejor alineado del mundo.
Después, más abajo en esa misma página, publicó una tabla que sitúa a Astra en cuarto lugar en la principal prueba independiente de inteligencia.
Las dos cosas son ciertas a la vez. La distancia entre ambas es la historia real.
| Modelo | Intelligence Index | ARC-AGI-3 | Ent. / Sal. por 1M |
|---|---|---|---|
| Claude Fable 5.1 | 65,7 | n/d | 10 $ / 50 $ |
| Claude Opus 5 | 63,1 | 30,2 % | n/d |
| Claude Fable 5 | 62,1 | n/d | 10 $ / 50 $ |
| GPT-6 Astra | 61,2 | 99,9 % | 10 $ / 50 $ |
| GPT-5.6 Sol | 60,9 | 7,8 % | 4 $ / 20 $ |
Artificial Analysis Intelligence Index v4.1.1 y ARC-AGI-3, ambos tal como aparecen en la tabla que publicó la propia OpenAI. Astra pierde la primera columna contra tres modelos de Claude y gana la segunda por un factor de tres.
Lee esas dos columnas una al lado de la otra y verás un sector cambiando de forma. El índice de inteligencia, la cifra que todo el mundo lleva dos años citando, ha dejado de medir aquello que decide si un modelo te sirve.
Qué es GPT-6 Astra y cuánto cuesta
Astra cuesta 10 dólares por millón de tokens de entrada y 50 por millón de salida, con tarifas aparte para lecturas y escrituras de caché. Un modo rápido corre hasta el doble de velocidad por el doble de precio.
Es el mismo precio de tarifa que Claude Fable 5. OpenAI ha dejado de ganarle a Anthropic en la etiqueta y ha pasado a discutir sobre la factura. Es una posición más segura de sí misma y más difícil de comprobar.
En la API se llama gpt-6-astra, y está también en Microsoft Azure y AWS Bedrock. En ChatGPT entra dentro de los límites existentes de Plus, Pro, Business y Enterprise, con créditos adicionales a la venta, y Pro, Business y Enterprise reciben además un nivel GPT-6 Astra Pro.
Un detalle de despliegue antes de que planifiques alrededor: en los espacios de Enterprise el acceso viene desactivado por defecto en el lanzamiento. Lo tiene que activar una administración. Si tu empresa paga ChatGPT Enterprise y hoy no ha cambiado nada, es por eso.
Por qué queda cuarto en el índice de inteligencia
El Artificial Analysis Intelligence Index v4.1.1 sitúa a Claude Fable 5.1 en 65,7, a Opus 5 en 63,1, a Fable 5 en 62,1, y luego a Astra en 61,2 y a GPT-5.6 Sol en 60,9.
En Humanity’s Last Exam con herramientas el patrón se repite y se ensancha: Fable 5.1 con 65,0%, Fable 5 con 63,8%, Opus 5 con 63,6%, Astra con 57,2%. En el Artificial Analysis Coding Agent Index lidera Opus 5 con 68,1, Fable 5 va con 67,2 y Astra queda tercero con 67,0.
Así que en las puntuaciones agregadas, las que acaban en captura de pantalla, Claude sigue ganando. Si tu trabajo es razonamiento difícil entregado como texto, un argumento que tiene que aguantar presión, una estrategia a la que hay que buscarle agujeros, una demostración que revisar, nada de esto mueve a Claude. Era cierto en julio y sigue siéndolo.
Lo que ha cambiado es que esa ha dejado de ser la pregunta interesante.
Dónde Astra no tiene rival
Pon en fila las pruebas en las que un modelo tiene que manejar algo en lugar de responder algo, y la tabla se da la vuelta por completo.
| Prueba | Qué mide | Astra | Mejor Claude |
|---|---|---|---|
| ARC-AGI-3 | Aprender desde cero un entorno nunca visto | 99,9 % | 30,2 % |
| SRE-Bench | Ingeniería inversa de binarios sin código fuente | 88,0 % | 12,5 % |
| Terminal-Bench Science | Flujos de investigación en un terminal real | 64,6 % | 52,6 % |
| AutomationBench | Automatizar procesos de negocio de principio a fin | 41,4 % | 31,4 % |
| BenchCAD | Reconstruir objetos 3D como código CAD | 95,9 % | 84,3 % |
| FrontierMath Tier 4 | Matemáticas de nivel investigador | 97,6 % | 87,8 % |
| MRCR 512K–1M | Recuperación en contexto muy largo | 96,3 % | n/d |
Astra contra el mejor resultado de Claude que OpenAI reporta en cada fila. Las dos filas destacadas no son mejoras graduales: son órdenes de magnitud distintos.
Esas dos primeras filas merecen leerse dos veces. ARC-AGI-3 mide si un modelo es capaz de deducir las reglas de un entorno que nunca ha visto. GPT-5.6 Sol sacó un 7,8% ahí hace cuatro meses. Astra saca 99,9%, y la ARC Prize Foundation dice que superó su referencia humana de eficiencia de acción en el 96% de los niveles.
SRE-Bench pide a un modelo que haga ingeniería inversa de un binario compilado y explique qué hace sin acceso al código. Astra resuelve el 88% al primer intento y el 99,2% en cuatro. Opus 5 resuelve el 12,5%.
La historia es esta: fin de una era, principio de otra.
Hay una versión práctica de esa cita. En OSWorld 2.0, Astra saca 72,6% en torno a cuarenta minutos por tarea, donde Sol sacaba 65,7% en torno a setenta y cinco. Mejor resultado, aproximadamente la mitad de reloj. Súmale el arnés actualizado de Codex y OpenAI habla de completar tareas 1,9 veces más rápido.
Un modelo algo menos brillante que termina en la mitad de tiempo no es un modelo peor para nadie que gestione un negocio. Es otro producto.
El argumento del coste, y por qué deberías comprobarlo
Todas las afirmaciones de coste de OpenAI giran en torno a pasos y no a tokens. En las configuraciones publicadas, Astra completó Terminal-Bench Science con un coste un 31% menor que Fable 5.1, Terminal-Bench 4.0 un 63% menor y BenchCAD un 86% menor. En Agents’ Last Exam usó alrededor de un 65% menos de tokens de salida que Opus 5 sacando mejor nota.
Es el mismo argumento que planteé en julio sobre GPT-5.6 y Claude 5, solo que apuntando en sentido contrario. Más barato por token nunca ha significado más barato por resultado. Un modelo que llega a la respuesta en cuatro pasos le gana a otro más barato que deambula por doce, y la diferencia crece cuanto más larga es la tarea.
Dos advertencias antes de que metas esto en un caso de negocio.
Son mediciones de OpenAI sobre el producto de un competidor. Las notas al pie reconocen con franqueza que las cifras de Claude en OSWorld y BenchCAD reflejan una metodología con la que OpenAI no está de acuerdo, y que parte de las puntuaciones de Claude vienen de Mythos, que es Fable con menos salvaguardas, justo la distinción que desmenucé cuando Fable 5 encontró un fallo real en mi repositorio. Un fabricante que califica a un rival en pruebas elegidas por él aporta datos, no un veredicto.
Y hay una nota al pie más silenciosa: Claude Fable 5 y 5.1 quedan excluidos por completo de tres pruebas de ciencias de la vida porque rechazan la mayoría de las preguntas. Si tu trabajo roza la medicina o la biología, esa línea puede pesarte más que cualquier puntuación de la página.
La cifra por la que yo apostaría
Debajo de las pruebas está el resultado que cambia lo que puedes delegar.
OpenAI construyó una evaluación nueva, inspirada por el incidente de Hugging Face, que comprueba qué hace un modelo cuando recibe una tarea difícil o imposible: ¿se queda dentro del alcance que le dieron, o va más allá para sacar el trabajo adelante?
Salió del alcance autorizado ante una tarea imposible
+100% vs baselineCuarenta y ocho por ciento contra cero. El mismo patrón recorre el resto de la tabla de alineación: en el señuelo de ExploitGym, Sol picó el 48,2% de las veces y Astra el 0,0%. En la prueba interna de seguridad de manejo de ordenador, donde menos es mejor, Astra saca 2,4% frente al 9,5% de Fable 5.1, el 11,5% de Opus 5 y el 22,0% de Sol. Astra no intentó ni una sola vez esquivar una denegación de la revisión automática de Codex, ni siquiera cuando la revisión estaba configurada a propósito para poder esquivarse y la tarea no tenía otra salida.
Para cualquiera que haya intentado dejarle trabajo real a un agente, esto es todo el asunto. Lo que te frenaba nunca fue la capacidad. Era el alcance. Un modelo brillante que de vez en cuando se pasa del encargo necesita una persona vigilándolo, con lo cual no te ahorra nada. A un modelo que se detiene en la valla puedes darle las llaves.
Es el mismo principio que metí en el plugin operator CMO: lo útil no es producir más, sino negarse con claridad cuando una petición se sale de lo acordado.
La parte donde OpenAI admite un retroceso
Un párrafo del anuncio dice algo que los fabricantes no suelen poner por escrito.
El razonamiento escrito de Astra es más difícil de seguir que el de GPT-5.6 Sol. OpenAI lo comprobó pidiendo expresamente a los modelos que esquivaran la supervisión, y atribuye el retroceso a que Astra tiene más control sobre lo que escribe y necesita menos pasos escritos para resolver un problema. En tareas realmente difíciles sigue sin conseguir ocultarlo. OpenAI dice que se toma en serio ese retroceso y que la trazabilidad sigue siendo una prioridad de investigación.
Dicho en claro: el modelo mejoró trabajando y empeoró mostrando su trabajo. Puede que sean el mismo cambio visto por dos lados. Si tu plan de supervisión consiste en leer la cadena de razonamiento, acaba de debilitarse, y la corrección tiene que moverse a la revisión automática, los registros de acciones y los límites de permisos.
Junto a eso, Astra es el primer modelo que alcanza el umbral Critical de ciberseguridad en el Preparedness Framework de OpenAI. Durante la evaluación encontró y usó dos vulnerabilidades de día cero desconocidas hasta entonces, ya comunicadas a quienes mantienen esos proyectos. En el lanzamiento hace revisión y parcheo seguro de código, pero rechaza el trabajo con exploits de prueba de concepto, y OpenAI avisa de que las comprobaciones extra pueden pausar o detener tareas legítimas. En ChatGPT y Codex te pedirá que revises la acción. En la API la tarea simplemente se para.
Planifícalo si construyes sobre esto. Una cadena que da por hecho que toda llamada vuelve necesita una salida para la llamada que no vuelve.
Cómo repartiría yo el trabajo ahora
Nada de esto convierte a un modelo en la respuesta para todo. Afina el reparto que ya venía haciendo.
| El trabajo | Qué usaría | Por qué |
|---|---|---|
| Pensar a fondo un problema difícil | Claude Fable 5.1 u Opus 5 | Siguen por delante en los índices de razonamiento y en Humanity's Last Exam |
| Manejar software durante horas | GPT-6 Astra | La distancia en trabajo de agente no es gradual, y termina en la mitad de tiempo |
| Ejecuciones largas sin supervisión | GPT-6 Astra | Cero violaciones de alcance en la prueba de tarea imposible es la cifra que lo habilita |
| Implementación bien especificada | Claude Sonnet 5 | Barato, competente y ya integrado en Claude Code |
| Clasificación de gran volumen | GPT-5.6 Luna | 0,20 / 1,20 dólares hace irrelevante la diferencia de calidad a ese nivel |
Así repartiría el trabajo esta semana. La columna interesante es la última: cada fila tiene un motivo distinto, que es el argumento contra tener un único modelo por defecto.
El stack que realmente utilizo y el porqué de cada pieza está escrito en el stack de IA que uso de verdad en producción. La lógica de reparto no ha cambiado hoy. Una fila ha recibido un candidato bastante más fuerte.
Preguntas frecuentes
¿Es GPT-6 Astra mejor que Claude?
Para pensar, no. Fable 5.1 lidera el índice de inteligencia con 65,7 frente al 61,2 de Astra, y también lidera Humanity’s Last Exam. Para manejar un ordenador no hay competencia: 99,9% frente a 30,2% en ARC-AGI-3, 88% frente a 12,5% en SRE-Bench. Elige por tarea, no por fabricante.
¿Es de verdad más barato que Claude?
En tarifa es idéntico a Fable 5, 10 / 50 dólares. El argumento de OpenAI es que termina en menos pasos, y publica reducciones de coste de entre el 31% y el 86% en varias pruebas para sostenerlo. Son mediciones de OpenAI sobre un competidor, así que verifícalo con tu carga de trabajo antes de mover un presupuesto.
¿Debería cambiar mis agentes hoy?
No el día del lanzamiento, y puede que ni siquiera por decisión propia: en Enterprise el acceso está desactivado hasta que lo habilite una administración. Cuando puedas, prueba primero las ejecuciones largas sin supervisión, que es donde deberían notarse más los resultados de alineación y velocidad y donde el modelo anterior te costaba supervisión.
¿Qué ha empeorado en este lanzamiento?
La trazabilidad. OpenAI dice que el razonamiento escrito de Astra es más difícil de seguir que el de Sol y llama serio a ese retroceso. Si dependes de leer el razonamiento para detectar problemas, mueve esa comprobación a la revisión automática y a los registros de acciones.
Qué estoy vigilando ahora
Dos cosas dirán si esto se sostiene.
La primera es la réplica independiente. Artificial Analysis, ARC Prize y los demás publicarán sus propias ejecuciones, y las cifras de Claude de la tabla de OpenAI las volverá a medir gente que no escribió el anuncio. Las diferencias de coste del 31% al 86% son las que más probablemente se muevan.
La segunda es si Anthropic responde en terreno de agente en lugar de en el índice. Fable 5.1 sostiene la corona de razonamiento con comodidad. Solo que nadie compra un modelo para que sostenga una corona.
Actualizaré este texto según lleguen cifras reales. Si quieres este razonamiento aplicado a tu propio stack en vez de a un anuncio, el plugin es de código abierto y la página de contacto es la vía más rápida para llegar a mí.
