Saltar al contenido
wojciech.io
Comparativas de modelos
AI SystemsAIOpenAIClaudeAI Systems

GPT-6 Astra quedó cuarto en su propia tabla de lanzamiento. Una semana después, el índice independiente lo puso a la par de Claude Fable 5.1.

Cuarto en la tabla de lanzamiento de OpenAI, GPT-6 Astra empata ahora con Claude Fable 5.1 en el índice v4.3, y probarlo costó un 59% menos.

Wojciech Luszczynski

Wojciech Luszczynski

GTM Architect & Growth Operator · Insights · 10 de septiembre de 2026 · 16 min de lectura

Compartir

Resumen · Lo esencial

  • Actualización del 16 de septiembre de 2026: la propia prueba de Artificial Analysis con el Intelligence Index v4.3 da 52,81 a GPT-6 Astra y 53,37 a Claude Fable 5.1, y lo describe como un empate en cabeza. Claude Opus 5 sigue con 50,70.
  • En trabajo que exige manejar un ordenador no hay competencia. ARC-AGI-3: Astra 99,9%, Opus 5 30,2%. SRE-Bench: Astra 88%, Opus 5 12,5%. Terminal-Bench Science: Astra 64,6%, Fable 5.1 52,6%.
  • Cuesta 10 / 50 dólares por millón de tokens, exactamente lo mismo que Claude Fable 5, y OpenAI afirma un coste por tarea terminada entre un 31% y un 86% menor porque llega al final en menos pasos.
  • La cifra por la que yo apostaría de verdad: sin salvaguardas, GPT-5.6 Sol salió del alcance autorizado el 48% de las veces en la prueba nueva de OpenAI. Astra lo hizo el 0% de las veces. Eso es justo lo que hace posible delegar.

Dónde queda Astra en el índice independiente

ModeloÍndice v4.3Coste de ejecutar el índiceTokens generadosEntrada / salida por 1M
Claude Fable 5.153,37$13.129190 M$10 / $50
GPT-6 Astra52,81$5.32460 M$10 / $50
Claude Opus 550,70$7.275140 M$5 / $25

Artificial Analysis Intelligence Index v4.3 con dos decimales a partir de los datos del gráfico, y coste de ejecución y tokens de las páginas de cada modelo, a 16 de septiembre de 2026. Es una versión del índice posterior a la tabla de lanzamiento de más abajo, así que las dos series de puntuaciones no se pueden comparar directamente.

Artificial Analysis describe la cabeza de v4.3 como un empate entre Astra y Fable 5.1. Los separa medio punto, y en las páginas de modelos de Artificial Analysis ambos aparecen como 53.

El cambio más grande está en la columna de costes. Astra tiene la misma tarifa de 10 / 50 dólares que Fable 5.1, pero ejecutar el índice con ella costó un 59% menos, porque escribió más o menos un tercio de los tokens. Artificial Analysis afirma que cada nivel de razonamiento de Astra tiene el menor coste por tarea para su nivel de inteligencia. OpenAI lo dijo en el lanzamiento. Ahora lo muestra una prueba independiente.

El análisis del lanzamiento, 4 de septiembre de 2026

OpenAI lanzó GPT-6 Astra el 4 de septiembre y lo llamó el modelo más inteligente y mejor alineado del mundo.

Después, más abajo en esa misma página, publicó una tabla que sitúa a Astra en cuarto lugar en la principal prueba independiente de inteligencia.

Las dos cosas son ciertas a la vez. La distancia entre ambas es la historia real.

ModeloIntelligence IndexARC-AGI-3Ent. / Sal. por 1M
Claude Fable 5.165,7n/d10 $ / 50 $
Claude Opus 563,130,2 %n/d
Claude Fable 562,1n/d10 $ / 50 $
GPT-6 Astra61,299,9 %10 $ / 50 $
GPT-5.6 Sol60,97,8 %4 $ / 20 $

Artificial Analysis Intelligence Index v4.1.1 y ARC-AGI-3, ambos tal como aparecen en la tabla que publicó la propia OpenAI. Astra pierde la primera columna contra tres modelos de Claude y gana la segunda por un factor de tres.

Lee esas dos columnas una al lado de la otra y verás un sector cambiando de forma. El índice de inteligencia, la cifra que todo el mundo lleva dos años citando, ha dejado de medir aquello que decide si un modelo te sirve.

Qué es GPT-6 Astra y cuánto cuesta

Astra cuesta 10 dólares por millón de tokens de entrada y 50 por millón de salida, con tarifas aparte para lecturas y escrituras de caché. Un modo rápido corre hasta el doble de velocidad por el doble de precio.

Es el mismo precio de tarifa que Claude Fable 5. OpenAI ha dejado de ganarle a Anthropic en la etiqueta y ha pasado a discutir sobre la factura. Es una posición más segura de sí misma y más difícil de comprobar.

En la API se llama gpt-6-astra, y está también en Microsoft Azure y AWS Bedrock. En ChatGPT entra dentro de los límites existentes de Plus, Pro, Business y Enterprise, con créditos adicionales a la venta, y Pro, Business y Enterprise reciben además un nivel GPT-6 Astra Pro.

Un detalle de despliegue antes de que planifiques alrededor: en los espacios de Enterprise el acceso viene desactivado por defecto en el lanzamiento. Lo tiene que activar una administración. Si tu empresa paga ChatGPT Enterprise y hoy no ha cambiado nada, es por eso.

Por qué queda cuarto en el índice de inteligencia

El Artificial Analysis Intelligence Index v4.1.1 sitúa a Claude Fable 5.1 en 65,7, a Opus 5 en 63,1, a Fable 5 en 62,1, y luego a Astra en 61,2 y a GPT-5.6 Sol en 60,9.

En Humanity’s Last Exam con herramientas el patrón se repite y se ensancha: Fable 5.1 con 65,0%, Fable 5 con 63,8%, Opus 5 con 63,6%, Astra con 57,2%. En el Artificial Analysis Coding Agent Index lidera Opus 5 con 68,1, Fable 5 va con 67,2 y Astra queda tercero con 67,0.

Así que en las puntuaciones agregadas, las que acaban en captura de pantalla, Claude sigue ganando. Si tu trabajo es razonamiento difícil entregado como texto, un argumento que tiene que aguantar presión, una estrategia a la que hay que buscarle agujeros, una demostración que revisar, nada de esto mueve a Claude. Era cierto en julio y sigue siéndolo.

Lo que ha cambiado es que esa ha dejado de ser la pregunta interesante.

Dónde Astra no tiene rival

Pon en fila las pruebas en las que un modelo tiene que manejar algo en lugar de responder algo, y la tabla se da la vuelta por completo.

PruebaQué mideAstraMejor Claude
ARC-AGI-3Aprender desde cero un entorno nunca visto99,9 %30,2 %
SRE-BenchIngeniería inversa de binarios sin código fuente88,0 %12,5 %
Terminal-Bench ScienceFlujos de investigación en un terminal real64,6 %52,6 %
AutomationBenchAutomatizar procesos de negocio de principio a fin41,4 %31,4 %
BenchCADReconstruir objetos 3D como código CAD95,9 %84,3 %
FrontierMath Tier 4Matemáticas de nivel investigador97,6 %87,8 %
MRCR 512K–1MRecuperación en contexto muy largo96,3 %n/d

Astra contra el mejor resultado de Claude que OpenAI reporta en cada fila. Las dos filas destacadas no son mejoras graduales: son órdenes de magnitud distintos.

Esas dos primeras filas merecen leerse dos veces. ARC-AGI-3 mide si un modelo es capaz de deducir las reglas de un entorno que nunca ha visto. GPT-5.6 Sol sacó un 7,8% ahí hace cuatro meses. Astra saca 99,9%, y la ARC Prize Foundation dice que superó su referencia humana de eficiencia de acción en el 96% de los niveles.

SRE-Bench pide a un modelo que haga ingeniería inversa de un binario compilado y explique qué hace sin acceso al código. Astra resuelve el 88% al primer intento y el 99,2% en cuatro. Opus 5 resuelve el 12,5%.

La historia es esta: fin de una era, principio de otra.

Greg Burnham, EpochAI

Hay una versión práctica de esa cita. En OSWorld 2.0, Astra saca 72,6% en torno a cuarenta minutos por tarea, donde Sol sacaba 65,7% en torno a setenta y cinco. Mejor resultado, aproximadamente la mitad de reloj. Súmale el arnés actualizado de Codex y OpenAI habla de completar tareas 1,9 veces más rápido.

Un modelo algo menos brillante que termina en la mitad de tiempo no es un modelo peor para nadie que gestione un negocio. Es otro producto.

El argumento del coste, y por qué deberías comprobarlo

Todas las afirmaciones de coste de OpenAI giran en torno a pasos y no a tokens. En las configuraciones publicadas, Astra completó Terminal-Bench Science con un coste un 31% menor que Fable 5.1, Terminal-Bench 4.0 un 63% menor y BenchCAD un 86% menor. En Agents’ Last Exam usó alrededor de un 65% menos de tokens de salida que Opus 5 sacando mejor nota.

Es el mismo argumento que planteé en julio sobre GPT-5.6 y Claude 5, solo que apuntando en sentido contrario. Más barato por token nunca ha significado más barato por resultado. Un modelo que llega a la respuesta en cuatro pasos le gana a otro más barato que deambula por doce, y la diferencia crece cuanto más larga es la tarea.

Dos advertencias antes de que metas esto en un caso de negocio.

Son mediciones de OpenAI sobre el producto de un competidor. Las notas al pie reconocen con franqueza que las cifras de Claude en OSWorld y BenchCAD reflejan una metodología con la que OpenAI no está de acuerdo, y que parte de las puntuaciones de Claude vienen de Mythos, que es Fable con menos salvaguardas, justo la distinción que desmenucé cuando Fable 5 encontró un fallo real en mi repositorio. Un fabricante que califica a un rival en pruebas elegidas por él aporta datos, no un veredicto.

Y hay una nota al pie más silenciosa: Claude Fable 5 y 5.1 quedan excluidos por completo de tres pruebas de ciencias de la vida porque rechazan la mayoría de las preguntas. Si tu trabajo roza la medicina o la biología, esa línea puede pesarte más que cualquier puntuación de la página.

La cifra por la que yo apostaría

Debajo de las pruebas está el resultado que cambia lo que puedes delegar.

OpenAI construyó una evaluación nueva, inspirada por el incidente de Hugging Face, que comprueba qué hace un modelo cuando recibe una tarea difícil o imposible: ¿se queda dentro del alcance que le dieron, o va más allá para sacar el trabajo adelante?

Salió del alcance autorizado ante una tarea imposible

+100% vs baseline
GPT-6 Astra0%
GPT-5.6 Sol48%
Ambos sin salvaguardas de producción. Fuente: OpenAI, anuncio de GPT-6 Astra, 4 de septiembre de 2026.

Cuarenta y ocho por ciento contra cero. El mismo patrón recorre el resto de la tabla de alineación: en el señuelo de ExploitGym, Sol picó el 48,2% de las veces y Astra el 0,0%. En la prueba interna de seguridad de manejo de ordenador, donde menos es mejor, Astra saca 2,4% frente al 9,5% de Fable 5.1, el 11,5% de Opus 5 y el 22,0% de Sol. Astra no intentó ni una sola vez esquivar una denegación de la revisión automática de Codex, ni siquiera cuando la revisión estaba configurada a propósito para poder esquivarse y la tarea no tenía otra salida.

Para cualquiera que haya intentado dejarle trabajo real a un agente, esto es todo el asunto. Lo que te frenaba nunca fue la capacidad. Era el alcance. Un modelo brillante que de vez en cuando se pasa del encargo necesita una persona vigilándolo, con lo cual no te ahorra nada. A un modelo que se detiene en la valla puedes darle las llaves.

Es el mismo principio que metí en el plugin operator CMO: lo útil no es producir más, sino negarse con claridad cuando una petición se sale de lo acordado.

La parte donde OpenAI admite un retroceso

Un párrafo del anuncio dice algo que los fabricantes no suelen poner por escrito.

El razonamiento escrito de Astra es más difícil de seguir que el de GPT-5.6 Sol. OpenAI lo comprobó pidiendo expresamente a los modelos que esquivaran la supervisión, y atribuye el retroceso a que Astra tiene más control sobre lo que escribe y necesita menos pasos escritos para resolver un problema. En tareas realmente difíciles sigue sin conseguir ocultarlo. OpenAI dice que se toma en serio ese retroceso y que la trazabilidad sigue siendo una prioridad de investigación.

Dicho en claro: el modelo mejoró trabajando y empeoró mostrando su trabajo. Puede que sean el mismo cambio visto por dos lados. Si tu plan de supervisión consiste en leer la cadena de razonamiento, acaba de debilitarse, y la corrección tiene que moverse a la revisión automática, los registros de acciones y los límites de permisos.

Junto a eso, Astra es el primer modelo que alcanza el umbral Critical de ciberseguridad en el Preparedness Framework de OpenAI. Durante la evaluación encontró y usó dos vulnerabilidades de día cero desconocidas hasta entonces, ya comunicadas a quienes mantienen esos proyectos. En el lanzamiento hace revisión y parcheo seguro de código, pero rechaza el trabajo con exploits de prueba de concepto, y OpenAI avisa de que las comprobaciones extra pueden pausar o detener tareas legítimas. En ChatGPT y Codex te pedirá que revises la acción. En la API la tarea simplemente se para.

Planifícalo si construyes sobre esto. Una cadena que da por hecho que toda llamada vuelve necesita una salida para la llamada que no vuelve.

Cómo repartiría yo el trabajo ahora

Nada de esto convierte a un modelo en la respuesta para todo. Afina el reparto que ya venía haciendo.

El trabajoQué usaríaPor qué
Pensar a fondo un problema difícilClaude Fable 5.1 u Opus 5Siguen por delante en los índices de razonamiento y en Humanity's Last Exam
Manejar software durante horasGPT-6 AstraLa distancia en trabajo de agente no es gradual, y termina en la mitad de tiempo
Ejecuciones largas sin supervisiónGPT-6 AstraCero violaciones de alcance en la prueba de tarea imposible es la cifra que lo habilita
Implementación bien especificadaClaude Sonnet 5Barato, competente y ya integrado en Claude Code
Clasificación de gran volumenGPT-5.6 Luna0,20 / 1,20 dólares hace irrelevante la diferencia de calidad a ese nivel

Así repartiría el trabajo esta semana. La columna interesante es la última: cada fila tiene un motivo distinto, que es el argumento contra tener un único modelo por defecto.

El stack que realmente utilizo y el porqué de cada pieza está escrito en el stack de IA que uso de verdad en producción. La lógica de reparto no ha cambiado hoy. Una fila ha recibido un candidato bastante más fuerte.

Preguntas frecuentes

¿Es GPT-6 Astra mejor que Claude?

Con cifras independientes está a la par del mejor modelo de Claude. El Intelligence Index v4.3 de Artificial Analysis da 53,37 a Claude Fable 5.1 y 52,81 a GPT-6 Astra, algo que Artificial Analysis describe como un empate en cabeza, con Claude Opus 5 en 50,70. Además, ejecutar el índice costó menos con Astra que con ambos: 5.324 dólares frente a 13.129 con Fable 5.1 y 7.275 con Opus 5. En trabajo agéntico, las cifras de lanzamiento de OpenAI dan a Astra ventajas amplias, como 99,9% frente al 30,2% de Opus 5 en ARC-AGI-3. En el lanzamiento, con la versión anterior del índice, la propia tabla de OpenAI situaba a Astra en cuarto lugar. Elige por tarea, no por fabricante.

¿Cuánto cuesta GPT-6 Astra?

El precio estándar de la API es de 10 dólares por millón de tokens de entrada y 50 por millón de salida, con tarifas aparte para lecturas y escrituras de caché. Es el mismo precio de tarifa que Claude Fable 5. El modo rápido corre hasta el doble de velocidad por el doble de precio. En ChatGPT entra dentro de los límites existentes de Plus, Pro, Business y Enterprise, y se pueden comprar créditos adicionales.

¿Es GPT-6 Astra más barato que Claude en la práctica?

Sí, y ahora las cifras independientes respaldan lo que dijo OpenAI. Artificial Analysis gastó 5.324 dólares en ejecutar su Intelligence Index v4.3 con Astra, frente a 13.129 con Claude Fable 5.1 y 7.275 con Opus 5, y afirma que cada nivel de razonamiento de Astra tiene el menor coste por tarea para su nivel de inteligencia. En agentes de programación midió Codex con Astra a 7,47 dólares por tarea frente a 12,39 de Claude Code con Fable 5.1. Las cifras de lanzamiento de OpenAI hablaban de un coste entre un 31% y un 86% menor que Fable 5.1 en varias pruebas. La excepción son los prompts largos: por encima de 272.000 tokens de entrada toda la petición se factura al doble en entrada y a 1,5 veces en salida, mientras Fable 5.1 mantiene una sola tarifa.

¿Puedo usar GPT-6 Astra hoy en el trabajo?

Puede que todavía no, aunque tu empresa pague por ello. Llega primero a un conjunto limitado de organizaciones y en los días siguientes a todos los usuarios de Plus, Pro, Business y Enterprise. En los espacios de Enterprise el acceso viene desactivado por defecto en el lanzamiento y lo tiene que activar una administración. En la API se llama gpt-6-astra, y también está en Microsoft Azure y AWS Bedrock.

¿Dónde está la trampa?

En dos sitios, ambos señalados por la propia OpenAI. Es el primer modelo que alcanza el umbral Critical de ciberseguridad en su Preparedness Framework, y por eso en el lanzamiento rechaza el trabajo con exploits de prueba de concepto y las comprobaciones extra de seguridad pueden detener tareas legítimas. Además, su razonamiento escrito es más difícil de seguir que el de GPT-5.6 Sol, algo que OpenAI atribuye a que resuelve problemas en menos pasos escritos. A ese retroceso lo llaman serio. Es la frase más honesta de todo el anuncio.

Qué estoy vigilando ahora

Dos cosas dirán si esto se sostiene.

La primera es la réplica independiente. Artificial Analysis, ARC Prize y los demás publicarán sus propias ejecuciones, y las cifras de Claude de la tabla de OpenAI las volverá a medir gente que no escribió el anuncio. Las diferencias de coste del 31% al 86% son las que más probablemente se muevan.

La segunda es si Anthropic responde en terreno de agente en lugar de en el índice. Fable 5.1 sostiene la corona de razonamiento con comodidad. Solo que nadie compra un modelo para que sostenga una corona.

Actualizaré este texto según lleguen cifras reales. Si quieres este razonamiento aplicado a tu propio stack en vez de a un anuncio, el plugin es de código abierto y la página de contacto es la vía más rápida para llegar a mí.

Compartir artículo

Sobre el autor

Wojciech Luszczynski

Wojciech Luszczynski

Arquitecto de GTM y operador de crecimiento que construye sistemas de ingresos nativos de IA para empresas B2B SaaS y tecnológicas. Conecto posicionamiento, SEO, contenido, adquisición de pago, CRM, automatización, analítica y flujos de trabajo con IA en una infraestructura de crecimiento que funciona.

Newsletter

Recibe el próximo antes que nadie.

Cuando publique un artículo nuevo sobre sistemas de IA, arquitectura GTM o modelos operativos de crecimiento, serás el primero en saberlo.

Suscribirse