Claude Opus 5.5 gana a GPT-6 Astra en todas las puntuaciones y aun así cuesta más terminar el trabajo
Opus 5.5 saca 58 frente al 53 de Astra, cuesta un 60% menos por token y aun así factura 5,98 por tarea frente a 3,26. Escribe 260 M de tokens frente a 60 M.
GTM Architect & Growth Operator · Insights · 28 de septiembre de 2026 · 9 min de lectura
Resumen · Lo esencial
- Artificial Analysis puntúa a Claude Opus 5.5 con 58 y a GPT-6 Astra con 53. Opus 5.5 es primero entre 211 modelos, Astra sexto. Opus 5.5 además figura un 60% más barato por token, 4 / 20 dólares frente a 10 / 50.
- Pese a ambas cosas, Astra es el modelo más barato por tarea terminada: 3,26 frente a 5,98 dólares. Opus 5.5 escribió 260 millones de tokens en la ejecución del índice y Astra escribió 60 millones.
- Opus 5.5 genera más rápido, unos 95 tokens de salida por segundo frente a 64, y aun así tarda mucho más de principio a fin, porque la velocidad por token pierde frente a cuatro veces los tokens.
- Como agente de programación se repite la misma forma. Claude Code con Opus 5.5 encabeza el Coding Agent Index con 66 frente al 62 de Codex con Astra, y cuesta 13,04 dólares por tarea en 1,1 horas frente a 7,47 en 29,4 minutos.
Dos modelos insignia, y el marcador dice una cosa mientras la factura dice la otra.
Claude Opus 5.5 es primero entre 211 modelos en el índice independiente. Además es un 60% más barato por token que GPT-6 Astra. Ambas cosas son ciertas, y a Astra le sigue costando menos sacar un trabajo adelante.
| Info | GPT-6 Astra | Claude Opus 5.5 |
|---|---|---|
| Entrada / salida por 1 M | $10 / $50 | $4 / $20 |
| Entrada en caché por 1 M | $1.00 | $0.20 |
| Intelligence Index v4.3.2 | 53 | 58 |
| Puesto entre 211 modelos | 6.º | 1.º |
| Coste por tarea del índice | $3.26 | $5.98 |
| Tokens generados en el índice | 60 M | 260 M |
| Velocidad de salida, tokens/s | unos 64 | unos 95 |
| Por encima de 272K de entrada, ent / sal | $20 / $75 | $4 / $20 |
| Contexto / salida máxima | 1 M / 128K | 1 M / 128K |
| Corte de conocimiento | abr 2026 | jun 2026 |
Precios y la regla de 272K de la página de modelo de GPT-6 Astra de OpenAI y de las páginas de precios y modelos de Anthropic. Puntuación del índice, coste por tarea, tokens y velocidad de las páginas de modelo de Artificial Analysis, ambos a max effort. Consultado el 28 de septiembre de 2026.
Opus 5.5 gana el marcador con claridad
Cinco puntos en el índice, 58 frente a 53, y los puestos lo concretan: primero entre 211 frente a sexto. La propia página de modelos de Anthropic manda ahora a los lectores indecisos a Opus 5.5 para la mayoría de las cargas.
También tiene los datos de entrenamiento más frescos, junio de 2026 frente a abril, lo que importa más de lo habitual en un año en que los modelos comparados salieron en septiembre.
Y pierde la factura
Por token Opus 5.5 es el barato por un margen amplio. $4 y $20 frente a $10 y $50. La entrada en caché cuesta $0.20 frente a $1, porque Anthropic tarifa los aciertos de caché en este modelo a 0,05x la entrada base donde el resto de la gama usa 0,1x.
Después la ejecución medida sale a 5,98 dólares por tarea frente a 3,26.
Toda la inversión cabe en una fila de la tabla. Opus 5.5 escribió 260 millones de tokens en el índice y Astra escribió 60 millones. Cuatro veces y un tercio de salida, al 40% del precio por token, deja un saldo de alrededor de un 80% más en la factura.
Dos modelos, y la lista de precios más barata pertenece al modelo más caro. Si presupuesta a partir de una tarifa en lugar de una ejecución medida, esta es la pareja que le pillará.
La cifra de velocidad es una trampa por sí sola
Artificial Analysis mide a Opus 5.5 en unos 95 tokens de salida por segundo y a Astra en unos 64. Opus 5.5 es el modelo más rápido, y Artificial Analysis califica a Astra de más lento que la media.
Aun así termina mucho más tarde. Los tokens por segundo son una tasa, y Opus 5.5 tiene cuatro veces más camino por delante. En el benchmark de programación, donde el tiempo real se mide directamente, eso se lee como 1,1 horas por tarea frente a 29,4 minutos.
Un modelo más rápido que termina en el doble de tiempo no es una contradicción. Es la diferencia entre un velocímetro y una hora de llegada, y solo una de las dos está en su calendario.
Agentes de programación: la misma forma, más alta
Opus 5.5 ya está en el Coding Agent Index de Artificial Analysis, donde no estaba cuando estos modelos salieron.
| Info | Codex + Astra | Claude Code + Opus 5.5 |
|---|---|---|
| Coding Agent Index v1.5 | 62 | 66 |
| DeepSWE v1.1 | 68% | 68% |
| Terminal-Bench 4.0 | 56% | 63% |
| SWE-Atlas-QnA | 62% | 66% |
| Coste por tarea | $7.47 | $13.04 |
| Tiempo por tarea | 29,4 min | 1,1 h |
| Tokens por tarea | 3,3 M | 15,6 M |
Coding Agent Index v1.5, cada modelo en su propio arnés. Opus 5.5 lidera todos los benchmarks salvo DeepSWE, donde empatan.
Opus 5.5 se lleva la cabeza de esa tabla y lidera Terminal-Bench por siete puntos, que es el benchmark que separa un modelo que escribe código de uno capaz de conducir un entorno. Factura un 75% más por tarea y tarda más del doble de tiempo real en hacerlo.
Tenga en cuenta la advertencia sobre el arnés que aplica a todas las filas: las cifras de Astra vienen de Codex y las de Opus 5.5 de Claude Code, y el arnés mueve los resultados tanto como el modelo.
La línea de 272K sigue siendo de Anthropic
OpenAI retarifa un prompt de Astra por encima de 272K tokens de entrada para la petición completa: doble de entrada y caché, una vez y media la salida, o sea $20 / $75. Anthropic factura toda la ventana de 1 millón de Opus 5.5 a una sola tarifa.
Pasada esa línea, Opus 5.5 cuesta un quinto que Astra en entrada y menos de un tercio en salida, encima de ser ya más barato por token. Para documentos largos, bases de código grandes mantenidas en contexto, o cualquier bucle cuya conversación crezca por encima de 272K, la inversión por tarea de arriba deja de proteger a Astra.
Cuál usaría yo
| El trabajo | Modelo | Por qué |
|---|---|---|
| La respuesta decide el resultado | Claude Opus 5.5 | Primero entre 211, y lidera todos los benchmarks de programación salvo aquel en que empatan. |
| Alto volumen pagando por tarea terminada | GPT-6 Astra | $3.26 frente a $5.98 en el índice, $7.47 frente a $13.04 en programación. |
| Alguien está esperando | GPT-6 Astra | 29,4 minutos frente a 1,1 horas, pese a ser el modelo más lento por token. |
| Prompts que cruzan los 272K tokens | Claude Opus 5.5 | Una sola tarifa en 1 millón, mientras la petición completa de Astra se dobla en entrada. |
| Bucles de agente con mucha caché | Claude Opus 5.5 | $0.20 frente a $1 en la línea que domina la factura de un bucle largo. |
| Conducir un terminal | Claude Opus 5.5 | Siete puntos en Terminal-Bench 4.0, el benchmark que separa escribir código de ejecutarlo. |
Opus 5.5 para calidad, prompts largos y bucles con mucha caché. Astra para rendimiento y para todo aquello que alguien esté esperando.
Dentro de la gama de OpenAI, Sol frente a Astra es la versión barata de esta decisión. Frente al propio salto de Anthropic, Opus 5.5 frente a Opus 5 cubre los cuatro cambios que rompen en la actualización.
Qué me haría cambiar de opinión
Ambos modelos en un mismo arnés. Todas las cifras de programación de aquí son Astra en Codex frente a Opus 5.5 en Claude Code, y eso son dos variables moviéndose a la vez.
Un barrido de esfuerzo. Opus 5.5 usa medium por defecto y todas las cifras de arriba son max effort, de donde salen sus 260 millones de tokens. La distancia por tarea podría cerrarse o invertirse en el valor por defecto.
Un cambio en la regla de 272K. Es la única línea que hace a Opus 5.5 varias veces más barato en prompts largos.
Preguntas que me hicieron
¿Es Claude Opus 5.5 mejor que GPT-6 Astra?
En toda puntuación publicada, sí. Artificial Analysis sitúa a Opus 5.5 en 58 en el Intelligence Index v4.3.2 y a Astra en 53, lo que hace a Opus 5.5 primero entre 211 modelos y a Astra sexto. En el arnés de programación se mantiene el mismo orden: Claude Code con Opus 5.5 saca 66 y Codex con Astra saca 62, y Opus 5.5 lidera Terminal-Bench 4.0 por siete puntos y SWE-Atlas-QnA por cuatro, con DeepSWE v1.1 empatado en 68%.
¿Cuál es más barato, GPT-6 Astra o Claude Opus 5.5?
Depende de qué cifra se refiera, y las dos discrepan. Por token Opus 5.5 es un 60% más barato: $4 de entrada y $20 de salida por millón frente a los $10 y $50 de Astra, y $0.20 frente a $1 en entrada en caché. Por tarea terminada Astra es un 45% más barato: Artificial Analysis midió $3.26 frente a $5.98, porque Opus 5.5 generó 260 millones de tokens en la ejecución del índice y Astra generó 60 millones. En tareas de programación la distancia se amplía a $7.47 frente a $13.04.
¿Cuál es más rápido, GPT-6 Astra o Claude Opus 5.5?
Opus 5.5 genera más rápido y termina más tarde. Artificial Analysis mide unos 95 tokens de salida por segundo para Opus 5.5 y unos 64 para Astra, pero Opus 5.5 escribe aproximadamente cuatro veces más tokens, así que dedica mucho más tiempo al mismo trabajo. En el benchmark de programación eso aparece como 1,1 horas por tarea frente a 29,4 minutos.
¿Debo usar GPT-6 Astra o Claude Opus 5.5?
Opus 5.5 cuando la calidad de la respuesta decide el resultado, cuando los prompts se alargan, o cuando el trabajo ya vive en Claude Code: puntúa más alto en todo, cuesta un quinto que Astra en entrada en caché y mantiene una sola tarifa en toda su ventana de 1 millón. Astra cuando paga por tarea terminada y el volumen es alto, o cuando hay una persona esperando, porque cuesta alrededor de la mitad por tarea y devuelve el trabajo en una fracción del tiempo.
Si está eligiendo un modelo insignia para un producto agéntico y quiere la regla de enrutado por escrito, la página de contacto es la vía más rápida para llegar a mí.



