GPT-5.6 contra Claude 5: las primeras pruebas dicen que el cambio de fondo no es quién lidera la tabla
GPT-5.6 Luna saca 51,2 frente al 53 de Claude Sonnet 5, a una décima parte del precio. Cuándo gana el modelo barato y cuándo es falsa economía.
GTM Architect & Growth Operator · Insights · 12 de julio de 2026
Resumen · Lo esencial
- Claude Fable 5 sigue liderando el índice de inteligencia de Artificial Analysis con 60. GPT-5.6 Sol saca 59 y termina esa misma prueba por alrededor de un tercio del coste de Fable. La distancia ya es dinero, no capacidad.
- GPT-5.6 son tres modelos, no uno: Sol (buque insignia), Terra (equilibrado, índice 55 a 2 / 12 dólares) y Luna (volumen, índice 51 a 0,20 / 1,20). Lo sensato por defecto es Terra, con Sol como escalada, no Sol para todo.
- Más barato por token no es más barato por resultado. Sonnet 5 quemó unos 300 millones de tokens en una sola evaluación, cinco veces la mediana, así que puede salir más caro por tarea terminada que un modelo más fuerte incluso a 2 / 10 dólares.
- Deja de preguntar qué modelo es el mejor. Enruta el trabajo: Luna a Terra a Sol, o Sonnet para ejecutar y Fable para planificar. Quien gana es la arquitectura, no la fila con el número más alto.
OpenAI y Anthropic lanzaron sus generaciones de modelos más recientes con semanas de diferencia. Por encima parece otra ronda de guerra de tablas. No lo es. El movimiento interesante es estructural y cambia cómo construiría yo sobre cualquiera de las dos pilas.
OpenAI ha dejado de vender un único “mejor GPT”. GPT-5.6 es una familia de tres:
- GPT-5.6 Sol, el buque insignia,
- GPT-5.6 Terra, el nivel que equilibra capacidad y coste,
- GPT-5.6 Luna, el nivel rápido y barato para volumen.
Anthropic posiciona dos:
- Claude Fable 5 como su modelo más capaz de lanzamiento amplio,
- Claude Sonnet 5 como el modelo agéntico práctico para el día a día, la automatización y la programación.
Los cinco llevan alrededor de un millón de tokens de contexto y hasta 128.000 tokens de salida. La ventana de contexto ha dejado de diferenciar. Lo que los separa ahora es la fiabilidad, el coste por tarea terminada, el uso de herramientas, la velocidad y cuánta supervisión necesitan para funcionar sin que yo esté mirando.
| Modelo | Índice de inteligencia | Entrada / salida por 1M | Papel más lógico |
|---|---|---|---|
| Claude Fable 5 | 60 | $10 / $50 | Los problemas más duros, análisis, planificación, programación de alto riesgo |
| GPT-5.6 Sol | 59 | $4 / $20 | Capacidad de frontera con mejores números, integración fuerte con Codex |
| GPT-5.6 Terra | 55 | $2 / $12 | Modelo por defecto para el trabajo profesional diario |
| Claude Sonnet 5 | 53 | $2 / $10 | Ejecución agéntica bien especificada y Claude Code |
| GPT-5.6 Luna | 51 | $0,20 / $1,20 | Cargas rápidas, de mucho volumen y bajo coste |
Cinco modelos de un vistazo. Índice de inteligencia de Artificial Analysis, precios de tarifa publicados de la API y dónde se gana el sueldo cada uno. El resto del artículo explica por qué la fila destacada no es toda la historia.
El hallazgo central: Fable lidera, Sol queda un punto por detrás por un tercio del precio
Claude Fable 5 sacó 60 en el índice de inteligencia de Artificial Analysis. GPT-5.6 Sol con el razonamiento al máximo sacó 59. Artificial Analysis situó el coste de Sol en unos 1,04 dólares por tarea en esa evaluación, alrededor de un tercio del de Fable. Sol además se puso primero en el índice de agentes de programación con una puntuación de 80.
Índice de inteligencia de Artificial Analysis
+2% vs baselineEsto no es un nocaut. Es un cambio en la economía del mercado.
Fable puede seguir siendo la decisión correcta para el problema más duro, ese en el que el coste del modelo importa menos que la probabilidad de acertar. Sol parece la mejor opción por defecto para trabajo de frontera repetido, sobre todo cualquier cosa que ejecutes muchas veces al día.
Qué cambia GPT-5.6 en realidad
Sol: cerca de Fable, bastante más barato
GPT-5.6 Sol cuesta 4 dólares por millón de tokens de entrada y 20 de salida. Fable 5 cuesta 10 y 50.
El precio por token nunca dice la verdad por sí solo, porque los modelos gastan cantidades distintas de razonamiento, dan un número distinto de pasos y necesitan distinta corrección humana. Pero el dato independiente de coste por tarea dice que la ventaja de Sol es más que un truco de tabla de precios.
Coste de Sol por tarea
1,04 $
evaluación de Artificial Analysis
Coste de Fable frente a Sol
~3x
más barato
misma prueba
Sol, índice de agentes de programación
80
líder actual
Claire Vo ejecutó Sol, Terra, Luna, Fable y Sonnet sobre documentos de producto, prototipos, wireframes, depuración y voz agéntica. Sol ganó la prueba general, con lo mejor en documentos de producto, prototipado y uso del navegador. El problema de Fable no era la capacidad bruta. Era un exceso de precisión y un estilo de colaboración más duro durante el trabajo en sí.
Los primeros informes de desarrolladores apuntan en la misma dirección. Describen a Sol como cercano a Fable, pero más rápido, más barato y más fiable en cambios que tocan varias capas de un sistema a la vez. Anécdotas, no experimentos controlados, pero la dirección coincide con los números independientes.
Fable no perdió por capacidad. Perdió por lo que costaba trabajar con él.
Terra quizá sea el modelo más importante del lanzamiento
Sol se lleva la atención. Terra quizá tenga el impacto operativo mayor.
Terra cuesta 2 dólares por millón de tokens de entrada y 12 de salida. OpenAI lo describe como competitivo con GPT-5.5 a mitad de precio. Artificial Analysis le dio un 55 en el índice, cuatro puntos por detrás de Sol.
Eso basta para una parte grande del trabajo real de producción:
Análisis de negocio
TerraLee, resume y razona sobre material desordenado lo bastante bien como para preparar una decisión.
Documentos e investigación
TerraLa capa de volumen de la producción profesional: borradores, extracción, síntesis entre fuentes.
Generar y refactorizar código
TerraCambios de dificultad media con alcance claro, no las decisiones de arquitectura ambiguas.
Herramientas y ejecución de agentes
TerraEjecuciones de varios pasos donde el plan está definido y el modelo lo lleva a cabo.
No todo el mundo está convencido. Hay quien señala que Terra puntúa por debajo de GPT-5.5 en varias pruebas concretas y se comporta más como un modelo mediano destilado que como un Sol barato. Es justo. Una puntuación agregada alta no significa calidad uniforme en todas las cargas. Pero para una empresa la pregunta no es “¿gana Terra todas las evaluaciones?”. Es:
¿Termina Terra suficientes tareas nuestras como para que pagar Sol por defecto deje de hacer falta?
Para muchas cargas la respuesta es que sí.
Luna enseña a qué velocidad se abarata la capacidad
GPT-5.6 Luna cuesta 0,20 dólares por millón de tokens de entrada y 1,20 de salida. Sacó 51,2 en el índice, justo por debajo de Sonnet 5 con el razonamiento al máximo.
Eso no significa que Luna gane a Sonnet en cualquier tarea. Sonnet puede ser bastante mejor en trabajo agéntico, de programación o de larga duración. Lo que enseña Luna es la presión de precios que crea GPT-5.6: capacidad que hasta hace poco exigía un modelo de frontera caro se sienta ahora en un nivel de veinte céntimos de entrada.
Dónde Luna es la elección racional
Juzga a Luna por el trabajo que abre económicamente, no por si gana a Fable en el problema más difícil posible.
Mucho volumen, poca ambigüedad, pasa o no pasa. El trabajo clásico del modelo barato.
Primeros borradores, variantes y reescrituras a escala, donde un humano edita la salida de todos modos.
Clasifica una tarea, decide la dificultad y escala las difíciles a un nivel más fuerte.
Así que la mejor arquitectura no es Sol para todo. Enruta el trabajo por dificultad y riesgo.
Fable 5 sigue teniendo el argumento más fuerte en capacidad pura
Claude Fable 5 sigue primero en el índice general y rinde particularmente bien en tareas analíticas largas, programación agéntica, prototipado, trabajo con hojas de cálculo y problemas que exigen verificarse a sí mismos. Los primeros socios de Anthropic lo describieron como capaz de terminar trabajo que antes costaba muchos prompts, y de revisar y comprobar su propia salida con el esfuerzo al máximo.
Fable también sacó un 80 % en SWE-Bench Pro frente al 64,6 % de Sol. Pero Sol lideró Terminal-Bench 2.1 con un 88,8 % frente al 83,1 % de Fable.
SWE-Bench Pro
+24% vs baselineTerminal-Bench 2.1
+7% vs baselineLas dos pruebas miden trabajos distintos, y el entorno importa tanto como el modelo:
- SWE-Bench premia arreglar incidencias definidas en un repositorio.
- Terminal-Bench evalúa el trabajo dentro de un entorno de terminal.
- Codex y Claude Code añaden encima sus propios entornos, instrucciones de sistema, gestión de contexto y estrategias de herramientas.
El mismo modelo de base rinde distinto a través de una API cruda, dentro de Claude Code, dentro de Codex o dentro del marco de agentes de un tercero. Juzga el entorno, no solo los pesos.
Las desventajas reales de Fable son el coste y el acceso. Tras su suspensión temporal el modelo volvió globalmente, pero bastantes usuarios criticaron a Anthropic por sacar el uso de Fable de las cuotas normales de suscripción y meterlo en créditos de pago aparte. Fable puede ser el mejor especialista sin ser el mejor empleado por defecto.
Sonnet 5: un modelo capaz con un problema de posicionamiento
Sonnet 5 venía a responder una pregunta sencilla: ¿qué modelo de Claude debería usar la gente cada día?
La historia de producto es atractiva. Sonnet 5 está disponible en todos los planes de Claude, es el modelo por defecto en Free y Pro, funciona en Claude Code y cuesta 2 dólares por millón de tokens de entrada y 10 de salida. Eso empezó como precio de introducción con caducidad el 31 de agosto de 2026, pero Anthropic ha confirmado que la subida prevista a 3 y 15 no va a ocurrir y que 2 / 10 es ya el precio estándar. Anthropic lo presenta como bastante más agéntico que Sonnet 4.6: mejor terminando tareas de varios pasos, comprobando su propia salida y trabajando sobre bases de código existentes y desordenadas. Los socios con acceso anticipado informaron de buenos resultados en depuración, uso de herramientas, pruebas y código heredado.
El cuadro independiente es más desigual.
Eso no hace débil a Sonnet 5. Sugiere que planificar trabajo muy ambiguo no es su papel natural. Un reparto más racional:
| El trabajo | Mi elección | Por qué |
|---|---|---|
| Arquitectura, planificación, trabajo con mucha incertidumbre | Fable o Sol | Lo caro es equivocarse. Paga por el modelo con menos probabilidad de mandarte por el camino malo. |
| Implementar una tarea bien especificada | Sonnet 5 | El alcance está fijado y el trabajo es ejecutar. Aquí es donde luce su fuerza agéntica y el precio encaja. |
| Análisis y ejecución diarios con buen coste | Terra | Calidad cercana a la frontera por la mitad del buque insignia, para el grueso de la producción profesional. |
| Escala y flujos de bajo riesgo | Luna | Volumen que antes nunca justificaba un modelo de frontera y ahora sale a veinte céntimos por millón de entrada. |
Empareja el modelo con el riesgo de la tarea, no con una fila de una tabla.

La competición de verdad: ChatGPT Work y Codex contra Claude Cowork y Claude Code
Las comparaciones de modelo contra modelo describen cada mes peor la productividad real.
OpenAI puso GPT-5.6 en ChatGPT, ChatGPT Work, Codex y la API. Los usuarios de pago eligen Sol, Terra o Luna dentro de Work y Codex y controlan el esfuerzo de razonamiento. Existen modos max y ultra en los planes que lo permiten, y la API admite llamadas a herramientas por programa y subagentes en paralelo. Anthropic ofrece un sistema comparable con Claude Chat, Cowork y Claude Code.
OpenAI: ChatGPT Work + Codex
mejor economíaSol, Terra y Luna seleccionables dentro de Work y Codex, control del esfuerzo, modos max y ultra, llamadas a herramientas por programa y subagentes en paralelo. El atractivo es la integración más estrecha con el resto de ChatGPT y una economía de modelos más agresiva.
Anthropic: Cowork + Claude Code
experiencia de dev maduraEl mismo abanico de trabajos desde Claude Chat, Cowork y Claude Code. La ventaja sigue siendo Claude Code: aún la experiencia de desarrollo más madura, sobre todo para moverse con naturalidad por una base de código existente y desordenada.
Las dos pilas se mueven entre los mismos trabajos: conversación y análisis, documentos y ficheros, trabajo a nivel de aplicación, editar un repositorio, ejecutar código, delegar en subagentes. La ventaja de Anthropic sigue siendo Claude Code, todavía la experiencia de desarrollo más madura y la preferida por más gente, sobre todo para trabajar con naturalidad sobre una base de código existente. La respuesta de OpenAI es una integración más estrecha entre Codex y el resto de ChatGPT, más una economía de modelos más agresiva.
Las primeras reacciones no coronan a un ganador universal. Hay desarrolladores que siguen prefiriendo Claude para frontend, por ceñirse a las convenciones del proyecto y generar código más cercano a la intención. Otros cuentan que Codex con Sol es más fiable cuando un problema cruza varias capas de un sistema, y que se atasca menos en una solución local.
Qué dicen los números en realidad
Dos conclusiones sobreviven a todas las salvedades.
Primera: la distancia de capacidad entre el buque insignia y los niveles baratos se está encogiendo. Un punto separa a Fable de Sol en el índice general. Cuatro puntos separan a Sol de Terra. Los modelos premium ya no son otra liga, solo otro precio.
Segunda: el precio por token no es el número que importa. Un modelo más barato puede salir más caro por resultado cuando genera más tokens de razonamiento, da más pasos o necesita más corrección. El coste por resultado terminado es la única cifra que toca una cuenta de resultados, y no aparece en ninguna página de precios.
Lo que enseña la página de precios
Coste por token
Lo que llega de verdad a tu presupuesto
Coste por resultado terminado
Cómo repartiría yo el trabajo
Para la mayoría del trabajo profesional: Terra
Terra es el mejor punto de partida para análisis, investigación, documentos, contenido y programación de dificultad media. Sol debería ser una vía de escalada, no el valor por defecto universal.
Para los problemas más duros: Sol o Fable
Fable mantiene una ventaja general mínima y rinde con fuerza en tareas largas y complejas. Sol entrega una capacidad cercana con números bastante mejores y es el valor por defecto más pragmático para una organización.
Dentro de Claude Code: Sonnet ejecuta, Fable planifica
Sonnet 5 encaja en implementación bien definida. En trabajo arquitectónico ambiguo, usar un modelo más fuerte para preparar el plan suele costar menos que corregir tres veces al barato.
Para automatización de mucho volumen: Luna
No juzgues a Luna por si gana a Fable en el problema más difícil. Su valor está en habilitar categorías enteras de trabajo que antes nunca justificaban económicamente la IA de frontera.
Veredicto final
OpenAI no necesitaba derrotar a Fable con claridad. Solo tenía que acercarse mucho a un coste bastante menor y repartir después la misma generación de capacidad en tres niveles económicos. El resultado es que “¿qué modelo es el mejor?” es cada vez peor pregunta.
Mejores preguntas:
- ¿Qué modelo termina de verdad mi flujo de trabajo concreto?
- ¿Cuánta supervisión necesita?
- ¿Qué cuesta un resultado correcto, no un millón de tokens?
- ¿Puede operar sobre mis documentos, aplicaciones y repositorios?
- ¿Cuándo debería escalar el trabajo automáticamente a un modelo más fuerte?
La IA de frontera ya no es un modelo. Se está convirtiendo en un sistema de producción por niveles. En ese sistema no gana el modelo con el número más alto en una tabla. Gana la arquitectura que envía la tarea correcta al nivel de inteligencia correcto.
Preguntas frecuentes: GPT-5.6 contra Claude 5
¿Es GPT-5.6 Luna mejor que Claude Sonnet 5?
En capacidad bruta, no: Luna saca 51,2 en el índice de inteligencia de Artificial Analysis y Sonnet 5 saca 53 con el razonamiento al máximo. En precio la distancia va en la otra dirección y no es pequeña: Luna cuesta 0,20 dólares por millón de tokens de entrada y 1,20 de salida, frente a los 2 y 10 de Sonnet 5. Es una décima parte del coste de entrada por un par de puntos de índice. Usa Luna para trabajo de mucho volumen y poca ambigüedad, donde una respuesta equivocada sale barata de detectar: clasificación, extracción, enrutado, primeros borradores. Usa Sonnet 5 cuando la tarea sea agéntica o larga, porque Sonnet da menos pasos para terminar y dentro de Claude Code ya viene integrado. La trampa está en juzgar a cualquiera de los dos por el precio por token en lugar del coste por tarea terminada.
¿Qué modelo de IA es el mejor ahora mismo, GPT-5.6 o Claude 5?
En el índice de inteligencia de Artificial Analysis, Claude Fable 5 lidera con 60 y GPT-5.6 Sol queda un punto por detrás con 59, pero Sol completa la prueba por alrededor de un tercio de lo que cuesta Fable. GPT-5.6 Terra quizá sea el más útil comercialmente de los cinco. No hay un ganador único: el modelo correcto depende de la tarea, del coste por resultado terminado y de cuánta supervisión puedes permitirte.
¿Es GPT-5.6 más barato que Claude Fable 5?
Sí. GPT-5.6 Sol cuesta 4 dólares por millón de tokens de entrada y 20 de salida, frente a los 10 y 50 de Fable 5, y las pruebas independientes situaron a Sol en torno a un tercio del coste de Fable por tarea completada. Terra (2 / 12) y Luna (0,20 / 1,20) quedan aún más por debajo de cualquier nivel de Claude.
¿Debería usar Claude Sonnet 5 en Claude Code?
Para implementación bien especificada, sí: es el modelo por defecto en Claude Code y es fuerte en depuración, uso de herramientas y bases de código existentes y desordenadas. Para arquitectura ambigua, planifica antes con un modelo más fuerte. Sonnet 5 puede dar más pasos, consumir más contexto y costar más por tarea terminada que un modelo superior, así que planificar con él el trabajo más difícil suele ser falsa economía.
¿Cuál es el mejor modelo GPT-5.6 para el trabajo profesional del día a día?
Terra para la mayor parte: análisis, investigación, trabajo con documentos y programación de dificultad media a mitad de precio que el buque insignia. Guarda Sol como vía de escalada para los problemas más duros y usa Luna para cargas de mucho volumen y poco riesgo como clasificación, extracción y enrutado.
Fuentes y lecturas
Fuentes primarias
Fuentes de primer nivel para los números citados arriba. Los enlaces profundos cambian; estas son las páginas contra las que comprobar las cifras vivas.
Las puntuaciones del índice de inteligencia y del índice de agentes de programación, y las estimaciones de coste por tarea citadas en todo el texto.
Anuncios de Claude Fable 5 y Sonnet 5, precios y fichas de modelo.
Anuncios de GPT-5.6 Sol, Terra y Luna, niveles de precio y la integración con Codex.
Si quieres el contexto operativo alrededor de esto, he escrito mi propia prueba de Claude Fable 5 contra Opus y Sonnet y la pila de producción con IA sobre la que realmente trabajo. Mismo principio que aquí: el modelo es una capa, y el trabajo es el sistema que reparte el trabajo a su alrededor.
