Saltar al contenido
wojciech.io
Todos los artículos
AI SystemsAIOpenAIClaudeAI Systems

GPT-5.6 contra Claude 5: las primeras pruebas dicen que el cambio de fondo no es quién lidera la tabla

GPT-5.6 Luna saca 51,2 frente al 53 de Claude Sonnet 5, a una décima parte del precio. Cuándo gana el modelo barato y cuándo es falsa economía.

Wojciech Łuszczyński

Wojciech Łuszczyński

GTM Architect & Growth Operator · Insights · 12 de julio de 2026

Resumen · Lo esencial

  • Claude Fable 5 sigue liderando el índice de inteligencia de Artificial Analysis con 60. GPT-5.6 Sol saca 59 y termina esa misma prueba por alrededor de un tercio del coste de Fable. La distancia ya es dinero, no capacidad.
  • GPT-5.6 son tres modelos, no uno: Sol (buque insignia), Terra (equilibrado, índice 55 a 2 / 12 dólares) y Luna (volumen, índice 51 a 0,20 / 1,20). Lo sensato por defecto es Terra, con Sol como escalada, no Sol para todo.
  • Más barato por token no es más barato por resultado. Sonnet 5 quemó unos 300 millones de tokens en una sola evaluación, cinco veces la mediana, así que puede salir más caro por tarea terminada que un modelo más fuerte incluso a 2 / 10 dólares.
  • Deja de preguntar qué modelo es el mejor. Enruta el trabajo: Luna a Terra a Sol, o Sonnet para ejecutar y Fable para planificar. Quien gana es la arquitectura, no la fila con el número más alto.

OpenAI y Anthropic lanzaron sus generaciones de modelos más recientes con semanas de diferencia. Por encima parece otra ronda de guerra de tablas. No lo es. El movimiento interesante es estructural y cambia cómo construiría yo sobre cualquiera de las dos pilas.

OpenAI ha dejado de vender un único “mejor GPT”. GPT-5.6 es una familia de tres:

  • GPT-5.6 Sol, el buque insignia,
  • GPT-5.6 Terra, el nivel que equilibra capacidad y coste,
  • GPT-5.6 Luna, el nivel rápido y barato para volumen.

Anthropic posiciona dos:

  • Claude Fable 5 como su modelo más capaz de lanzamiento amplio,
  • Claude Sonnet 5 como el modelo agéntico práctico para el día a día, la automatización y la programación.

Los cinco llevan alrededor de un millón de tokens de contexto y hasta 128.000 tokens de salida. La ventana de contexto ha dejado de diferenciar. Lo que los separa ahora es la fiabilidad, el coste por tarea terminada, el uso de herramientas, la velocidad y cuánta supervisión necesitan para funcionar sin que yo esté mirando.

ModeloÍndice de inteligenciaEntrada / salida por 1MPapel más lógico
Claude Fable 560$10 / $50Los problemas más duros, análisis, planificación, programación de alto riesgo
GPT-5.6 Sol59$4 / $20Capacidad de frontera con mejores números, integración fuerte con Codex
GPT-5.6 Terra55$2 / $12Modelo por defecto para el trabajo profesional diario
Claude Sonnet 553$2 / $10Ejecución agéntica bien especificada y Claude Code
GPT-5.6 Luna51$0,20 / $1,20Cargas rápidas, de mucho volumen y bajo coste

Cinco modelos de un vistazo. Índice de inteligencia de Artificial Analysis, precios de tarifa publicados de la API y dónde se gana el sueldo cada uno. El resto del artículo explica por qué la fila destacada no es toda la historia.

El hallazgo central: Fable lidera, Sol queda un punto por detrás por un tercio del precio

Claude Fable 5 sacó 60 en el índice de inteligencia de Artificial Analysis. GPT-5.6 Sol con el razonamiento al máximo sacó 59. Artificial Analysis situó el coste de Sol en unos 1,04 dólares por tarea en esa evaluación, alrededor de un tercio del de Fable. Sol además se puso primero en el índice de agentes de programación con una puntuación de 80.

Índice de inteligencia de Artificial Analysis

+2% vs baseline
Claude Fable 560
GPT-5.6 Sol59
Un punto de diferencia en lo más alto. En el índice general Fable mantiene una ventaja mínima, del tipo que desaparece en cuanto miras el coste.

Esto no es un nocaut. Es un cambio en la economía del mercado.

Fable puede seguir siendo la decisión correcta para el problema más duro, ese en el que el coste del modelo importa menos que la probabilidad de acertar. Sol parece la mejor opción por defecto para trabajo de frontera repetido, sobre todo cualquier cosa que ejecutes muchas veces al día.

Qué cambia GPT-5.6 en realidad

Sol: cerca de Fable, bastante más barato

GPT-5.6 Sol cuesta 4 dólares por millón de tokens de entrada y 20 de salida. Fable 5 cuesta 10 y 50.

El precio por token nunca dice la verdad por sí solo, porque los modelos gastan cantidades distintas de razonamiento, dan un número distinto de pasos y necesitan distinta corrección humana. Pero el dato independiente de coste por tarea dice que la ventaja de Sol es más que un truco de tabla de precios.

Coste de Sol por tarea

1,04 $

evaluación de Artificial Analysis

Coste de Fable frente a Sol

~3x

más barato

misma prueba

Sol, índice de agentes de programación

80

líder actual

El argumento de Sol no es que gane todas las tablas. Es que aterriza al lado de Fable en calidad costando una fracción por trabajo completado.

Claire Vo ejecutó Sol, Terra, Luna, Fable y Sonnet sobre documentos de producto, prototipos, wireframes, depuración y voz agéntica. Sol ganó la prueba general, con lo mejor en documentos de producto, prototipado y uso del navegador. El problema de Fable no era la capacidad bruta. Era un exceso de precisión y un estilo de colaboración más duro durante el trabajo en sí.

Los primeros informes de desarrolladores apuntan en la misma dirección. Describen a Sol como cercano a Fable, pero más rápido, más barato y más fiable en cambios que tocan varias capas de un sistema a la vez. Anécdotas, no experimentos controlados, pero la dirección coincide con los números independientes.

Fable no perdió por capacidad. Perdió por lo que costaba trabajar con él.

La nota que se repite en las primeras comparativas entre modelos

Terra quizá sea el modelo más importante del lanzamiento

Sol se lleva la atención. Terra quizá tenga el impacto operativo mayor.

Terra cuesta 2 dólares por millón de tokens de entrada y 12 de salida. OpenAI lo describe como competitivo con GPT-5.5 a mitad de precio. Artificial Analysis le dio un 55 en el índice, cuatro puntos por detrás de Sol.

Eso basta para una parte grande del trabajo real de producción:

Análisis de negocio

Terra

Lee, resume y razona sobre material desordenado lo bastante bien como para preparar una decisión.

Documentos e investigación

Terra

La capa de volumen de la producción profesional: borradores, extracción, síntesis entre fuentes.

Generar y refactorizar código

Terra

Cambios de dificultad media con alcance claro, no las decisiones de arquitectura ambiguas.

Herramientas y ejecución de agentes

Terra

Ejecuciones de varios pasos donde el plan está definido y el modelo lo lleva a cabo.

No todas las pruebas, pero sí bastantes tareas de producción como para que pagar Sol por defecto deje de tener sentido.

No todo el mundo está convencido. Hay quien señala que Terra puntúa por debajo de GPT-5.5 en varias pruebas concretas y se comporta más como un modelo mediano destilado que como un Sol barato. Es justo. Una puntuación agregada alta no significa calidad uniforme en todas las cargas. Pero para una empresa la pregunta no es “¿gana Terra todas las evaluaciones?”. Es:

¿Termina Terra suficientes tareas nuestras como para que pagar Sol por defecto deje de hacer falta?

Para muchas cargas la respuesta es que sí.

Luna enseña a qué velocidad se abarata la capacidad

GPT-5.6 Luna cuesta 0,20 dólares por millón de tokens de entrada y 1,20 de salida. Sacó 51,2 en el índice, justo por debajo de Sonnet 5 con el razonamiento al máximo.

Eso no significa que Luna gane a Sonnet en cualquier tarea. Sonnet puede ser bastante mejor en trabajo agéntico, de programación o de larga duración. Lo que enseña Luna es la presión de precios que crea GPT-5.6: capacidad que hasta hace poco exigía un modelo de frontera caro se sienta ahora en un nivel de veinte céntimos de entrada.

Dónde Luna es la elección racional

Juzga a Luna por el trabajo que abre económicamente, no por si gana a Fable en el problema más difícil posible.

Clasificación y extracción

Mucho volumen, poca ambigüedad, pasa o no pasa. El trabajo clásico del modelo barato.

Procesamiento masivo de contenido

Primeros borradores, variantes y reescrituras a escala, donde un humano edita la salida de todos modos.

Agentes simples y enrutado

Clasifica una tarea, decide la dificultad y escala las difíciles a un nivel más fuerte.

Así que la mejor arquitectura no es Sol para todo. Enruta el trabajo por dificultad y riesgo.

Tarea entrante
triaje
Lunavolumen · riesgo bajo
demasiado difícil
Terratrabajo profesional diario
mucho en juego
Solsolo los problemas más duros
El enrutado por niveles que gana a un único modelo por defecto: el modelo más barato capaz de terminar el trabajo, escalando solo cuando no puede

Fable 5 sigue teniendo el argumento más fuerte en capacidad pura

Claude Fable 5 sigue primero en el índice general y rinde particularmente bien en tareas analíticas largas, programación agéntica, prototipado, trabajo con hojas de cálculo y problemas que exigen verificarse a sí mismos. Los primeros socios de Anthropic lo describieron como capaz de terminar trabajo que antes costaba muchos prompts, y de revisar y comprobar su propia salida con el esfuerzo al máximo.

Fable también sacó un 80 % en SWE-Bench Pro frente al 64,6 % de Sol. Pero Sol lideró Terminal-Bench 2.1 con un 88,8 % frente al 83,1 % de Fable.

SWE-Bench Pro

+24% vs baseline
Claude Fable 580%
GPT-5.6 Sol64.6%
Arreglar incidencias definidas en un repositorio: el terreno de Fable, con ventaja clara.

Terminal-Bench 2.1

+7% vs baseline
GPT-5.6 Sol88.8%
Claude Fable 583.1%
Trabajo dentro de un terminal: se lo lleva Sol. Los mismos dos modelos, resultado opuesto. Por esto 'el mejor modelo para programar' es una etiqueta inútil.

Las dos pruebas miden trabajos distintos, y el entorno importa tanto como el modelo:

  • SWE-Bench premia arreglar incidencias definidas en un repositorio.
  • Terminal-Bench evalúa el trabajo dentro de un entorno de terminal.
  • Codex y Claude Code añaden encima sus propios entornos, instrucciones de sistema, gestión de contexto y estrategias de herramientas.

El mismo modelo de base rinde distinto a través de una API cruda, dentro de Claude Code, dentro de Codex o dentro del marco de agentes de un tercero. Juzga el entorno, no solo los pesos.

Las desventajas reales de Fable son el coste y el acceso. Tras su suspensión temporal el modelo volvió globalmente, pero bastantes usuarios criticaron a Anthropic por sacar el uso de Fable de las cuotas normales de suscripción y meterlo en créditos de pago aparte. Fable puede ser el mejor especialista sin ser el mejor empleado por defecto.

Sonnet 5: un modelo capaz con un problema de posicionamiento

Sonnet 5 venía a responder una pregunta sencilla: ¿qué modelo de Claude debería usar la gente cada día?

La historia de producto es atractiva. Sonnet 5 está disponible en todos los planes de Claude, es el modelo por defecto en Free y Pro, funciona en Claude Code y cuesta 2 dólares por millón de tokens de entrada y 10 de salida. Eso empezó como precio de introducción con caducidad el 31 de agosto de 2026, pero Anthropic ha confirmado que la subida prevista a 3 y 15 no va a ocurrir y que 2 / 10 es ya el precio estándar. Anthropic lo presenta como bastante más agéntico que Sonnet 4.6: mejor terminando tareas de varios pasos, comprobando su propia salida y trabajando sobre bases de código existentes y desordenadas. Los socios con acceso anticipado informaron de buenos resultados en depuración, uso de herramientas, pruebas y código heredado.

El cuadro independiente es más desigual.

Eso no hace débil a Sonnet 5. Sugiere que planificar trabajo muy ambiguo no es su papel natural. Un reparto más racional:

El trabajoMi elecciónPor qué
Arquitectura, planificación, trabajo con mucha incertidumbreFable o SolLo caro es equivocarse. Paga por el modelo con menos probabilidad de mandarte por el camino malo.
Implementar una tarea bien especificadaSonnet 5El alcance está fijado y el trabajo es ejecutar. Aquí es donde luce su fuerza agéntica y el precio encaja.
Análisis y ejecución diarios con buen costeTerraCalidad cercana a la frontera por la mitad del buque insignia, para el grueso de la producción profesional.
Escala y flujos de bajo riesgoLunaVolumen que antes nunca justificaba un modelo de frontera y ahora sale a veinte céntimos por millón de entrada.

Empareja el modelo con el riesgo de la tarea, no con una fila de una tabla.

Operador trabajando de noche en un escritorio con portátil, cuaderno y una estantería pequeña de libros, con las luces de la ciudad al fondo
La elección ya no es qué modelo es más listo. Es qué entorno termina tu trabajo.

La competición de verdad: ChatGPT Work y Codex contra Claude Cowork y Claude Code

Las comparaciones de modelo contra modelo describen cada mes peor la productividad real.

OpenAI puso GPT-5.6 en ChatGPT, ChatGPT Work, Codex y la API. Los usuarios de pago eligen Sol, Terra o Luna dentro de Work y Codex y controlan el esfuerzo de razonamiento. Existen modos max y ultra en los planes que lo permiten, y la API admite llamadas a herramientas por programa y subagentes en paralelo. Anthropic ofrece un sistema comparable con Claude Chat, Cowork y Claude Code.

OpenAI: ChatGPT Work + Codex

mejor economía

Sol, Terra y Luna seleccionables dentro de Work y Codex, control del esfuerzo, modos max y ultra, llamadas a herramientas por programa y subagentes en paralelo. El atractivo es la integración más estrecha con el resto de ChatGPT y una economía de modelos más agresiva.

Anthropic: Cowork + Claude Code

experiencia de dev madura

El mismo abanico de trabajos desde Claude Chat, Cowork y Claude Code. La ventaja sigue siendo Claude Code: aún la experiencia de desarrollo más madura, sobre todo para moverse con naturalidad por una base de código existente y desordenada.

Esto ya no es elegir entre chatbots. Es elegir entre entornos de ejecución para el trabajo digital.

Las dos pilas se mueven entre los mismos trabajos: conversación y análisis, documentos y ficheros, trabajo a nivel de aplicación, editar un repositorio, ejecutar código, delegar en subagentes. La ventaja de Anthropic sigue siendo Claude Code, todavía la experiencia de desarrollo más madura y la preferida por más gente, sobre todo para trabajar con naturalidad sobre una base de código existente. La respuesta de OpenAI es una integración más estrecha entre Codex y el resto de ChatGPT, más una economía de modelos más agresiva.

Las primeras reacciones no coronan a un ganador universal. Hay desarrolladores que siguen prefiriendo Claude para frontend, por ceñirse a las convenciones del proyecto y generar código más cercano a la intención. Otros cuentan que Codex con Sol es más fiable cuando un problema cruza varias capas de un sistema, y que se atasca menos en una solución local.

Qué dicen los números en realidad

Dos conclusiones sobreviven a todas las salvedades.

Primera: la distancia de capacidad entre el buque insignia y los niveles baratos se está encogiendo. Un punto separa a Fable de Sol en el índice general. Cuatro puntos separan a Sol de Terra. Los modelos premium ya no son otra liga, solo otro precio.

Segunda: el precio por token no es el número que importa. Un modelo más barato puede salir más caro por resultado cuando genera más tokens de razonamiento, da más pasos o necesita más corrección. El coste por resultado terminado es la única cifra que toca una cuenta de resultados, y no aparece en ninguna página de precios.

Lo que enseña la página de precios

Coste por token

Lo que llega de verdad a tu presupuesto

Coste por resultado terminado

La métrica que lo decide todo, y la que ningún anuncio de lanzamiento pone en la diapositiva

Cómo repartiría yo el trabajo

Para la mayoría del trabajo profesional: Terra

Terra es el mejor punto de partida para análisis, investigación, documentos, contenido y programación de dificultad media. Sol debería ser una vía de escalada, no el valor por defecto universal.

Para los problemas más duros: Sol o Fable

Fable mantiene una ventaja general mínima y rinde con fuerza en tareas largas y complejas. Sol entrega una capacidad cercana con números bastante mejores y es el valor por defecto más pragmático para una organización.

Dentro de Claude Code: Sonnet ejecuta, Fable planifica

Sonnet 5 encaja en implementación bien definida. En trabajo arquitectónico ambiguo, usar un modelo más fuerte para preparar el plan suele costar menos que corregir tres veces al barato.

Para automatización de mucho volumen: Luna

No juzgues a Luna por si gana a Fable en el problema más difícil. Su valor está en habilitar categorías enteras de trabajo que antes nunca justificaban económicamente la IA de frontera.

Veredicto final

OpenAI no necesitaba derrotar a Fable con claridad. Solo tenía que acercarse mucho a un coste bastante menor y repartir después la misma generación de capacidad en tres niveles económicos. El resultado es que “¿qué modelo es el mejor?” es cada vez peor pregunta.

Mejores preguntas:

  • ¿Qué modelo termina de verdad mi flujo de trabajo concreto?
  • ¿Cuánta supervisión necesita?
  • ¿Qué cuesta un resultado correcto, no un millón de tokens?
  • ¿Puede operar sobre mis documentos, aplicaciones y repositorios?
  • ¿Cuándo debería escalar el trabajo automáticamente a un modelo más fuerte?

La IA de frontera ya no es un modelo. Se está convirtiendo en un sistema de producción por niveles. En ese sistema no gana el modelo con el número más alto en una tabla. Gana la arquitectura que envía la tarea correcta al nivel de inteligencia correcto.

Preguntas frecuentes: GPT-5.6 contra Claude 5

¿Es GPT-5.6 Luna mejor que Claude Sonnet 5?

En capacidad bruta, no: Luna saca 51,2 en el índice de inteligencia de Artificial Analysis y Sonnet 5 saca 53 con el razonamiento al máximo. En precio la distancia va en la otra dirección y no es pequeña: Luna cuesta 0,20 dólares por millón de tokens de entrada y 1,20 de salida, frente a los 2 y 10 de Sonnet 5. Es una décima parte del coste de entrada por un par de puntos de índice. Usa Luna para trabajo de mucho volumen y poca ambigüedad, donde una respuesta equivocada sale barata de detectar: clasificación, extracción, enrutado, primeros borradores. Usa Sonnet 5 cuando la tarea sea agéntica o larga, porque Sonnet da menos pasos para terminar y dentro de Claude Code ya viene integrado. La trampa está en juzgar a cualquiera de los dos por el precio por token en lugar del coste por tarea terminada.

¿Qué modelo de IA es el mejor ahora mismo, GPT-5.6 o Claude 5?

En el índice de inteligencia de Artificial Analysis, Claude Fable 5 lidera con 60 y GPT-5.6 Sol queda un punto por detrás con 59, pero Sol completa la prueba por alrededor de un tercio de lo que cuesta Fable. GPT-5.6 Terra quizá sea el más útil comercialmente de los cinco. No hay un ganador único: el modelo correcto depende de la tarea, del coste por resultado terminado y de cuánta supervisión puedes permitirte.

¿Es GPT-5.6 más barato que Claude Fable 5?

Sí. GPT-5.6 Sol cuesta 4 dólares por millón de tokens de entrada y 20 de salida, frente a los 10 y 50 de Fable 5, y las pruebas independientes situaron a Sol en torno a un tercio del coste de Fable por tarea completada. Terra (2 / 12) y Luna (0,20 / 1,20) quedan aún más por debajo de cualquier nivel de Claude.

¿Debería usar Claude Sonnet 5 en Claude Code?

Para implementación bien especificada, sí: es el modelo por defecto en Claude Code y es fuerte en depuración, uso de herramientas y bases de código existentes y desordenadas. Para arquitectura ambigua, planifica antes con un modelo más fuerte. Sonnet 5 puede dar más pasos, consumir más contexto y costar más por tarea terminada que un modelo superior, así que planificar con él el trabajo más difícil suele ser falsa economía.

¿Cuál es el mejor modelo GPT-5.6 para el trabajo profesional del día a día?

Terra para la mayor parte: análisis, investigación, trabajo con documentos y programación de dificultad media a mitad de precio que el buque insignia. Guarda Sol como vía de escalada para los problemas más duros y usa Luna para cargas de mucho volumen y poco riesgo como clasificación, extracción y enrutado.

Fuentes y lecturas

Fuentes primarias

Fuentes de primer nivel para los números citados arriba. Los enlaces profundos cambian; estas son las páginas contra las que comprobar las cifras vivas.

Si quieres el contexto operativo alrededor de esto, he escrito mi propia prueba de Claude Fable 5 contra Opus y Sonnet y la pila de producción con IA sobre la que realmente trabajo. Mismo principio que aquí: el modelo es una capa, y el trabajo es el sistema que reparte el trabajo a su alrededor.

Sobre el autor

Wojciech Łuszczyński

Wojciech Łuszczyński

Arquitecto de GTM y operador de crecimiento que construye sistemas de ingresos nativos de IA para empresas B2B SaaS y tecnológicas. Conecto posicionamiento, SEO, contenido, adquisición de pago, CRM, automatización, analítica y flujos de trabajo con IA en una infraestructura de crecimiento que funciona.

Newsletter

Recibe el próximo antes que nadie.

Cuando publique un artículo nuevo sobre sistemas de IA, arquitectura GTM o modelos operativos de crecimiento, serás el primero en saberlo.

Suscribirse