Vai al contenuto
wojciech.io
Tutti gli articoli
AI SystemsAIOpenAIClaudeAI Systems

GPT-5.6 contro Claude 5: i primi test dicono che il cambiamento vero non è chi guida la classifica

GPT-5.6 Luna segna 51,2 contro il 53 di Claude Sonnet 5, a un decimo del prezzo. Quando vince il modello economico e quando è falsa economia.

Wojciech Łuszczyński

Wojciech Łuszczyński

GTM Architect & Growth Operator · Insights · 12 luglio 2026

In breve · I punti chiave

  • Claude Fable 5 guida ancora l'indice di intelligenza di Artificial Analysis con 60. GPT-5.6 Sol segna 59 e chiude lo stesso benchmark a circa un terzo del costo di Fable. La distanza ormai è denaro, non capacità.
  • GPT-5.6 sono tre modelli, non uno: Sol (di punta), Terra (equilibrato, indice 55 a 2 / 12 dollari) e Luna (volume, indice 51 a 0,20 / 1,20). La scelta sensata di default è Terra, con Sol come escalation, non Sol per tutto.
  • Più economico per token non vuol dire più economico per risultato. Sonnet 5 ha bruciato circa 300 milioni di token in una sola valutazione, cinque volte la mediana, quindi può costare più per attività completata di un modello più forte anche a 2 / 10 dollari.
  • Smetti di chiedere quale modello sia il migliore. Instrada il lavoro: Luna verso Terra verso Sol, oppure Sonnet per eseguire e Fable per pianificare. A vincere è l'architettura, non la riga con il numero più alto.

OpenAI e Anthropic hanno rilasciato le loro generazioni di modelli più recenti a poche settimane di distanza. In superficie sembra l’ennesimo round di guerra dei benchmark. Non lo è. La mossa interessante è strutturale e cambia il modo in cui costruirei su entrambi gli stack.

OpenAI ha smesso di vendere un unico “GPT migliore”. GPT-5.6 è una famiglia di tre:

  • GPT-5.6 Sol, il modello di punta,
  • GPT-5.6 Terra, il livello che bilancia capacità e costo,
  • GPT-5.6 Luna, il livello veloce ed economico per il volume.

Anthropic ne posiziona due:

  • Claude Fable 5 come modello più capace a distribuzione ampia,
  • Claude Sonnet 5 come modello agentico pratico per il lavoro quotidiano, l’automazione e la programmazione.

Tutti e cinque portano circa un milione di token di contesto e fino a 128.000 token in uscita. La finestra di contesto ha smesso di fare la differenza. Quello che li separa adesso è l’affidabilità, il costo per attività completata, l’uso degli strumenti, la velocità e quanta supervisione serve perché lavorino senza che io stia a guardare.

ModelloIndice di intelligenzaIn / out per 1MRuolo più logico
Claude Fable 560$10 / $50Problemi più duri, analisi, pianificazione, programmazione ad alto rischio
GPT-5.6 Sol59$4 / $20Capacità di frontiera con conti migliori, integrazione forte con Codex
GPT-5.6 Terra55$2 / $12Modello di default per il lavoro professionale quotidiano
Claude Sonnet 553$2 / $10Esecuzione agentica ben specificata e Claude Code
GPT-5.6 Luna51$0,20 / $1,20Carichi veloci, ad alto volume e a basso costo

Cinque modelli a colpo d'occhio. Indice di intelligenza di Artificial Analysis, prezzi di listino pubblicati delle API e dove ciascuno si guadagna lo stipendio. Il resto dell'articolo spiega perché la riga evidenziata non è tutta la storia.

Il dato centrale: Fable guida, Sol resta un punto dietro a un terzo del prezzo

Claude Fable 5 ha segnato 60 sull’indice di intelligenza di Artificial Analysis. GPT-5.6 Sol al massimo ragionamento ha segnato 59. Artificial Analysis ha collocato il costo di Sol intorno a 1,04 dollari per attività in quella valutazione, circa un terzo di quello di Fable. Sol si è anche preso la testa dell’indice degli agenti di programmazione con un punteggio di 80.

Indice di intelligenza di Artificial Analysis

+2% vs baseline
Claude Fable 560
GPT-5.6 Sol59
Un punto di distanza in cima. Sull'indice generale Fable tiene un vantaggio minimo, di quelli che spariscono appena guardi il costo.

Questo non è un knockout. È un cambiamento nell’economia del mercato.

Fable può restare la scelta giusta per il problema singolo più duro, quello in cui il costo del modello pesa meno della probabilità di una risposta corretta. Sol sembra il default migliore per lavoro di frontiera ripetuto, soprattutto per qualsiasi cosa tu esegua molte volte al giorno.

Cosa cambia davvero GPT-5.6

Sol: vicino a Fable, nettamente più economico

GPT-5.6 Sol costa 4 dollari per milione di token in ingresso e 20 in uscita. Fable 5 costa 10 e 50.

Il prezzo per token da solo non dice mai la verità, perché i modelli spendono quantità diverse di ragionamento, compiono un numero diverso di passi e richiedono una quantità diversa di correzione umana. Ma il dato indipendente sul costo per attività dice che il vantaggio di Sol è più di un trucco da tabella prezzi.

Costo di Sol per attività

1,04 $

valutazione Artificial Analysis

Costo di Fable rispetto a Sol

~3x

più economico

stesso benchmark

Sol, indice agenti di programmazione

80

leader attuale

La tesi di Sol non è che vinca ogni classifica. È che atterra accanto a Fable sulla qualità costando una frazione per lavoro completato.

Claire Vo ha messo alla prova Sol, Terra, Luna, Fable e Sonnet su documenti di prodotto, prototipi, wireframe, debugging e voce agentica. Sol ha vinto il test complessivo, con i risultati migliori su documenti di prodotto, prototipazione e uso del browser. Il problema di Fable non era la capacità pura. Era un eccesso di precisione e uno stile di collaborazione più faticoso durante il lavoro stesso.

Le prime testimonianze degli sviluppatori vanno nella stessa direzione. Descrivono Sol come vicino a Fable, ma più veloce, più economico e più affidabile sui cambiamenti che toccano più livelli di un sistema insieme. Aneddoti, non esperimenti controllati, ma la direzione coincide con i numeri indipendenti.

Fable non ha perso sulla capacità. Ha perso su quanta fatica costava lavorarci insieme.

La nota ricorrente nei primi test incrociati fra modelli

Terra è forse il modello più importante del rilascio

Sol si prende l’attenzione. Terra ha forse l’impatto operativo maggiore.

Terra costa 2 dollari per milione di token in ingresso e 12 in uscita. OpenAI lo descrive come competitivo con GPT-5.5 a metà prezzo. Artificial Analysis gli ha dato 55 sull’indice, quattro punti dietro Sol.

Basta per una quota grossa del lavoro reale di produzione:

Analisi di business

Terra

Legge, sintetizza e ragiona su materiale disordinato abbastanza bene da preparare una decisione.

Documenti e ricerca

Terra

Lo strato di volume della produzione professionale: bozze, estrazione, sintesi fra più fonti.

Generazione e refactoring di codice

Terra

Modifiche di difficoltà media con perimetro chiaro, non le scelte architetturali ambigue.

Strumenti ed esecuzione di agenti

Terra

Esecuzioni a più passi dove il piano è definito e il modello lo porta a termine.

Non tutti i benchmark, ma abbastanza attività di produzione da far perdere senso al pagare Sol di default.

Non tutti sono convinti. Alcuni osservano che Terra segna sotto GPT-5.5 su diversi benchmark singoli e si comporta più come un modello medio distillato che come un Sol economico. È giusto. Un punteggio aggregato alto non significa qualità uniforme su ogni carico. Ma per un’azienda la domanda non è “Terra vince ogni valutazione?”. È:

Terra porta a termine abbastanza nostre attività da rendere superfluo pagare Sol di default?

Per molti carichi la risposta è sì.

Luna mostra quanto in fretta la capacità stia diventando economica

GPT-5.6 Luna costa 0,20 dollari per milione di token in ingresso e 1,20 in uscita. Ha segnato 51,2 sull’indice, appena sotto Sonnet 5 al massimo ragionamento.

Questo non significa che Luna batta Sonnet su ogni attività. Sonnet può essere molto migliore su lavoro agentico, di programmazione o di lunga durata. Quello che Luna mostra è la pressione sui prezzi che GPT-5.6 crea: capacità che fino a poco fa richiedeva un modello di frontiera costoso adesso sta in una fascia da venti centesimi in ingresso.

Dove Luna è la scelta razionale

Giudica Luna dal lavoro che sblocca sul piano economico, non dal fatto che batta Fable sul problema più difficile possibile.

Classificazione ed estrazione

Alto volume, bassa ambiguità, passa o non passa. Il lavoro classico del modello economico.

Elaborazione di contenuti in massa

Prime bozze, varianti e riscritture su scala, dove comunque un umano rivede l'output.

Agenti semplici e instradamento

Smista un'attività, decide la difficoltà e manda le più dure a un livello più forte.

Quindi l’architettura migliore non è Sol per tutto. Instrada il lavoro per difficoltà e rischio.

Attività in arrivo
smistamento
Lunavolume · rischio basso
troppo difficile
Terralavoro professionale quotidiano
posta in gioco alta
Solsolo i problemi più duri
L'instradamento a livelli che batte un singolo modello di default: il modello più economico in grado di chiudere il lavoro, con escalation solo quando non ce la fa

Fable 5 ha ancora l’argomento più forte sulla capacità pura

Claude Fable 5 resta primo sull’indice generale e rende particolarmente bene su attività analitiche lunghe, programmazione agentica, prototipazione, lavoro su fogli di calcolo e problemi che richiedono di verificarsi da soli. I primi partner di Anthropic lo hanno descritto come capace di portare a termine lavoro che prima richiedeva molti prompt, e di rileggere e controllare il proprio output al livello di sforzo massimo.

Fable ha anche segnato 80 % su SWE-Bench Pro contro il 64,6 % di Sol. Ma Sol ha guidato Terminal-Bench 2.1 con l’88,8 % contro l’83,1 % di Fable.

SWE-Bench Pro

+24% vs baseline
Claude Fable 580%
GPT-5.6 Sol64.6%
Risolvere problemi definiti dentro un repository: il terreno di casa di Fable, vantaggio netto.

Terminal-Bench 2.1

+7% vs baseline
GPT-5.6 Sol88.8%
Claude Fable 583.1%
Lavoro dentro un terminale: se lo prende Sol. Gli stessi due modelli, risultato opposto. Per questo 'il miglior modello per programmare' è un'etichetta inutile.

I due benchmark misurano lavori diversi, e l’ambiente conta quanto il modello:

  • SWE-Bench premia la risoluzione di problemi definiti in un repository.
  • Terminal-Bench valuta il lavoro dentro un ambiente di terminale.
  • Codex e Claude Code aggiungono sopra i propri ambienti, istruzioni di sistema, gestione del contesto e strategie di strumenti.

Lo stesso modello di base rende in modo diverso attraverso una API grezza, dentro Claude Code, dentro Codex o dentro il framework di agenti di terze parti. Giudica l’ambiente, non solo i pesi.

Gli svantaggi veri di Fable sono costo e accesso. Dopo la sospensione temporanea il modello è tornato ovunque, ma parecchi utenti hanno criticato Anthropic per aver spostato l’uso di Fable fuori dalle quote normali di abbonamento e dentro crediti a pagamento separati. Fable può essere il miglior specialista senza essere il miglior dipendente di default.

Sonnet 5: un modello capace con un problema di posizionamento

Sonnet 5 doveva rispondere a una domanda semplice: quale modello Claude dovrebbe usare la gente tutti i giorni?

La storia di prodotto è attraente. Sonnet 5 è disponibile su tutti i piani Claude, è il default su Free e Pro, gira dentro Claude Code e costa 2 dollari per milione di token in ingresso e 10 in uscita. Era partito come prezzo introduttivo in scadenza il 31 agosto 2026, ma Anthropic ha confermato che l’aumento previsto a 3 e 15 non ci sarà e che 2 / 10 è ormai il prezzo standard. Anthropic lo presenta come nettamente più agentico di Sonnet 4.6: migliore nel chiudere attività a più passi, nel controllare il proprio output e nel lavorare su codebase esistenti e disordinate. I partner con accesso anticipato hanno riportato buoni risultati su debugging, uso degli strumenti, test e codice preesistente.

Il quadro indipendente è più disomogeneo.

Questo non rende debole Sonnet 5. Suggerisce che pianificare lavoro molto ambiguo non è il suo ruolo naturale. Una divisione più razionale:

Il lavoroLa mia sceltaPerché
Architettura, pianificazione, lavoro ad alta incertezzaFable o SolLa parte costosa è sbagliare. Paga per il modello con meno probabilità di mandarti sulla strada sbagliata.
Implementare un'attività ben specificataSonnet 5Il perimetro è fissato, il lavoro è eseguire. Qui la sua forza agentica si vede e il prezzo torna.
Analisi ed esecuzione quotidiana a buon costoTerraQualità vicina alla frontiera a metà del modello di punta, per il grosso della produzione professionale.
Scala e flussi a basso rischioLunaVolume che prima non giustificava mai un modello di frontiera e adesso gira a venti centesimi per milione in ingresso.

Abbina il modello al rischio dell'attività, non a una riga di classifica.

Operatore al lavoro a tarda sera a una scrivania con portatile, quaderno e un piccolo scaffale di libri, luci della città dietro la finestra
La scelta non è più quale modello sia più intelligente. È quale ambiente porta a termine il tuo lavoro.

La gara vera: ChatGPT Work e Codex contro Claude Cowork e Claude Code

I confronti fra soli modelli descrivono ogni mese peggio la produttività reale.

OpenAI ha messo GPT-5.6 dentro ChatGPT, ChatGPT Work, Codex e le API. Gli utenti a pagamento scelgono Sol, Terra o Luna dentro Work e Codex e regolano lo sforzo di ragionamento. Esistono modalità max e ultra sui piani che le prevedono, e le API supportano chiamate a strumenti da programma e subagenti in parallelo. Anthropic offre un sistema paragonabile con Claude Chat, Cowork e Claude Code.

OpenAI: ChatGPT Work + Codex

conti migliori

Sol, Terra e Luna selezionabili dentro Work e Codex, controllo dello sforzo, modalità max e ultra, chiamate a strumenti da programma e subagenti in parallelo. L'attrattiva è l'integrazione più stretta con il resto di ChatGPT e conti sui modelli più aggressivi.

Anthropic: Cowork + Claude Code

sviluppo più maturo

La stessa gamma di lavori da Claude Chat, Cowork e Claude Code. Il vantaggio resta Claude Code: ancora l'esperienza di sviluppo più matura, soprattutto per muoversi con naturalezza dentro una codebase esistente e disordinata.

Questa non è più una scelta fra chatbot. È una scelta fra ambienti di esecuzione per il lavoro digitale.

I due stack si muovono fra gli stessi lavori: conversazione e analisi, documenti e file, lavoro a livello di applicazione, modifica di un repository, esecuzione di codice, delega a subagenti. Il vantaggio di Anthropic resta Claude Code, ancora l’esperienza di sviluppo più matura e la preferita da più persone, soprattutto per lavorare con naturalezza su una codebase esistente. La risposta di OpenAI è un’integrazione più stretta fra Codex e il resto di ChatGPT, più conti sui modelli più aggressivi.

I primi riscontri non incoronano un vincitore universale. Alcuni sviluppatori preferiscono ancora Claude per il frontend, perché rispetta le convenzioni del progetto e genera codice più vicino all’intenzione. Altri raccontano che Codex con Sol è più affidabile quando un problema attraversa più livelli di un sistema, e che si incastra meno in una soluzione locale.

Cosa dicono davvero i numeri

Due conclusioni sopravvivono a tutte le riserve.

Primo: la distanza di capacità fra il modello di punta e le fasce economiche si sta stringendo. Un punto separa Fable da Sol sull’indice generale. Quattro punti separano Sol da Terra. I modelli premium non sono più un altro campionato, solo un altro prezzo.

Secondo: il prezzo per token non è il numero che conta. Un modello più economico può costare di più per risultato quando genera più token di ragionamento, compie più passi o richiede più correzione. Il costo per risultato completato è l’unica cifra che tocca un conto economico, e non compare su nessuna pagina di prezzi.

Quello che mostra la pagina prezzi

Costo per token

Quello che arriva davvero sul tuo budget

Costo per risultato completato

La metrica che decide tutto, e quella che nessun annuncio di lancio mette sulla slide

Come instraderei il lavoro

Per la maggior parte del lavoro professionale: Terra

Terra è il punto di partenza migliore per analisi, ricerca, documenti, contenuti e programmazione di difficoltà media. Sol dovrebbe essere un percorso di escalation, non il default universale.

Per i problemi più duri: Sol o Fable

Fable tiene un vantaggio complessivo minimo e rende con forza su attività lunghe e complesse. Sol offre una capacità vicina con conti molto migliori ed è il default più pragmatico per un’organizzazione.

Dentro Claude Code: Sonnet esegue, Fable pianifica

Sonnet 5 si adatta all’implementazione ben definita. Sul lavoro architetturale ambiguo, usare un modello più forte per preparare il piano costa di solito meno che correggere tre volte quello economico.

Per automazione ad alto volume: Luna

Non giudicare Luna dal fatto che batta Fable sul problema più difficile. Il suo valore sta nell’abilitare intere categorie di lavoro che prima non giustificavano economicamente l’AI di frontiera.

Verdetto finale

OpenAI non doveva sconfiggere Fable in modo netto. Doveva solo arrivarci vicino a un costo molto più basso, e poi distribuire la stessa generazione di capacità su tre fasce economiche. Il risultato è che “quale modello è il migliore?” sta diventando una domanda sempre più debole.

Domande migliori:

  • Quale modello porta davvero a termine il mio flusso di lavoro specifico?
  • Quanta supervisione richiede?
  • Quanto costa un risultato corretto, non un milione di token?
  • Riesce a operare sui miei documenti, applicazioni e repository?
  • Quando il lavoro dovrebbe passare automaticamente a un modello più forte?

L’AI di frontiera non è più un modello. Sta diventando un sistema di produzione a livelli. In quel sistema non vince il modello con il numero più alto su una classifica. Vince l’architettura che manda l’attività giusta al livello di intelligenza giusto.

Domande frequenti: GPT-5.6 contro Claude 5

GPT-5.6 Luna è meglio di Claude Sonnet 5?

Sulla capacità pura no: Luna segna 51,2 sull’indice di intelligenza di Artificial Analysis e Sonnet 5 segna 53 al massimo ragionamento. Sul prezzo la distanza va nell’altra direzione e non è piccola: Luna costa 0,20 dollari per milione di token in ingresso e 1,20 in uscita, contro i 2 e 10 di Sonnet 5. È un decimo del costo in ingresso per un paio di punti di indice. Usa Luna per lavoro ad alto volume e bassa ambiguità, dove una risposta sbagliata costa poco da intercettare: classificazione, estrazione, instradamento, prime bozze. Usa Sonnet 5 quando l’attività è agentica o lunga, perché Sonnet compie meno passi per arrivare in fondo e dentro Claude Code è già integrato. La trappola è giudicare entrambi sul prezzo per token invece che sul costo per attività completata.

Qual è il modello di AI migliore adesso, GPT-5.6 o Claude 5?

Sull’indice di intelligenza di Artificial Analysis, Claude Fable 5 guida con 60 e GPT-5.6 Sol resta un punto dietro con 59, ma Sol completa il benchmark a circa un terzo del costo di Fable. GPT-5.6 Terra è forse il più utile dal punto di vista commerciale di tutti e cinque. Non esiste un vincitore unico: il modello giusto dipende dall’attività, dal costo per risultato completato e da quanta supervisione puoi permetterti.

GPT-5.6 costa meno di Claude Fable 5?

Sì. GPT-5.6 Sol costa 4 dollari per milione di token in ingresso e 20 in uscita, contro i 10 e 50 di Fable 5, e i test indipendenti hanno collocato Sol intorno a un terzo del costo di Fable per attività completata. Terra (2 / 12) e Luna (0,20 / 1,20) stanno ancora più sotto di qualsiasi livello Claude.

Conviene usare Claude Sonnet 5 dentro Claude Code?

Per implementazione ben specificata sì: è il modello di default in Claude Code ed è forte su debugging, uso degli strumenti e codebase esistenti e disordinate. Per architetture ambigue, pianifica prima con un modello più forte. Sonnet 5 può compiere più passi, consumare più contesto e costare più per attività completata di un modello superiore, quindi pianificare con lui il lavoro più difficile è spesso falsa economia.

Qual è il modello GPT-5.6 migliore per il lavoro professionale quotidiano?

Terra per la maggior parte: analisi, ricerca, lavoro sui documenti e programmazione di difficoltà media a metà del costo del modello di punta. Tieni Sol come percorso di escalation per i problemi più duri e usa Luna per carichi ad alto volume e basso rischio come classificazione, estrazione e instradamento.

Fonti e letture

Fonti primarie

Fonti di primo livello per i numeri citati sopra. I link profondi cambiano; queste sono le pagine su cui verificare le cifre aggiornate.

Se vuoi il contesto operativo intorno a tutto questo, ho scritto il mio benchmark di Claude Fable 5 contro Opus e Sonnet e lo stack di produzione con AI su cui lavoro davvero. Stesso principio di qui: il modello è uno strato, e il lavoro è il sistema che gli smista il lavoro intorno.

Sull'autore

Wojciech Łuszczyński

Wojciech Łuszczyński

GTM Architect e growth operator che costruisce sistemi di ricavi nativi per l'AI per aziende B2B SaaS e tecnologiche. Collego posizionamento, SEO, contenuti, acquisizione a pagamento, CRM, automazione, analytics e flussi di lavoro con AI in un'infrastruttura di crescita che funziona.

Newsletter

Ricevi il prossimo per primo.

Quando pubblico un articolo nuovo su sistemi di AI, architettura GTM o modelli operativi di crescita, lo saprai per primo.

Iscriviti