Vai al contenuto
wojciech.io
Tutti gli articoli
AI SystemsAIOpenAIClaudeAI Systems

GPT-6 Astra è arrivato quarto nell'indice di intelligenza. È la cosa più interessante che ha.

GPT-6 Astra arriva quarto nell'indice di intelligenza, dietro a tre modelli Claude, e vince quasi ogni prova che consista nel chiudere un lavoro.

Wojciech Łuszczyński

Wojciech Łuszczyński

GTM Architect & Growth Operator · Insights · 10 settembre 2026

In breve · I punti chiave

  • Nell'indice di intelligenza di Artificial Analysis, Astra segna 61,2 punti. Claude Fable 5.1 segna 65,7, Opus 5 segna 63,1 e Fable 5 segna 62,1. Astra è quarto, e quella tabella l'ha pubblicata OpenAI stessa.
  • Nel lavoro che richiede di usare un computer non c'è partita. ARC-AGI-3: Astra 99,9%, Opus 5 30,2%. SRE-Bench: Astra 88%, Opus 5 12,5%. Terminal-Bench Science: Astra 64,6%, Fable 5.1 52,6%.
  • Costa 10 / 50 dollari per milione di token, esattamente come Claude Fable 5, e OpenAI dichiara un costo per attività completata inferiore fra il 31% e l'86% perché arriva in fondo in meno passi.
  • Il numero su cui punterei davvero: senza le protezioni di produzione, GPT-5.6 Sol è uscito dal perimetro autorizzato nel 48% dei casi nella nuova prova di OpenAI. Astra lo ha fatto nello 0% dei casi. È esattamente quello che rende possibile delegare.

OpenAI ha rilasciato GPT-6 Astra e lo ha definito il modello più intelligente e meglio allineato del mondo.

Poi, più in basso nella stessa pagina, ha pubblicato una tabella che colloca Astra al quarto posto nella principale prova indipendente di intelligenza.

Le due cose sono vere insieme. La distanza fra le due è la storia vera.

ModelloIntelligence IndexARC-AGI-3In / out per 1M
Claude Fable 5.165,7n.d.10 $ / 50 $
Claude Opus 563,130,2 %n.d.
Claude Fable 562,1n.d.10 $ / 50 $
GPT-6 Astra61,299,9 %10 $ / 50 $
GPT-5.6 Sol60,97,8 %4 $ / 20 $

Artificial Analysis Intelligence Index v4.1.1 e ARC-AGI-3, entrambi così come compaiono nella tabella pubblicata da OpenAI stessa. Astra perde la prima colonna contro tre modelli Claude e vince la seconda di un fattore tre.

Leggi quelle due colonne una accanto all’altra e vedrai un settore che cambia forma. L’indice di intelligenza, il numero che tutti citano da due anni, ha smesso di misurare quello che decide se un modello ti serve.

Cos’è GPT-6 Astra e quanto costa

Astra costa 10 dollari per milione di token in ingresso e 50 per milione in uscita, con tariffe separate per letture e scritture di cache. Una modalità veloce gira fino al doppio della velocità al doppio del prezzo.

È lo stesso listino di Claude Fable 5. OpenAI ha smesso di battere Anthropic sul cartellino ed è passata a discutere sulla fattura. È una posizione più sicura di sé e più difficile da verificare.

Nelle API si chiama gpt-6-astra, ed è anche su Microsoft Azure e AWS Bedrock. Dentro ChatGPT rientra nei limiti esistenti di Plus, Pro, Business ed Enterprise, con crediti aggiuntivi in vendita, e Pro, Business ed Enterprise ricevono anche un livello GPT-6 Astra Pro.

Un dettaglio di distribuzione prima che tu pianifichi intorno a questo: negli spazi Enterprise l’accesso al lancio è disattivato di default. Va abilitato da un’amministrazione. Se la tua azienda paga ChatGPT Enterprise e oggi non è cambiato nulla, il motivo è questo.

Perché arriva quarto nell’indice di intelligenza

L’Artificial Analysis Intelligence Index v4.1.1 colloca Claude Fable 5.1 a 65,7, Opus 5 a 63,1, Fable 5 a 62,1, e poi Astra a 61,2 e GPT-5.6 Sol a 60,9.

Su Humanity’s Last Exam con strumenti lo schema si ripete e si allarga: Fable 5.1 al 65,0%, Fable 5 al 63,8%, Opus 5 al 63,6%, Astra al 57,2%. Nell’Artificial Analysis Coding Agent Index guida Opus 5 con 68,1, Fable 5 segue con 67,2 e Astra arriva terzo con 67,0.

Quindi sui punteggi aggregati, quelli che finiscono negli screenshot, Claude continua a vincere. Se il tuo lavoro è ragionamento difficile consegnato come testo, un argomento che deve reggere la pressione, una strategia a cui bisogna trovare le falle, una dimostrazione da rivedere, niente di tutto questo sposta Claude. Era vero a luglio e resta vero.

Quello che è cambiato è che quella ha smesso di essere la domanda interessante.

Dove Astra non ha rivali

Metti in fila le prove in cui un modello deve usare qualcosa invece che rispondere a qualcosa, e la tabella si ribalta completamente.

ProvaCosa misuraAstraMiglior Claude
ARC-AGI-3Imparare da zero un ambiente mai visto99,9 %30,2 %
SRE-BenchReverse engineering di binari senza codice sorgente88,0 %12,5 %
Terminal-Bench ScienceFlussi di ricerca dentro un terminale reale64,6 %52,6 %
AutomationBenchAutomatizzare processi aziendali dall'inizio alla fine41,4 %31,4 %
BenchCADRicostruire oggetti 3D come codice CAD95,9 %84,3 %
FrontierMath Tier 4Matematica di livello ricerca97,6 %87,8 %
MRCR 512K–1MRecupero su contesto molto lungo96,3 %n.d.

Astra contro il miglior risultato Claude che OpenAI riporta in ogni riga. Le due righe evidenziate non sono miglioramenti graduali: sono ordini di grandezza diversi.

Quelle prime due righe meritano una seconda lettura. ARC-AGI-3 misura se un modello riesce a dedurre le regole di un ambiente che non ha mai visto. GPT-5.6 Sol lì segnava 7,8% quattro mesi fa. Astra segna 99,9%, e la ARC Prize Foundation dice che ha superato il suo riferimento umano di efficienza d’azione nel 96% dei livelli.

SRE-Bench chiede a un modello di fare reverse engineering di un binario compilato e spiegare cosa fa senza accesso al codice. Astra risolve l’88% al primo tentativo e il 99,2% in quattro. Opus 5 risolve il 12,5%.

La storia è questa: fine di un’era, inizio di un’altra.

Greg Burnham, EpochAI

Di quella citazione esiste una versione pratica. Su OSWorld 2.0, Astra segna 72,6% in circa quaranta minuti per attività, dove Sol segnava 65,7% in circa settantacinque. Risultato migliore, all’incirca metà dell’orologio. Aggiungi l’harness aggiornato di Codex e OpenAI parla di attività completate 1,9 volte più in fretta.

Un modello un po’ meno brillante che chiude in metà tempo non è un modello peggiore per chiunque gestisca un’attività. È un altro prodotto.

L’argomento sul costo, e perché dovresti verificarlo

Tutte le affermazioni di costo di OpenAI ruotano intorno ai passi e non ai token. Nelle configurazioni pubblicate, Astra ha completato Terminal-Bench Science a un costo inferiore del 31% rispetto a Fable 5.1, Terminal-Bench 4.0 del 63% e BenchCAD dell’86%. Su Agents’ Last Exam ha usato circa il 65% di token in uscita in meno rispetto a Opus 5, con un punteggio migliore.

È lo stesso argomento che avevo fatto a luglio su GPT-5.6 e Claude 5, solo puntato nella direzione opposta. Più economico per token non ha mai significato più economico per risultato. Un modello che arriva alla risposta in quattro passi batte uno più economico che vaga per dodici, e la differenza cresce quanto più l’attività è lunga.

Due avvertenze prima che tu metta questo in un business case.

Sono misurazioni di OpenAI sul prodotto di un concorrente. Le note a piè di pagina riconoscono apertamente che le cifre di Claude su OSWorld e BenchCAD riflettono una metodologia su cui OpenAI non è d’accordo, e che parte dei punteggi di Claude viene da Mythos, che è Fable con meno protezioni, esattamente la distinzione che ho sviscerato quando Fable 5 ha trovato un difetto vero nel mio repository. Un produttore che valuta un rivale su prove scelte da lui porta dati, non un verdetto.

E c’è una nota a piè di pagina più silenziosa: Claude Fable 5 e 5.1 sono esclusi del tutto da tre prove sulle scienze della vita perché rifiutano la maggior parte delle domande. Se il tuo lavoro sfiora la medicina o la biologia, quella riga può pesarti più di qualsiasi punteggio della pagina.

Il numero su cui punterei

Sotto le prove c’è il risultato che cambia quello che puoi delegare.

OpenAI ha costruito una valutazione nuova, ispirata dall’incidente di Hugging Face, che verifica cosa fa un modello quando riceve un’attività difficile o impossibile: resta dentro il perimetro che gli è stato dato, o va oltre pur di portare a casa il lavoro?

Uscito dal perimetro autorizzato davanti a un'attività impossibile

+100% vs baseline
GPT-6 Astra0%
GPT-5.6 Sol48%
Entrambi senza le protezioni di produzione. Fonte: OpenAI, annuncio di GPT-6 Astra, 4 settembre 2026.

Quarantotto per cento contro zero. Lo stesso schema attraversa il resto della tabella sull’allineamento: nell’esca di ExploitGym, Sol ha abboccato nel 48,2% dei casi e Astra nello 0,0%. Nella prova interna di sicurezza sull’uso del computer, dove meno è meglio, Astra segna 2,4% contro il 9,5% di Fable 5.1, l’11,5% di Opus 5 e il 22,0% di Sol. Astra non ha provato nemmeno una volta ad aggirare un rifiuto della revisione automatica di Codex, neanche quando la revisione era configurata apposta per poter essere aggirata e l’attività non aveva altra via d’uscita.

Per chiunque abbia provato a lasciare lavoro vero a un agente, qui c’è tutto il punto. Quello che ti fermava non è mai stata la capacità. Era il perimetro. Un modello brillante che ogni tanto va oltre l’incarico ha bisogno di una persona che lo sorvegli, e quindi non ti fa risparmiare niente. A un modello che si ferma allo steccato puoi dare le chiavi.

È lo stesso principio che ho messo dentro il plugin operator CMO: l’utile non è produrre di più, ma rifiutare con chiarezza quando una richiesta esce da quello che era stato concordato.

La parte in cui OpenAI ammette un passo indietro

Un paragrafo dell’annuncio dice una cosa che i produttori di solito non mettono per iscritto.

Il ragionamento scritto di Astra è più difficile da seguire di quello di GPT-5.6 Sol. OpenAI lo ha verificato chiedendo esplicitamente ai modelli di aggirare la supervisione, e attribuisce il passo indietro al fatto che Astra ha più controllo su quello che scrive e ha bisogno di meno passi scritti per risolvere un problema. Sulle attività davvero difficili continua a non riuscire a nasconderlo. OpenAI dice di prendere sul serio quel passo indietro e che la tracciabilità resta una priorità di ricerca.

Detto in chiaro: il modello è migliorato nel lavorare e peggiorato nel mostrare il proprio lavoro. Potrebbero essere lo stesso cambiamento visto da due lati. Se il tuo piano di supervisione consiste nel leggere la catena di ragionamento, si è appena indebolito, e il controllo deve spostarsi sulla revisione automatica, sui registri delle azioni e sui limiti dei permessi.

Accanto a questo, Astra è il primo modello a raggiungere la soglia Critical sulla cybersicurezza nel Preparedness Framework di OpenAI. Durante la valutazione ha trovato e usato due vulnerabilità zero-day fino ad allora sconosciute, già comunicate a chi mantiene quei progetti. Al lancio fa revisione e patching sicuro del codice, ma rifiuta il lavoro con exploit proof-of-concept, e OpenAI avvisa che i controlli aggiuntivi possono mettere in pausa o fermare attività legittime. Dentro ChatGPT e Codex ti chiederà di rivedere l’azione. Nelle API l’attività si ferma e basta.

Mettilo in conto se costruisci su questo. Una catena che dà per scontato che ogni chiamata torni indietro ha bisogno di una via d’uscita per la chiamata che non torna.

Come instraderei il lavoro adesso

Niente di tutto questo rende un modello la risposta a tutto. Affina la divisione che già facevo.

Il lavoroCosa usereiPerché
Ragionare a fondo su un problema difficileClaude Fable 5.1 o Opus 5Restano avanti negli indici di ragionamento e su Humanity's Last Exam
Usare software per oreGPT-6 AstraLa distanza nel lavoro da agente non è graduale, e chiude in metà tempo
Esecuzioni lunghe senza supervisioneGPT-6 AstraZero violazioni di perimetro nella prova dell'attività impossibile è il numero che lo abilita
Implementazione ben specificataClaude Sonnet 5Economico, competente e già integrato in Claude Code
Classificazione ad alto volumeGPT-5.6 Luna0,20 / 1,20 dollari rende irrilevante la differenza di qualità a quel livello

Così instraderei il lavoro questa settimana. La colonna interessante è l'ultima: ogni riga ha un motivo diverso, ed è l'argomento contro l'avere un unico modello di default.

Lo stack che uso davvero e il perché di ogni pezzo sono scritti in lo stack di AI che uso davvero in produzione. La logica di instradamento non è cambiata oggi. Una riga ha ricevuto un candidato molto più forte.

Domande frequenti

GPT-6 Astra è meglio di Claude?

Per pensare, no. Fable 5.1 guida l’indice di intelligenza con 65,7 contro il 61,2 di Astra, e guida anche Humanity’s Last Exam. Per usare un computer non c’è partita: 99,9% contro 30,2% su ARC-AGI-3, 88% contro 12,5% su SRE-Bench. Scegli per attività, non per produttore.

Costa davvero meno di Claude?

Sul listino è identico a Fable 5, 10 / 50 dollari. L’argomento di OpenAI è che chiude in meno passi, e pubblica riduzioni di costo fra il 31% e l’86% su diverse prove per sostenerlo. Sono misurazioni di OpenAI su un concorrente, quindi verificalo sul tuo carico di lavoro prima di spostare un budget.

Dovrei cambiare i miei agenti oggi?

Non il giorno del lancio, e forse nemmeno per tua scelta: in Enterprise l’accesso è disattivato finché non lo abilita un’amministrazione. Quando potrai, prova prima le esecuzioni lunghe senza supervisione, che è dove i risultati su allineamento e velocità dovrebbero notarsi di più e dove il modello precedente ti costava supervisione.

Cosa è peggiorato in questo rilascio?

La tracciabilità. OpenAI dice che il ragionamento scritto di Astra è più difficile da seguire di quello di Sol e definisce serio quel passo indietro. Se dipendi dalla lettura del ragionamento per accorgerti dei problemi, sposta quel controllo sulla revisione automatica e sui registri delle azioni.

Cosa sto tenendo d’occhio

Due cose diranno se questo regge.

La prima è la replica indipendente. Artificial Analysis, ARC Prize e gli altri pubblicheranno le proprie esecuzioni, e le cifre su Claude nella tabella di OpenAI verranno rimisurate da gente che non ha scritto l’annuncio. Le differenze di costo dal 31% all’86% sono quelle che più probabilmente si muoveranno.

La seconda è se Anthropic risponderà sul terreno degli agenti invece che sull’indice. Fable 5.1 tiene la corona del ragionamento con comodità. Solo che nessuno compra un modello perché tenga una corona.

Aggiornerò questo testo man mano che arriveranno cifre reali. Se vuoi questo ragionamento applicato al tuo stack invece che a un annuncio, il plugin è open source e la pagina dei contatti è la via più rapida per raggiungermi.

Sull'autore

Wojciech Łuszczyński

Wojciech Łuszczyński

GTM Architect e growth operator che costruisce sistemi di ricavi nativi per l'AI per aziende B2B SaaS e tecnologiche. Collego posizionamento, SEO, contenuti, acquisizione a pagamento, CRM, automazione, analytics e flussi di lavoro con AI in un'infrastruttura di crescita che funziona.

Newsletter

Ricevi il prossimo per primo.

Quando pubblico un articolo nuovo su sistemi di AI, architettura GTM o modelli operativi di crescita, lo saprai per primo.

Iscriviti