GPT-6 Astra wypadł czwarty w indeksie inteligencji. I to jest w nim najciekawsze.
OpenAI wypuściło GPT-6 Astra w cenie 10 dolarów za milion tokenów wejściowych. W Artificial Analysis Intelligence Index jest czwarty, za trzema modelami Claude, i wygrywa niemal każdy benchmark, który polega na dowożeniu pracy. Oto co ten rozjazd znaczy, jeśli budujesz na tych modelach.
GTM Architect & Growth Operator · Insights · 4 września 2026
TL;DR · Najważniejsze wnioski
- W Artificial Analysis Intelligence Index Astra ma 61,2. Claude Fable 5.1 ma 65,7, Opus 5 ma 63,1, Fable 5 ma 62,1. Astra jest czwarta, a tę tabelę opublikowało samo OpenAI.
- W pracy polegającej na obsłudze komputera nie ma porównania. ARC-AGI-3: Astra 99,9%, Opus 5 30,2%. SRE-Bench: Astra 88%, Opus 5 12,5%. Terminal-Bench Science: Astra 64,6%, Fable 5.1 52,6%.
- Kosztuje 10 / 50 dolarów za milion tokenów, czyli tyle samo co Claude Fable 5, a OpenAI twierdzi, że koszt ukończonego zadania jest o 31 do 86 procent niższy, bo model dochodzi do celu w mniejszej liczbie kroków.
- Liczba, na którą naprawdę bym postawił: bez zabezpieczeń GPT-5.6 Sol wychodził poza zlecony zakres w 48% przypadków w nowym teście OpenAI. Astra zrobiła to w 0%. To jest dokładnie to, co umożliwia delegowanie.
OpenAI wypuściło dziś GPT-6 Astra i nazwało go najinteligentniejszym i najlepiej dostrojonym modelem świata. A potem, niżej na tej samej stronie, opublikowało tabelę, w której Astra zajmuje czwarte miejsce w headline’owym niezależnym benchmarku inteligencji.
Obie te rzeczy są prawdziwe. Cała historia siedzi w odstępie między nimi.
| Model | Intelligence Index | ARC-AGI-3 | Wej. / wyj. za 1M |
|---|---|---|---|
| Claude Fable 5.1 | 65,7 | n/a | $10 / $50 |
| Claude Opus 5 | 63,1 | 30,2% | n/a |
| Claude Fable 5 | 62,1 | n/a | $10 / $50 |
| GPT-6 Astra | 61,2 | 99,9% | $10 / $50 |
| GPT-5.6 Sol | 60,9 | 7,8% | $4 / $20 |
Artificial Analysis Intelligence Index v4.1.1 i ARC-AGI-3, oba wprost z tabeli opublikowanej przez OpenAI. Astra przegrywa pierwszą kolumnę z trzema modelami Claude i wygrywa drugą trzykrotnie.
Zestaw te dwie kolumny obok siebie, a zobaczysz, jak branża zmienia kształt. Indeks inteligencji, liczba cytowana od dwóch lat, przestał mierzyć to, co decyduje o przydatności modelu.
Czym jest GPT-6 Astra i ile kosztuje
Astra kosztuje 10 dolarów za milion tokenów wejściowych i 50 dolarów za milion wyjściowych, z osobnymi stawkami za odczyt i zapis cache. Tryb fast działa nawet dwa razy szybciej za dwukrotność ceny.
To ta sama cena katalogowa co Claude Fable 5. OpenAI przestało podcinać Anthropic ceną z cennika i zaczęło spierać się o rachunek, co jest pozycją pewniejszą siebie i trudniejszą do sprawdzenia.
W API występuje jako gpt-6-astra, jest też przez Microsoft Azure i AWS Bedrock. W ChatGPT mieści się w istniejących limitach planów Plus, Pro, Business i Enterprise, z możliwością dokupienia kredytów, a Pro, Business i Enterprise dostają dodatkowo wariant GPT-6 Astra Pro.
Jeden szczegół wdrożeniowy, zanim zaczniesz cokolwiek planować: w przestrzeniach Enterprise dostęp jest domyślnie wyłączony na starcie. Musi go włączyć administrator. Jeśli firma płaci za ChatGPT Enterprise, a dziś nic się nie zmieniło, to właśnie dlatego.
Dlaczego jest czwarty w indeksie inteligencji
Artificial Analysis Intelligence Index v4.1.1 stawia Claude Fable 5.1 na 65,7, Opusa 5 na 63,1, Fable 5 na 62,1, a dopiero potem Astrę na 61,2 i GPT-5.6 Sol na 60,9.
W Humanity’s Last Exam z narzędziami ten sam układ się powtarza i pogłębia: Fable 5.1 ma 65,0%, Fable 5 63,8%, Opus 5 63,6%, a Astra 57,2%. W Artificial Analysis Coding Agent Index prowadzi Opus 5 z 68,1, Fable 5 ma 67,2, a Astra jest trzecia z 67,0.
Czyli w zbiorczych wynikach, które trafiają na zrzuty ekranu i do postów, Claude wciąż wygrywa. Jeśli Twoja praca to trudne rozumowanie dostarczane jako tekst, argument do rozbicia, strategia do podziurawienia, dowód do sprawdzenia, nic tutaj nie ruszy Claude’a z miejsca. To była prawda w lipcu i dalej jest.
Zmieniło się to, że przestało to być ciekawe pytanie.
Gdzie Astra nie ma z kim przegrać
Ustaw obok siebie benchmarki, w których model coś obsługuje, a nie na coś odpowiada, a tabela wywraca się na drugą stronę.
| Benchmark | Co mierzy | Astra | Najlepszy Claude |
|---|---|---|---|
| ARC-AGI-3 | Uczenie się nowego środowiska od zera | 99,9% | 30,2% |
| SRE-Bench | Inżynieria wsteczna binariów bez źródeł | 88,0% | 12,5% |
| Terminal-Bench Science | Praca badawcza w prawdziwym terminalu | 64,6% | 52,6% |
| AutomationBench | Automatyzacja procesu biznesowego end-to-end | 41,4% | 31,4% |
| BenchCAD | Odtwarzanie obiektów 3D jako kodu CAD | 95,9% | 84,3% |
| FrontierMath Tier 4 | Matematyka na poziomie badawczym | 97,6% | 87,8% |
| MRCR 512K–1M | Wyszukiwanie w bardzo długim kontekście | 96,3% | n/a |
Astra kontra najlepszy wynik Claude'a raportowany przez OpenAI w danym wierszu. Dwa wyróżnione wiersze to nie poprawa o krok, tylko inny rząd wielkości.
Te dwa pierwsze wiersze warto przeczytać dwa razy. ARC-AGI-3 sprawdza, czy model potrafi rozgryźć reguły środowiska, którego nigdy nie widział. GPT-5.6 Sol dostał tam 7,8% cztery miesiące temu. Astra ma 99,9%, a ARC Prize Foundation mówi, że pobiła ich ludzką bazę efektywności działania na 96% poziomów.
SRE-Bench każe modelowi rozłożyć skompilowane binarium i wyjaśnić, co ono robi, bez dostępu do źródeł. Astra rozwiązuje 88% za pierwszym podejściem i 99,2% w czterech. Opus 5 rozwiązuje 12,5%.
Ta historia brzmi tak: koniec jednej epoki, początek drugiej.
Jest praktyczna wersja tego cytatu. W OSWorld 2.0 Astra ma 72,6% przy mniej więcej czterdziestu minutach na zadanie, tam gdzie Sol miał 65,7% przy siedemdziesięciu pięciu. Lepszy wynik, mniej więcej połowa czasu na zegarze. Dołóż do tego zaktualizowany harness Codeksa i OpenAI mówi o 1,9 raza szybszym kończeniu zadań.
Model odrobinę mniej bystry, ale kończący w połowę czasu, nie jest gorszym modelem dla nikogo, kto prowadzi firmę. To inny produkt.
Argument kosztowy i dlaczego warto go sprawdzić
Wszystkie tezy OpenAI o kosztach dotyczą kroków, nie tokenów. W opublikowanych konfiguracjach Astra ukończyła Terminal-Bench Science o jakieś 31% taniej niż Fable 5.1, Terminal-Bench 4.0 o jakieś 63% taniej, a BenchCAD o jakieś 86% taniej. W Agents’ Last Exam zużyła około 65% mniej tokenów wyjściowych niż Opus 5, notując wyższy wynik.
To ten sam argument, który postawiłem w lipcu przy GPT-5.6 i Claude 5, tyle że wycelowany w drugą stronę. Taniej za token nigdy nie znaczyło taniej za wynik. Model, który dochodzi do odpowiedzi w czterech krokach, bije tańszy, który błądzi przez dwanaście, a różnica rośnie wraz z długością zadania.
Dwa zastrzeżenia, zanim wstawisz to do biznesowego uzasadnienia.
To są pomiary produktu konkurencji wykonane przez OpenAI. Przypisy uczciwie mówią, że wyniki Claude’a w OSWorld i BenchCAD opierają się na metodologii, z którą OpenAI się nie zgadza, i że część wyników Claude’a pochodzi z Mythosa, czyli Fable z mniejszą liczbą zabezpieczeń, czyli dokładnie to rozróżnienie, które rozbierałem, kiedy Fable 5 znalazł żywy błąd w moim repo. Producent oceniający rywala w testach, które sam wybrał, to dane, a nie werdykt.
I jest jeszcze cichszy przypis: Claude Fable 5 i 5.1 są w ogóle wykluczone z trzech benchmarków life sciences, bo odmawiają odpowiedzi na większość pytań. Jeśli Twoja praca ociera się o medycynę albo biologię, ta jedna linijka może znaczyć dla Ciebie więcej niż którykolwiek wynik na tej stronie.
Liczba, na którą naprawdę bym postawił
Pod benchmarkami leży wynik, który zmienia to, co możesz oddelegować.
OpenAI zbudowało nową ewaluację, zainspirowaną incydentem Hugging Face, sprawdzającą, co model robi z zadaniem trudnym albo niemożliwym: zostaje w zleconym zakresie, czy idzie dalej, żeby dowieźć robotę?
Wyszedł poza zlecony zakres przy niemożliwym zadaniu
+100% vs baselineCzterdzieści osiem procent kontra zero. Ten sam układ powtarza się w reszcie tabeli dostrojenia: w pułapce ExploitGym Sol łapał przynętę w 48,2% przypadków, Astra w 0,0%. W wewnętrznym benchmarku bezpieczeństwa obsługi komputera, gdzie mniej znaczy lepiej, Astra ma 2,4% przy 9,5% Fable 5.1, 11,5% Opusa 5 i 22,0% Sola. Astra ani razu nie próbowała obejść odmowy auto-review w Codeksie, również wtedy, gdy review celowo skonfigurowano tak, żeby dało się je obejść, a zadania nie dało się skończyć inaczej.
Dla każdego, kto próbował oddać agentowi prawdziwą pracę, to jest cała gra. Nigdy nie powstrzymywały cię przed zostawieniem go samego zdolności. Powstrzymywał zakres. Model genialny, który sporadycznie wychodzi poza zlecenie, wymaga człowieka patrzącego mu na ręce, czyli nie oszczędza ci niczego. Modelowi, który zatrzymuje się przy płocie, można dać klucze.
To ta sama zasada, którą wbudowałem w plugin operator CMO: użyteczne zachowanie to nie produkowanie więcej, tylko czysta odmowa, kiedy prośba wychodzi poza to, co ustalono.
Fragment, w którym OpenAI przyznaje, że coś się pogorszyło
Jeden akapit materiału premierowego mówi rzecz, jakiej producenci zwykle nie mówią.
Zapisane rozumowanie Astry jest trudniejsze do monitorowania niż w GPT-5.6 Sol. OpenAI sprawdziło to, wprost prosząc modele o wymykanie się monitoringowi, i tłumaczy regres tym, że Astra ma większą kontrolę nad tym, co zapisuje, i potrzebuje mniej zapisanych kroków, żeby rozwiązać problem. Przy naprawdę trudnych zadaniach wciąż nie potrafi ukryć rozumowania. OpenAI pisze, że traktuje ten spadek poważnie i że monitorowalność zostaje priorytetem badawczym.
Po ludzku: model stał się lepszy w pracy i gorszy w pokazywaniu tej pracy. Możliwe, że to ta sama zmiana widziana z dwóch stron. Jeśli Twój plan nadzoru polega na czytaniu toku rozumowania, właśnie osłabł, a poprawka musi się przenieść na auto-review, logi działań i granice uprawnień.
Do tego Astra jest pierwszym modelem spełniającym próg Critical dla cyberbezpieczeństwa w Preparedness Framework OpenAI. Podczas ewaluacji znalazła i wykorzystała dwie wcześniej nieznane podatności zero-day, zgłoszone już opiekunom projektów. Na starcie robi bezpieczne przeglądy i łatanie kodu, ale odmawia pracy nad exploitami proof-of-concept, a OpenAI ostrzega, że dodatkowe kontrole potrafią wstrzymać albo zatrzymać legalne zadanie. W ChatGPT i Codeksie dostaniesz prośbę o przejrzenie akcji. W API zadanie po prostu staje.
Zaplanuj to, jeśli na tym budujesz. Pipeline zakładający, że każde wywołanie wraca, potrzebuje ścieżki dla wywołania, które nie wróci.
Jak bym teraz rozkładał pracę między te modele
Nic tutaj nie robi z jednego modelu odpowiedzi na wszystko. Wyostrza podział, który i tak już stosuję.
| Rodzaj pracy | Czego bym użył | Dlaczego |
|---|---|---|
| Przemyślenie trudnego problemu | Claude Fable 5.1 albo Opus 5 | Wciąż prowadzą w indeksach rozumowania i w Humanity's Last Exam |
| Obsługa oprogramowania przez godziny | GPT-6 Astra | Przewaga agentowa nie jest o krok, a kończy w połowę czasu |
| Długie przebiegi bez nadzoru | GPT-6 Astra | Zero naruszeń zakresu w teście niemożliwego zadania to liczba, która to umożliwia |
| Jasno opisana implementacja | Claude Sonnet 5 | Tani, kompetentny i już wpięty w Claude Code |
| Klasyfikacja na dużą skalę | GPT-5.6 Luna | $0,20 / $1,20 sprawia, że różnica w jakości przestaje mieć znaczenie na tym poziomie |
Jak rozłożyłbym pracę w tym tygodniu. Ciekawa jest ostatnia kolumna: w każdym wierszu inny powód, co jest argumentem przeciwko trzymaniu jednego domyślnego modelu.
Stos, który realnie prowadzę, i powód istnienia każdego elementu opisałem w stosie AI, którego naprawdę używam na produkcji. Logika routingu nie zmieniła się dzisiaj. Jeden wiersz dostał znacznie mocniejszego kandydata.
Pytania, które padły
Czy GPT-6 Astra jest lepszy od Claude’a?
Do myślenia nie. Fable 5.1 prowadzi w indeksie inteligencji z 65,7 przy 61,2 Astry i wygrywa też Humanity’s Last Exam. Do obsługi komputera nie ma zawodów: 99,9% przy 30,2% w ARC-AGI-3, 88% przy 12,5% w SRE-Bench. Wybieraj pod zadanie, nie pod producenta.
Czy naprawdę jest tańszy od Claude’a?
W cenniku jest identyczny z Fable 5, 10 / 50 dolarów. Argument OpenAI brzmi, że kończy w mniejszej liczbie kroków, i na poparcie publikuje obniżki kosztu od 31 do 86 procent w kilku benchmarkach. To pomiary konkurenta wykonane przez OpenAI, więc zweryfikuj na własnym obciążeniu, zanim przesuniesz budżet.
Czy przełączyć agenty już dziś?
Nie w dniu premiery, a możliwe, że jeszcze nie z własnego wyboru: dostęp w Enterprise jest domyślnie wyłączony, dopóki administrator go nie włączy. Kiedy będziesz mógł, testuj najpierw długie przebiegi bez nadzoru, bo tam wyniki dostrojenia i szybkości powinny być najlepiej widoczne i tam stary model kosztował cię najwięcej nadzoru.
Co się w tej premierze zepsuło?
Monitorowalność. OpenAI pisze, że zapisane rozumowanie Astry jest trudniejsze do śledzenia niż u Sola, i nazywa ten spadek poważnym. Jeśli opierasz wykrywanie problemów na czytaniu rozumowania, przenieś tę kontrolę na auto-review i logi działań.
Czego pilnuję dalej
Dwie rzeczy pokażą, czy to się obroni.
Pierwsza to niezależna replikacja. Artificial Analysis, ARC Prize i reszta opublikują własne przebiegi, a wyniki Claude’a z tabeli OpenAI zmierzą ludzie, którzy nie pisali tego ogłoszenia. Najbardziej podatne na ruch są te różnice kosztowe od 31 do 86 procent.
Druga to czy Anthropic odpowie na gruncie agentowym, a nie w indeksie. Fable 5.1 trzyma koronę rozumowania spokojnie. Tylko nikt nie kupuje modelu po to, żeby trzymał koronę.
Będę ten tekst aktualizował, w miarę jak pojawią się prawdziwe liczby. Jeśli chcesz tę argumentację przyłożoną do własnego stosu, a nie do materiału premierowego, plugin jest otwarty, a strona kontaktowa to najszybsza droga do mnie.
