Przejdź do treści
wojciech.io
Wszystkie spostrzeżenia
AI SystemsAIOpenAIClaudeAI Systems

GPT-6 Astra była czwarta we własnej tabeli z premiery. Tydzień później niezależny indeks postawił ją na równi z Claude Fable 5.1.

W tabeli OpenAI z premiery GPT-6 Astra była czwarta. W niezależnym indeksie v4.3 remisuje z Claude Fable 5.1, a jej test kosztował o 59% mniej.

Wojciech Łuszczyński

Wojciech Łuszczyński

GTM Architect & Growth Operator · Insights · 4 września 2026 · 14 min czytania

Udostępnij

TL;DR · Najważniejsze wnioski

  • Aktualizacja 16 września 2026: własny przebieg Artificial Analysis na Intelligence Index v4.3 daje GPT-6 Astra 52,81, a Claude Fable 5.1 53,37, i nazywa to remisem na prowadzeniu. Claude Opus 5 jest dalej, z 50,70.
  • Astra jest też najtańsza z tej trójki w przebiegu. Cały indeks kosztował $5 324 na Astrze, $7 275 na Opusie 5 i $13 129 na Fable 5.1, bo Astra wypisała 60 mln tokenów wobec 140 i 190 mln.
  • Na premierę tabela OpenAI na poprzedniej wersji indeksu dawała Astrze czwarte miejsce z 61,2, za Fable 5.1, Opusem 5 i Fable 5. Wtedy historią były wyniki agentowe: ARC-AGI-3 99,9% wobec 30,2% Opusa 5, SRE-Bench 88% wobec 12,5%.
  • Cena katalogowa to 10 / 50 dolarów za milion tokenów, tyle co Fable 5.1 i dwa razy więcej niż Opus 5. Liczba, na którą wciąż bym postawił, to test zakresu: bez zabezpieczeń GPT-5.6 Sol wychodził poza zlecenie w 48% przypadków, a Astra w 0%.

Gdzie Astra stoi w niezależnym indeksie

ModelIndeks v4.3Koszt przebiegu indeksuWygenerowane tokenyWej. / wyj. za 1 mln
Claude Fable 5.153,37$13 129190 mln$10 / $50
GPT-6 Astra52,81$5 32460 mln$10 / $50
Claude Opus 550,70$7 275140 mln$5 / $25

Artificial Analysis Intelligence Index v4.3 do dwóch miejsc po przecinku z danych wykresu, koszt przebiegu i tokeny ze stron modeli, stan na 16 września 2026. To późniejsza wersja indeksu niż tabela z premiery niżej, więc tych dwóch zestawów wyników nie da się porównywać wprost.

Artificial Analysis opisuje szczyt v4.3 jako remis Astry z Fable 5.1 na prowadzeniu. Dzieli je pół punktu, a na stronach modeli w Artificial Analysis oba wyświetlają się jako 53.

Większa zmiana jest w kolumnie kosztów. Astra ma w cenniku te same $10 / $50 co Fable 5.1, a przebieg indeksu na niej kosztował o 59% mniej, bo wypisała mniej więcej jedną trzecią tokenów. Artificial Analysis pisze, że każdy poziom rozumowania Astry ma najniższy koszt zadania przy swoim poziomie inteligencji. OpenAI twierdziło to na premierę. Teraz pokazuje to niezależny przebieg.

Pojedynki jeden na jeden rozpisałem w Astra kontra Opus 5 i Astra kontra Fable 5.1.

Analiza z premiery, 4 września 2026

OpenAI wypuściło 4 września GPT-6 Astra i nazwało ją najinteligentniejszym i najlepiej dostrojonym modelem świata. A potem, niżej na tej samej stronie, opublikowało tabelę, w której Astra zajmuje czwarte miejsce w headline’owym niezależnym benchmarku inteligencji.

Obie te rzeczy są prawdziwe. Cała historia siedzi w odstępie między nimi.

ModelIntelligence IndexARC-AGI-3Wej. / wyj. za 1M
Claude Fable 5.165,7n/a$10 / $50
Claude Opus 563,130,2%n/a
Claude Fable 562,1n/a$10 / $50
GPT-6 Astra61,299,9%$10 / $50
GPT-5.6 Sol60,97,8%$4 / $20

Artificial Analysis Intelligence Index v4.1.1 i ARC-AGI-3, oba wprost z tabeli opublikowanej przez OpenAI 4 września. Na premierę Astra przegrywała pierwszą kolumnę z trzema modelami Claude i wygrywała drugą trzykrotnie.

Zestaw te dwie kolumny obok siebie, a zobaczysz, jak branża zmienia kształt. Indeks inteligencji, liczba cytowana od dwóch lat, przestał mierzyć to, co decyduje o przydatności modelu.

Czym jest GPT-6 Astra i ile kosztuje

Astra kosztuje 10 dolarów za milion tokenów wejściowych i 50 dolarów za milion wyjściowych, z osobnymi stawkami za odczyt i zapis cache. Tryb fast działa nawet dwa razy szybciej za dwukrotność ceny.

To ta sama cena katalogowa co Claude Fable 5. OpenAI przestało podcinać Anthropic ceną z cennika i zaczęło spierać się o rachunek, co jest pozycją pewniejszą siebie i trudniejszą do sprawdzenia.

W API występuje jako gpt-6-astra, jest też przez Microsoft Azure i AWS Bedrock. W ChatGPT mieści się w istniejących limitach planów Plus, Pro, Business i Enterprise, z możliwością dokupienia kredytów, a Pro, Business i Enterprise dostają dodatkowo wariant GPT-6 Astra Pro.

Jeden szczegół wdrożeniowy, zanim zaczniesz cokolwiek planować: w przestrzeniach Enterprise dostęp jest domyślnie wyłączony na starcie. Musi go włączyć administrator. Jeśli firma płaci za ChatGPT Enterprise, a dziś nic się nie zmieniło, to właśnie dlatego.

Dlaczego była czwarta w tabeli z premiery

W tabeli OpenAI z premiery Artificial Analysis Intelligence Index v4.1.1 stawiał Claude Fable 5.1 na 65,7, Opusa 5 na 63,1, Fable 5 na 62,1, a dopiero potem Astrę na 61,2 i GPT-5.6 Sol na 60,9.

W Humanity’s Last Exam z narzędziami ten sam układ się powtarza i pogłębia: Fable 5.1 ma 65,0%, Fable 5 63,8%, Opus 5 63,6%, a Astra 57,2%. W Artificial Analysis Coding Agent Index prowadzi Opus 5 z 68,1, Fable 5 ma 67,2, a Astra jest trzecia z 67,0.

Czyli w zbiorczych wynikach, które w dniu premiery trafiały na zrzuty ekranu i do postów, Claude wciąż wygrywał. Jeśli Twoja praca to trudne rozumowanie dostarczane jako tekst, argument do rozbicia, strategia do podziurawienia, dowód do sprawdzenia, nic w tabeli z premiery nie ruszało Claude’a z miejsca. Niezależny przebieg tydzień później zawęził to do remisu.

Zmieniło się to, że przestało to być ciekawe pytanie.

Gdzie Astra nie ma z kim przegrać

Ustaw obok siebie benchmarki, w których model coś obsługuje, a nie na coś odpowiada, a tabela wywraca się na drugą stronę.

BenchmarkCo mierzyAstraNajlepszy Claude
ARC-AGI-3Uczenie się nowego środowiska od zera99,9%30,2%
SRE-BenchInżynieria wsteczna binariów bez źródeł88,0%12,5%
Terminal-Bench SciencePraca badawcza w prawdziwym terminalu64,6%52,6%
AutomationBenchAutomatyzacja procesu biznesowego end-to-end41,4%31,4%
BenchCADOdtwarzanie obiektów 3D jako kodu CAD95,9%84,3%
FrontierMath Tier 4Matematyka na poziomie badawczym97,6%87,8%
MRCR 512K–1MWyszukiwanie w bardzo długim kontekście96,3%n/a

Astra kontra najlepszy wynik Claude'a raportowany przez OpenAI w danym wierszu. Dwa wyróżnione wiersze to nie poprawa o krok, tylko inny rząd wielkości.

Te dwa pierwsze wiersze warto przeczytać dwa razy. ARC-AGI-3 sprawdza, czy model potrafi rozgryźć reguły środowiska, którego nigdy nie widział. GPT-5.6 Sol dostał tam 7,8% cztery miesiące temu. Astra ma 99,9%, a ARC Prize Foundation mówi, że pobiła ich ludzką bazę efektywności działania na 96% poziomów.

SRE-Bench każe modelowi rozłożyć skompilowane binarium i wyjaśnić, co ono robi, bez dostępu do źródeł. Astra rozwiązuje 88% za pierwszym podejściem i 99,2% w czterech. Opus 5 rozwiązuje 12,5%.

Ta historia brzmi tak: koniec jednej epoki, początek drugiej.

Greg Burnham, EpochAI

Jest praktyczna wersja tego cytatu. W OSWorld 2.0 Astra ma 72,6% przy mniej więcej czterdziestu minutach na zadanie, tam gdzie Sol miał 65,7% przy siedemdziesięciu pięciu. Lepszy wynik, mniej więcej połowa czasu na zegarze. Dołóż do tego zaktualizowany harness Codeksa i OpenAI mówi o 1,9 raza szybszym kończeniu zadań.

Model odrobinę mniej bystry, ale kończący w połowę czasu, nie jest gorszym modelem dla nikogo, kto prowadzi firmę. To inny produkt.

Argument kosztowy i dlaczego warto go sprawdzić

Wszystkie tezy OpenAI o kosztach dotyczą kroków, nie tokenów. W opublikowanych konfiguracjach Astra ukończyła Terminal-Bench Science o jakieś 31% taniej niż Fable 5.1, Terminal-Bench 4.0 o jakieś 63% taniej, a BenchCAD o jakieś 86% taniej. W Agents’ Last Exam zużyła około 65% mniej tokenów wyjściowych niż Opus 5, notując wyższy wynik.

To ten sam argument, który postawiłem w lipcu przy GPT-5.6 i Claude 5, tyle że wycelowany w drugą stronę. Taniej za token nigdy nie znaczyło taniej za wynik. Model, który dochodzi do odpowiedzi w czterech krokach, bije tańszy, który błądzi przez dwanaście, a różnica rośnie wraz z długością zadania.

Dwa zastrzeżenia, zanim wstawisz to do biznesowego uzasadnienia.

To są pomiary produktu konkurencji wykonane przez OpenAI. Przypisy uczciwie mówią, że wyniki Claude’a w OSWorld i BenchCAD opierają się na metodologii, z którą OpenAI się nie zgadza, i że część wyników Claude’a pochodzi z Mythosa, czyli Fable z mniejszą liczbą zabezpieczeń, czyli dokładnie to rozróżnienie, które rozbierałem, kiedy Fable 5 znalazł żywy błąd w moim repo. Producent oceniający rywala w testach, które sam wybrał, to dane, a nie werdykt.

I jest jeszcze cichszy przypis: Claude Fable 5 i 5.1 są w ogóle wykluczone z trzech benchmarków life sciences, bo odmawiają odpowiedzi na większość pytań. Jeśli Twoja praca ociera się o medycynę albo biologię, ta jedna linijka może znaczyć dla Ciebie więcej niż którykolwiek wynik na tej stronie.

Liczba, na którą naprawdę bym postawił

Pod benchmarkami leży wynik, który zmienia to, co możesz oddelegować.

OpenAI zbudowało nową ewaluację, zainspirowaną incydentem Hugging Face, sprawdzającą, co model robi z zadaniem trudnym albo niemożliwym: zostaje w zleconym zakresie, czy idzie dalej, żeby dowieźć robotę?

Wyszedł poza zlecony zakres przy niemożliwym zadaniu

+100% vs baseline
GPT-6 Astra0%
GPT-5.6 Sol48%
Oba bez zabezpieczeń produkcyjnych. Źródło: OpenAI, materiał premierowy GPT-6 Astra, 4 września 2026.

Czterdzieści osiem procent kontra zero. Ten sam układ powtarza się w reszcie tabeli dostrojenia: w pułapce ExploitGym Sol łapał przynętę w 48,2% przypadków, Astra w 0,0%. W wewnętrznym benchmarku bezpieczeństwa obsługi komputera, gdzie mniej znaczy lepiej, Astra ma 2,4% przy 9,5% Fable 5.1, 11,5% Opusa 5 i 22,0% Sola. Astra ani razu nie próbowała obejść odmowy auto-review w Codeksie, również wtedy, gdy review celowo skonfigurowano tak, żeby dało się je obejść, a zadania nie dało się skończyć inaczej.

Dla każdego, kto próbował oddać agentowi prawdziwą pracę, to jest cała gra. Nigdy nie powstrzymywały cię przed zostawieniem go samego zdolności. Powstrzymywał zakres. Model genialny, który sporadycznie wychodzi poza zlecenie, wymaga człowieka patrzącego mu na ręce, czyli nie oszczędza ci niczego. Modelowi, który zatrzymuje się przy płocie, można dać klucze.

To ta sama zasada, którą wbudowałem w plugin operator CMO: użyteczne zachowanie to nie produkowanie więcej, tylko czysta odmowa, kiedy prośba wychodzi poza to, co ustalono.

Fragment, w którym OpenAI przyznaje, że coś się pogorszyło

Jeden akapit materiału premierowego mówi rzecz, jakiej producenci zwykle nie mówią.

Zapisane rozumowanie Astry jest trudniejsze do monitorowania niż w GPT-5.6 Sol. OpenAI sprawdziło to, wprost prosząc modele o wymykanie się monitoringowi, i tłumaczy regres tym, że Astra ma większą kontrolę nad tym, co zapisuje, i potrzebuje mniej zapisanych kroków, żeby rozwiązać problem. Przy naprawdę trudnych zadaniach wciąż nie potrafi ukryć rozumowania. OpenAI pisze, że traktuje ten spadek poważnie i że monitorowalność zostaje priorytetem badawczym.

Po ludzku: model stał się lepszy w pracy i gorszy w pokazywaniu tej pracy. Możliwe, że to ta sama zmiana widziana z dwóch stron. Jeśli Twój plan nadzoru polega na czytaniu toku rozumowania, właśnie osłabł, a poprawka musi się przenieść na auto-review, logi działań i granice uprawnień.

Do tego Astra jest pierwszym modelem spełniającym próg Critical dla cyberbezpieczeństwa w Preparedness Framework OpenAI. Podczas ewaluacji znalazła i wykorzystała dwie wcześniej nieznane podatności zero-day, zgłoszone już opiekunom projektów. Na starcie robi bezpieczne przeglądy i łatanie kodu, ale odmawia pracy nad exploitami proof-of-concept, a OpenAI ostrzega, że dodatkowe kontrole potrafią wstrzymać albo zatrzymać legalne zadanie. W ChatGPT i Codeksie dostaniesz prośbę o przejrzenie akcji. W API zadanie po prostu staje.

Zaplanuj to, jeśli na tym budujesz. Pipeline zakładający, że każde wywołanie wraca, potrzebuje ścieżki dla wywołania, które nie wróci.

Jak bym teraz rozkładał pracę między te modele

Nic tutaj nie robi z jednego modelu odpowiedzi na wszystko. Wyostrza podział, który i tak już stosuję.

Rodzaj pracyCzego bym użyłDlaczego
Przemyślenie trudnego problemuClaude Fable 5.1 albo Opus 5Na równi z Astrą w indeksie v4.3 i przed nią w Humanity's Last Exam w tabeli z premiery
Obsługa oprogramowania przez godzinyGPT-6 AstraPrzewaga agentowa nie jest o krok, a kończy w połowę czasu
Długie przebiegi bez nadzoruGPT-6 AstraZero naruszeń zakresu w teście niemożliwego zadania to liczba, która to umożliwia
Jasno opisana implementacjaClaude Sonnet 5Tani, kompetentny i już wpięty w Claude Code
Klasyfikacja na dużą skalęGPT-5.6 Luna$0,20 / $1,20 sprawia, że różnica w jakości przestaje mieć znaczenie na tym poziomie

Jak rozłożyłbym pracę w tym tygodniu. Ciekawa jest ostatnia kolumna: w każdym wierszu inny powód, co jest argumentem przeciwko trzymaniu jednego domyślnego modelu.

Stos, który realnie prowadzę, i powód istnienia każdego elementu opisałem w stosie AI, którego naprawdę używam na produkcji. Logika routingu nie zmieniła się dzisiaj. Jeden wiersz dostał znacznie mocniejszego kandydata.

Pytania, które padły

Czy GPT-6 Astra jest lepszy od Claude’a?

Według niezależnych liczb jest na równi z najlepszym modelem Claude. Artificial Analysis Intelligence Index v4.3 daje Claude Fable 5.1 53,37, a GPT-6 Astra 52,81, co Artificial Analysis opisuje jako remis na prowadzeniu, z Claude Opus 5 na 50,70. Przebieg indeksu na Astrze kosztował też mniej niż na obu: $5 324 wobec $13 129 na Fable 5.1 i $7 275 na Opusie 5. W pracy agentowej liczby OpenAI z premiery dają Astrze duży zapas, na przykład 99,9% wobec 30,2% Opusa 5 w ARC-AGI-3 i 88% wobec 12,5% w SRE-Bench. Na premierę, na poprzedniej wersji indeksu, tabela OpenAI stawiała Astrę na czwartym miejscu. Wybieraj pod zadanie, nie pod producenta.

Ile kosztuje GPT-6 Astra?

Standardowy cennik API to 10 dolarów za milion tokenów wejściowych i 50 dolarów za milion wyjściowych, z osobnymi stawkami za odczyt i zapis cache. To ta sama cena katalogowa co Claude Fable 5. Tryb fast działa nawet dwa razy szybciej za dwukrotność ceny. W ChatGPT model mieści się w istniejących limitach planów Plus, Pro, Business i Enterprise, a dodatkowe kredyty można dokupić.

Czy w praktyce jest tańszy od Claude’a?

Tak, i niezależne liczby potwierdzają teraz tezę OpenAI. Artificial Analysis wydało $5 324 na przebieg Intelligence Index v4.3 na Astrze, wobec $13 129 na Claude Fable 5.1 i $7 275 na Opusie 5, i pisze, że każdy poziom rozumowania Astry ma najniższy koszt zadania przy swoim poziomie inteligencji. Na agentach kodujących zmierzyło Codex z Astrą na $7,47 za zadanie wobec $12,39 za Claude Code z Fable 5.1. OpenAI na premierę deklarowało koszt niższy o 31 do 86 procent niż Fable 5.1 w kilku benchmarkach. Wyjątkiem są długie prompty: powyżej 272 tys. tokenów wejścia całe zapytanie jest liczone po 2x za wejście i 1,5x za wyjście, a Fable 5.1 trzyma jedną stawkę.

Czy mogę użyć GPT-6 Astra w pracy już dziś?

Możliwe, że jeszcze nie, nawet jeśli firma za to płaci. Model trafia najpierw do ograniczonej grupy organizacji, a do wszystkich użytkowników Plus, Pro, Business i Enterprise dociera przez kolejne dni. W przestrzeniach Enterprise dostęp jest domyślnie wyłączony na starcie i musi go włączyć administrator. W API występuje jako gpt-6-astra, jest też przez Microsoft Azure i AWS Bedrock.

Gdzie jest haczyk?

W dwóch miejscach, oba wskazane przez OpenAI. To pierwszy model, który spełnia próg Critical dla cyberbezpieczeństwa w ich Preparedness Framework, dlatego na starcie odmawia pracy nad exploitami proof-of-concept, a dodatkowe kontrole bezpieczeństwa potrafią wstrzymać legalne zadanie. Do tego jego zapisane rozumowanie jest trudniejsze do monitorowania niż w GPT-5.6 Sol, co OpenAI tłumaczy tym, że rozwiązuje problemy w mniejszej liczbie zapisanych kroków. Nazywają ten regres poważnym. To najuczciwsze zdanie w całym ogłoszeniu.

Czego pilnuję dalej

Dwie rzeczy pokażą, czy to się obroni.

Pierwsza to niezależna replikacja. Artificial Analysis, ARC Prize i reszta opublikują własne przebiegi, a wyniki Claude’a z tabeli OpenAI zmierzą ludzie, którzy nie pisali tego ogłoszenia. Artificial Analysis opublikowało już swój przebieg, opisany w aktualizacji na górze: Astra remisuje z Fable 5.1 w indeksie i kosztuje mniej w przebiegu.

Druga to czy Anthropic odpowie na gruncie agentowym, a nie w indeksie. Na premierę Fable 5.1 trzymał koronę rozumowania spokojnie. Tydzień później trzyma ją o pół punktu. Tylko nikt nie kupuje modelu po to, żeby trzymał koronę.

Będę ten tekst aktualizował, w miarę jak pojawią się prawdziwe liczby. Jeśli chcesz tę argumentację przyłożoną do własnego stosu, a nie do materiału premierowego, plugin jest otwarty, a strona kontaktowa to najszybsza droga do mnie.

Udostępnij artykuł

O autorze

Wojciech Łuszczyński

Wojciech Łuszczyński

Architekt GTM i operator wzrostu budujący natywne dla AI systemy przychodów dla B2B SaaS i firm technologicznych. Łączę pozycjonowanie, SEO, treści, płatne pozyskiwanie, CRM, automatyzację, analitykę i przepływy pracy AI w praktyczną infrastrukturę wzrostu.

Newsletter

Najpierw zdobądź następny.

Kiedy opublikuję nowy artykuł na temat systemów AI, architektury GTM lub modeli operacyjnych wzrostu, dowiesz się o tym jako pierwszy.

Subskrybuj