GPT-5.6 kontra Claude 5: pierwsze testy pokazują, że najważniejsza zmiana to nie nowy lider benchmarków
W indeksie v4.3 oba modele mają 38, ale przebieg benchmarku na Sonnecie 5 kosztował 22 razy więcej. Wrzesień 2026: kiedy wygrywa Luna, a kiedy Sonnet 5.
GTM Architect & Growth Operator · Insights · 12 lipca 2026 · 18 min czytania
TL;DR · Najważniejsze wnioski
- Aktualizacja 16 września 2026 pod Artificial Analysis Intelligence Index v4.3. GPT-5.6 Luna ma 37,50, a Claude Sonnet 5 38,36, oba wyświetlane jako 38. Przebieg indeksu kosztował $320 na Lunie i $6 998 na Sonnecie 5.
- Luna kosztuje $0,20 / $1,20 za milion tokenów, Sonnet 5 $2 / $10. Różnica w koszcie przebiegu jest większa niż w cenniku, bo Sonnet 5 wygenerował w indeksie 370 mln tokenów, a Luna 150 mln.
- Z pięciu modeli z tego porównania lipcowa kolejność trzyma się na v4.3: Claude Fable 5 49,70, GPT-5.6 Sol 47,06, Terra 42,25, Sonnet 5 38,36, Luna 37,50. Nad całą piątką są już trzy nowsze modele: Fable 5.1, GPT-6 Astra i Opus 5.
- Przestań pytać, który model jest najlepszy. Kieruj pracę: Luna do Terra do Sol, albo Sonnet 5 wykonuje, a mocniejszy model planuje. Wygrywa architektura, nie wiersz z najwyższą liczbą.
GPT-5.6 Luna kontra Claude Sonnet 5 we wrześniu 2026
Większość ludzi trafia tu z jednym pytaniem, więc aktualna odpowiedź idzie na początek.
| Info | GPT-5.6 Luna | Claude Sonnet 5 |
|---|---|---|
| Intelligence Index v4.3 | 37,50 | 38,36 |
| Wej. / wyj. za 1 mln | $0,20 / $1,20 | $2 / $10 |
| Koszt przebiegu całego indeksu | $320 | $6 998 |
| Tokeny wygenerowane w indeksie | 150 mln | 370 mln |
Wynik do dwóch miejsc po przecinku z danych wykresu v4.3 w Artificial Analysis; koszt przebiegu i tokeny z ich stron modeli; ceny z cenników OpenAI i Anthropic. Stan na 16 września 2026.
Pod względem zdolności są na równi. Dzieli je mniej niż punkt i oba wyświetlają się jako 38.
Pod względem kosztu nie ma porównania. Cena wejścia Luny to jedna dziesiąta ceny Sonneta 5, a na prawdziwym obciążeniu różnica rośnie: Artificial Analysis wydało na przebieg indeksu na Sonnecie 5 22 razy więcej, bo Sonnet 5 wypisał po drodze mniej więcej dwa i pół raza więcej tokenów.
Dlatego do pracy wolumenowej domyślnie wybieram Lunę. Sonnet 5 zarabia na swoją cenę gdzie indziej: tam, gdzie praca już działa w Claude Code albo na platformie Anthropic, a przeniesienie działającego pipeline’u kosztowałoby więcej niż ta różnica.
Jeśli wciąż pracujesz na Sonnecie 4.6, zobacz Lunę kontra Sonnet 4.6.
Porównanie z premiery, lipiec 2026
OpenAI i Anthropic wypuściły nowe generacje modeli w odstępie kilku tygodni. Na papierze wygląda to jak kolejna runda wojny benchmarkowej. Nie jest. Ciekawy ruch jest strukturalny i zmienia to, jak budowałbym na obu stackach.
OpenAI przestało sprzedawać jeden „najlepszy GPT”. GPT-5.6 to rodzina trzech modeli:
- GPT-5.6 Sol, flagowiec,
- GPT-5.6 Terra, poziom zbalansowany pod jakość i koszt,
- GPT-5.6 Luna, szybki, tani poziom do wolumenu.
Anthropic pozycjonuje dwa:
- Claude Fable 5 jako najmocniejszy szeroko dostępny model firmy,
- Claude Sonnet 5 jako praktyczny model agentowy do codziennej pracy, automatyzacji i kodowania.
Wszystkie pięć obsługuje około miliona tokenów kontekstu i do 128 000 tokenów wyjścia. Context window przestał być wyróżnikiem. Dziś różnicują je niezawodność, koszt na ukończone zadanie, wykorzystanie narzędzi, szybkość i to, ile nadzoru potrzebują, żeby działać, kiedy na nie nie patrzę.
| Model | Indeks, runda lipcowa | Indeks v4.3 | Wej. / wyj. za 1 mln | Najbardziej logiczna rola |
|---|---|---|---|---|
| Claude Fable 5 | 60 | 49,70 | $10 / $50 | Najtrudniejsze problemy, analiza, planowanie, high-stakes coding |
| GPT-5.6 Sol | 59 | 47,06 | $4 / $20 | Frontier capability przy lepszej ekonomii, mocna integracja z Codexem |
| GPT-5.6 Terra | 55 | 42,25 | $2 / $12 | Domyślny model do codziennej pracy profesjonalnej |
| Claude Sonnet 5 | 53 | 38,36 | $2 / $10 | Dobrze zdefiniowany agentic execution i Claude Code |
| GPT-5.6 Luna | 51 | 37,50 | $0.20 / $1.20 | Szybkie, wolumenowe, niskokosztowe workloady |
Pięć modeli w skrócie. Artificial Analysis Intelligence Index w rundzie lipcowej i na v4.3, które mają różne skale, aktualne ceny API i to, gdzie każdy zarabia na siebie. Reszta artykułu to powód, dla którego podświetlony wiersz nie jest całą prawdą.
Najważniejszy wniosek z lipca: Fable prowadził, Sol był o punkt za nim za jedną trzecią ceny
W lipcowej rundzie Claude Fable 5 uzyskał 60 w Artificial Analysis Intelligence Index, a GPT-5.6 Sol w maksymalnym reasoningu 59. Artificial Analysis oszacowało koszt Sol na około $1,04 na zadanie w tym benchmarku, mniej więcej jedną trzecią kosztu Fable. Sol objął też prowadzenie w Coding Agent Index z wynikiem 80.
Artificial Analysis Intelligence Index
+2% vs baselineNa v4.3 różnica to 2,6 punktu, 49,70 wobec 47,06, a przebieg indeksu kosztował Artificial Analysis $11 161 na Fable 5 i $3 465 na Solu. Nadal nie nokaut. Nadal zmiana ekonomiki rynku.
Fable nadal może być właściwym wyborem do jednego najtrudniejszego problemu, gdzie koszt modelu znaczy mniej niż prawdopodobieństwo poprawnego wyniku. Sol wygląda na lepszy domyślny model do powtarzalnej pracy frontier-level, zwłaszcza takiej, którą uruchamiasz wiele razy dziennie.
Co faktycznie zmienia GPT-5.6
Sol: blisko Fable, wyraźnie taniej
GPT-5.6 Sol kosztuje $5 za milion tokenów wejściowych i $30 wyjściowych. Fable 5 kosztuje $10 i $50.
Sama cena tokena nigdy nie mówi całej prawdy, bo modele zużywają różne ilości reasoningu, robią inną liczbę kroków i wymagają innej ilości poprawek. Ale niezależny koszt na zadanie mówi, że przewaga Sol to więcej niż sztuczka z cennika.
Sol, koszt na zadanie
$1,04
eval Artificial Analysis
Koszt Fable vs Sol
~3x
taniej
ten sam benchmark
Sol, Coding Agent Index
80
obecny lider
Claire Vo przepuściła Sol, Terra, Luna, Fable i Sonnet przez PRD, prototypy, wireframe’y, debugowanie i agentic voice. Sol wygrał cały test, najmocniej w PRD, prototypach i obsłudze przeglądarki. Problemem Fable nie były surowe zdolności. Była nadmierna pedanteria i trudniejsza współpraca podczas samej realizacji.
Pierwsze relacje deweloperów idą w tę samą stronę. Opisują Sol jako zbliżony do Fable, ale szybszy, tańszy i bardziej niezawodny przy zmianach, które dotykają kilku warstw systemu naraz. To anegdoty, nie kontrolowane eksperymenty, ale kierunek zgadza się z niezależnymi liczbami.
Fable nie przegrał na zdolnościach. Przegrał na tym, ile pracy kosztowała współpraca z nim.
Terra może być najważniejszym modelem tej premiery
Sol przyciąga uwagę. Terra może mieć większy wpływ operacyjny.
Terra kosztuje $2 za milion tokenów wejściowych i $12 wyjściowych. OpenAI opisuje ją jako konkurencyjną wobec GPT-5.5 za połowę ceny. Artificial Analysis dało jej 55 w lipcowej rundzie, cztery punkty za Solem. Na v4.3 ma 42,25, 4,8 punktu za nim.
To wystarcza do sporej części realnej pracy produkcyjnej:
Analiza biznesowa
TerraCzyta, streszcza i rozumuje na nieuporządkowanych danych na tyle dobrze, by przygotować decyzję.
Praca z dokumentami i research
TerraWarstwa wolumenowa profesjonalnego outputu: drafty, ekstrakcja, synteza wielu źródeł.
Generowanie i refaktoryzacja kodu
TerraZmiany o średniej trudności z jasnym zakresem, nie dwuznaczne decyzje architektoniczne.
Tool use i agentic execution
TerraWieloetapowe runy, w których plan jest zdefiniowany, a model go wykonuje.
Nie wszyscy są przekonani. Część testujących zauważa, że Terra wypada poniżej GPT-5.5 w kilku pojedynczych benchmarkach i zachowuje się bardziej jak wydestylowany model średniej klasy niż tańszy Sol. Trafnie. Mocna średnia nie oznacza równej jakości w każdym workloadzie. Ale dla firmy pytanie nie brzmi „czy Terra wygrywa każdy eval”. Brzmi:
Czy Terra kończy wystarczająco dużo naszych zadań, żeby płacenie za Sol domyślnie stało się zbędne?
Dla wielu workloadów odpowiedź brzmi: tak.
Luna pokazuje, jak szybko tanieją zdolności
GPT-5.6 Luna kosztuje $0,20 za milion tokenów wejściowych i $1,20 wyjściowych. W lipcowej rundzie uzyskała 51,2, tylko nieco poniżej Sonneta 5 w maksymalnym reasoningu, a na v4.3 dzieli je mniej niż punkt.
To nie znaczy, że Luna bije Sonnet w każdym zadaniu. Sonnet potrafi być znacznie lepszy w konkretnej pracy agentowej, kodowej albo długo działającej. Luna pokazuje presję cenową, którą tworzy GPT-5.6: zdolności, które jeszcze niedawno wymagały drogiego modelu frontier, siedzą dziś w poziomie za dolara za wejście.
Gdzie Luna jest racjonalnym wyborem
Oceniaj Lunę po pracy, którą odblokowuje ekonomicznie, nie po tym, czy pokona Fable w najtrudniejszym możliwym problemie.
Duży wolumen, niska dwuznaczność, jasne pass albo fail. Klasyczna robota dla taniego modelu.
Wstępne drafty, warianty, przepisania na skalę, gdzie output i tak edytuje człowiek.
Triage zadania, ocena trudności, potem eskalacja tych trudnych do mocniejszego poziomu.
Najlepsza architektura to więc nie Sol do wszystkiego. To routing pracy według trudności i ryzyka.
Fable 5 wciąż ma najmocniejszy argument czysto jakościowy
Z tej piątki Claude Fable 5 zostaje pierwszy w ogólnym indeksie i szczególnie mocno wypada w długich zadaniach analitycznych, kodowaniu agentowym, prototypowaniu, pracy z arkuszami i problemach wymagających samokontroli. Partnerzy Anthropic z wczesnego dostępu opisywali go jako zdolny do kończenia pracy, która wcześniej wymagała wielu promptów, i do refleksji nad własnym wynikiem przy najwyższym effort.
Fable zdobył też 80% w SWE-Bench Pro wobec 64,6% Sol. Ale Sol wygrał Terminal-Bench 2.1 wynikiem 88,8% wobec 83,1% Fable.
SWE-Bench Pro
+24% vs baselineTerminal-Bench 2.1
+7% vs baselineOba benchmarki mierzą inną robotę, a harness waży tyle samo co model:
- SWE-Bench premiuje naprawianie zdefiniowanych problemów w repo.
- Terminal-Bench sprawdza pracę w środowisku terminalowym.
- Codex i Claude Code dokładają własne harnessy, prompty systemowe, zarządzanie kontekstem i strategie narzędziowe.
Ten sam model wypada inaczej przez surowe API, w Claude Code, w Codexie albo w środowisku zbudowanym przez trzecią firmę. Oceniaj środowisko, nie same wagi.
Prawdziwe wady Fable to koszt i dostępność. Po czasowym wstrzymaniu model wrócił globalnie, ale wielu użytkowników krytykowało Anthropic za przeniesienie użycia Fable poza standardowe limity subskrypcyjne i na dodatkowe płatne credity. Fable może być najlepszym specjalistą, nie będąc najlepszym domyślnym pracownikiem.
Sonnet 5: dobry model z problemem pozycjonowania
Sonnet 5 miał odpowiedzieć na proste pytanie: który model Claude wybierać do codziennej pracy?
Oferta produktowa jest atrakcyjna. Sonnet 5 jest dostępny we wszystkich planach Claude, domyślny w Free i Pro, działa w Claude Code i kosztuje $2 za milion tokenów wejściowych i $10 wyjściowych. Zaczynało się to jako cena promocyjna do 31 sierpnia 2026, ale Anthropic potwierdziło, że zapowiedziany wzrost do $3 i $15 nie nastąpi, a $2/$10 jest teraz ceną standardową. Anthropic prezentuje go jako istotnie bardziej agentowego niż Sonnet 4.6: lepiej kończącego wieloetapowe zadania, sprawdzającego własny output i działającego na nieuporządkowanych, istniejących codebase’ach. Partnerzy z wczesnego dostępu zgłaszali mocne wyniki w debugowaniu, tool use, testowaniu i pracy z brownfield code.
Niezależny obraz jest bardziej mieszany.
To nie czyni Sonnet 5 słabym. Sugeruje, że planowanie mocno niejasnej pracy nie jest jego naturalną rolą. Bardziej racjonalny podział:
| Zadanie | Mój wybór | Dlaczego |
|---|---|---|
| Architektura, planowanie, praca z dużą niepewnością | Fable albo Sol | Drogie jest pomylenie się. Zapłać za model najmniej skłonny wysłać cię złą ścieżką. |
| Implementacja jasno zdefiniowanego zadania | Sonnet 5 | Zakres jest ustalony, robotą jest wykonanie. Tu jego siła agentowa działa, a cena pasuje. |
| Codzienna analiza i implementacja z dobrym cost/performance | Terra | Jakość blisko frontier za połowę ceny flagowca, dla większości profesjonalnego outputu. |
| Skala i workloady niskiego ryzyka | Luna | Wolumen, który wcześniej nie uzasadniał modelu frontier, dziś działa za dwadzieścia centów za milion wejścia. |
Dopasuj model do ryzyka zadania, nie do jednego wiersza w rankingu.

Prawdziwy pojedynek: ChatGPT Work i Codex kontra Claude Cowork i Claude Code
Porównania samych modeli coraz gorzej opisują realną produktywność.
OpenAI udostępniło GPT-5.6 w ChatGPT, ChatGPT Work, Codexie i API. Użytkownicy płatnych planów wybierają Sol, Terra albo Luna w Work i Codexie oraz sterują poziomem reasoningu. Tryby max i ultra są dostępne na wybranych planach, a API obsługuje programmatic tool calling i równoległych subagentów. Anthropic oferuje porównywalny system przez Claude Chat, Cowork i Claude Code.
OpenAI: ChatGPT Work + Codex
lepsza ekonomiaSol, Terra i Luna do wyboru w Work i Codexie, sterowanie effortem, tryby max i ultra, programmatic tool calling i równolegli subagenci. Siłą jest głębsza integracja z resztą ChatGPT i agresywniejsza ekonomia modeli.
Anthropic: Cowork + Claude Code
dojrzały dev UXTen sam zakres zadań przez Claude Chat, Cowork i Claude Code. Przewagą zostaje Claude Code: wciąż najbardziej dojrzałe doświadczenie deweloperskie, zwłaszcza do naturalnej pracy na istniejącym, nieuporządkowanym codebase.
Oba stacki przechodzą między tymi samymi zadaniami: rozmowa i analiza, dokumenty i pliki, praca na poziomie aplikacji, edycja repozytorium, uruchamianie kodu, delegowanie do subagentów. Przewagą Anthropic zostaje Claude Code, wciąż najbardziej dojrzałe i najczęściej preferowane doświadczenie deweloperskie, zwłaszcza do naturalnej pracy na istniejącym codebase. Odpowiedź OpenAI to głębsza integracja Codexa z resztą ChatGPT plus agresywniejsza ekonomia modeli.
Pierwsze opinie nie koronują jednego zwycięzcy. Część deweloperów wciąż woli Claude do frontendu, trzymania się konwencji projektu i generowania kodu bliższego intencji. Inni relacjonują, że Codex z Sol jest bardziej niezawodny, gdy problem przechodzi przez kilka warstw systemu, i rzadziej utyka w lokalnym rozwiązaniu.
Co naprawdę mówią liczby
Dwa wnioski przetrwają wszystkie zastrzeżenia.
Po pierwsze, różnica zdolności między flagowcem a tańszymi poziomami maleje. W lipcu jeden punkt dzielił Fable 5 i Sola w ogólnym indeksie, a cztery Sola i Terrę. Na v4.3 te różnice to 2,6 i 4,8 punktu. Modele premium to już nie inna liga, tylko inna cena.
Po drugie, cena tokena nie jest liczbą, która się liczy. Tańszy model może być droższy na wynik, gdy generuje więcej tokenów reasoningu, robi więcej kroków albo wymaga więcej poprawek. Koszt na ukończony wynik to jedyna liczba, która dotyka P&L, i nie ma jej na żadnej stronie z cennikiem.
To, co pokazuje cennik
Koszt na token
To, co realnie uderza w budżet
Koszt na ukończony wynik
Jak kierowałbym pracę
Do większości pracy profesjonalnej: Terra
Terra to najlepszy punkt startowy do analizy, researchu, pracy z dokumentami, treści i średnio trudnego kodowania. Sol powinien być ścieżką eskalacji, a nie uniwersalnym domyślnym wyborem.
Do najtrudniejszych problemów: Sol albo Fable
Fable trzyma minimalną przewagę w ogólnym rankingu i mocno wypada w długich, złożonych zadaniach. Sol daje zbliżone zdolności przy znacznie lepszej ekonomii i jest bardziej pragmatycznym domyślnym wyborem dla firmy.
W Claude Code: Sonnet wykonuje, Fable planuje
Sonnet 5 pasuje do jasno zdefiniowanej implementacji. Przy niejasnej pracy architektonicznej użycie mocniejszego modelu do przygotowania planu zwykle kosztuje mniej niż trzykrotne poprawianie tańszego.
Do automatyzacji wolumenowej: Luna
Nie oceniaj Luny po tym, czy pokona Fable w najtrudniejszym problemie. Jej wartość to odblokowanie całych kategorii pracy, które wcześniej ekonomicznie nie uzasadniały frontier AI.
Ostateczny werdykt
OpenAI nie musiało jednoznacznie pokonać Fable. Wystarczyło zbliżyć się przy znacznie niższym koszcie, a potem rozłożyć tę samą generację zdolności na trzy poziomy cenowe. W efekcie „który model jest najlepszy?” staje się coraz słabszym pytaniem.
Lepsze:
- Który model faktycznie kończy mój konkretny workflow?
- Ile wymaga nadzoru?
- Ile kosztuje poprawny wynik, a nie milion tokenów?
- Czy potrafi działać w moich dokumentach, aplikacjach i repozytoriach?
- Kiedy praca powinna być automatycznie eskalowana do mocniejszego modelu?
Frontier AI to już nie jeden model. Staje się warstwowym systemem produkcyjnym. W takim systemie wygrywa nie model z najwyższą liczbą na jednym wykresie. Wygrywa architektura, która kieruje właściwe zadanie do właściwego poziomu inteligencji.
FAQ: GPT-5.6 kontra Claude 5
Czy GPT-5.6 Luna jest lepszy od Claude Sonnet 5?
Pod względem zdolności są na równi. W Artificial Analysis Intelligence Index v4.3 Luna ma 37,50, a Sonnet 5 przy maksymalnym effort 38,36, oba wyświetlane jako 38. Luna kosztuje $0,20 za milion tokenów wejściowych i $1,20 wyjściowych, wobec $2 i $10 Sonneta 5, a przebieg całego indeksu kosztował $320 na Lunie i $6 998 na Sonnecie 5, bo Sonnet 5 wygenerował 370 mln tokenów, a Luna 150 mln. Luny używaj do pracy wolumenowej i jasno zdefiniowanej, gdzie zły wynik tanio wychwycisz: klasyfikacja, ekstrakcja, routing, pierwsze wersje tekstu. Sonneta 5 tam, gdzie praca już działa w Claude Code albo na platformie Anthropic i przeniesienie jej kosztowałoby więcej niż różnica w cenie. Oba oceniaj po koszcie ukończonego zadania, nie po cenie za token.
Który model AI jest teraz najlepszy, GPT-5.6 czy Claude 5?
Z pięciu modeli z tego porównania najwyżej w Artificial Analysis Intelligence Index v4.3 wciąż jest Claude Fable 5 z wynikiem 49,70, a za nim GPT-5.6 Sol z 47,06: ta sama kolejność co w lipcu, na niższej skali. Nad całą piątką są już trzy nowsze modele: Claude Fable 5.1 z 53,37, GPT-6 Astra z 52,81 i Claude Opus 5 z 50,70. Nie ma jednego zwycięzcy: właściwy model zależy od zadania, kosztu ukończonego wyniku i tego, ile masz nadzoru do oddania.
Czy GPT-5.6 jest tańszy od Claude Fable 5?
Tak. GPT-5.6 Sol kosztuje $4 za milion tokenów wejściowych i $20 wyjściowych wobec $10 i $50 Fable 5, a przebieg Artificial Analysis Intelligence Index v4.3 kosztował $3 465 na Solu i $11 161 na Fable 5. Cena Sola jest promocyjna co najmniej do 21 listopada 2026. Terra ($2 / $12) i Luna ($0,20 / $1,20) podcinają każdy poziom Claude jeszcze mocniej.
Czy używać Claude Sonnet 5 w Claude Code?
Do dobrze zdefiniowanej implementacji tak: jest szybki, jest wbudowany w Claude Code, a Anthropic przedstawia go jako mocny w debugowaniu, tool use i pracy na nieuporządkowanych codebase’ach. Przy niejasnej architekturze najpierw zaplanuj mocniejszym modelem. Sonnet 5 jest rozgadany: w przebiegu indeksu v4.3 wygenerował 370 mln tokenów, około cztery razy więcej niż mediana 90 mln, więc planowanie nim najtrudniejszej pracy to często fałszywa oszczędność.
Który model GPT-5.6 jest najlepszy do codziennej pracy?
Terra do większości: analizy, researchu, pracy z dokumentami i średnio trudnego kodowania za połowę ceny wejścia flagowca. Sol zostaw jako ścieżkę eskalacji do najtrudniejszych problemów, a Lunę do zadań wolumenowych o niskim ryzyku, jak klasyfikacja, ekstrakcja i routing.
Źródła i dalsza lektura
Źródła pierwotne
Strony główne dla cytowanych liczb. Głębokie permalinki się zmieniają, więc to strony, na których warto sprawdzić aktualne wartości.
Jeśli chcesz operatorskiego kontekstu wokół tego, opisałem mój własny benchmark Claude Fable 5 kontra Opus i Sonnet oraz production stack AI, na którym realnie dowożę. Ta sama zasada co tutaj: model to jedna warstwa, a robotą jest system, który kieruje wokół niego pracę.

