Claude Opus 5.5 bije GPT-6 Astrę w każdym wyniku i nadal drożej kończy robotę
Opus 5.5 ma 58 wobec 53 Astry, kosztuje 60% mniej za token, a i tak płaci $5,98 za zadanie wobec $3,26. Pisze 260 mln tokenów wobec 60 mln.
GTM Architect & Growth Operator · Insights · 28 września 2026 · 7 min czytania
TL;DR · Najważniejsze wnioski
- Artificial Analysis daje Claude Opus 5.5 wynik 58, a GPT-6 Astrze 53. Opus 5.5 jest pierwszy na 211 modeli, Astra szósta. Opus 5.5 kosztuje też o 60% mniej za token, $4 / $20 wobec $10 / $50.
- Mimo obu tych rzeczy to Astra jest tańsza na ukończone zadanie: $3,26 wobec $5,98. Opus 5.5 wypisał w przebiegu indeksu 260 mln tokenów, Astra 60 mln.
- Opus 5.5 generuje szybciej, ok. 95 tokenów wyjściowych na sekundę wobec 64, i i tak kończy dużo później, bo tempo na token przegrywa z czterokrotnością tokenów.
- W harnessie programistycznym ten sam kształt. Claude Code z Opusem 5.5 prowadzi w Coding Agent Index z wynikiem 66 wobec 62 Codeksa z Astrą i kosztuje $13,04 na zadanie przez 1,1 godziny wobec $7,47 przez 29,4 minuty.
Dwa flagowce i tablica wyników mówi jedno, a faktura drugie.
Claude Opus 5.5 jest pierwszy wśród 211 modeli w niezależnym indeksie. Jest też o 60% tańszy za token od GPT-6 Astry. Oba zdania są prawdziwe, a Astra i tak taniej kończy robotę.
| Info | GPT-6 Astra | Claude Opus 5.5 |
|---|---|---|
| Wejście / wyjście za 1 mln | $10 / $50 | $4 / $20 |
| Cache na wejściu za 1 mln | $1,00 | $0,20 |
| Intelligence Index v4.3.2 | 53 | 58 |
| Miejsce wśród 211 modeli | 6. | 1. |
| Koszt zadania w indeksie | $3,26 | $5,98 |
| Tokeny wygenerowane w indeksie | 60 mln | 260 mln |
| Prędkość wyjścia, tokeny/s | ok. 64 | ok. 95 |
| Powyżej 272 tys. tokenów, wej. / wyj. | $20 / $75 | $4 / $20 |
| Okno / maks. wyjście | 1 mln / 128 tys. | 1 mln / 128 tys. |
| Granica wiedzy | kwi 2026 | cze 2026 |
Ceny i reguła 272 tys. ze strony modelu GPT-6 Astra w OpenAI oraz ze stron cennika i modeli Anthropica. Wynik indeksu, koszt zadania, tokeny i prędkość z kart modeli Artificial Analysis, oba przy max effort. Odczyt 28 września 2026.
Opus 5.5 wygrywa tablicę wyników bezapelacyjnie
Pięć punktów w indeksie, 58 wobec 53, a miejsca robią z tego konkret: pierwsze na 211 wobec szóstego. Strona modeli Anthropica kieruje dziś niezdecydowanych na Opusa 5.5 przy większości zadań.
Ma też świeższe dane treningowe, czerwiec 2026 wobec kwietnia, co waży więcej niż zwykle w roku, w którym porównywane modele wyszły we wrześniu.
I przegrywa fakturę
Za token to Opus 5.5 jest tym tanim, i to z dużym zapasem. $4 i $20 wobec $10 i $50. Cache kosztuje $0,20 wobec $1, bo Anthropic wycenia trafienia w cache na tym modelu jako 0,05x ceny wejścia, kiedy reszta linii używa 0,1x.
A potem zmierzony przebieg wychodzi na $5,98 na zadanie wobec $3,26.
Całe odwrócenie siedzi w jednym wierszu tabeli. Opus 5.5 wypisał w indeksie 260 mln tokenów, a Astra 60 mln. Cztery i jedna trzecia razy więcej wyjścia przy 40% ceny za token daje w sumie jakieś 80% więcej na rachunku.
Dwa modele, a tańszy cennik należy do droższego modelu. Jeśli budżetujesz z tabeli stawek, a nie ze zmierzonego przebiegu, to jest ta para, która cię na tym złapie.
Liczba o prędkości jest pułapką sama w sobie
Artificial Analysis mierzy Opusa 5.5 na ok. 95 tokenów wyjściowych na sekundę, a Astrę na ok. 64. To Opus 5.5 jest szybszym modelem, a Astrę Artificial Analysis opisuje jako wolniejszą od średniej.
I mimo to kończy dużo później. Tokeny na sekundę to tempo, a Opus 5.5 ma cztery razy dalszą drogę. Na benchmarku programistycznym, gdzie czas mierzy się wprost, czyta się to jako 1,1 godziny na zadanie wobec 29,4 minuty.
Szybszy model, który kończy w dwa razy dłuższym czasie, to nie sprzeczność. To różnica między prędkościomierzem a godziną przyjazdu, a tylko jedno z nich masz w kalendarzu.
Agenci programistyczni: ten sam kształt, głośniej
Opus 5.5 jest już w Coding Agent Index od Artificial Analysis, czego nie było, kiedy te modele wychodziły.
| Info | Codex + Astra | Claude Code + Opus 5.5 |
|---|---|---|
| Coding Agent Index v1.5 | 62 | 66 |
| DeepSWE v1.1 | 68% | 68% |
| Terminal-Bench 4.0 | 56% | 63% |
| SWE-Atlas-QnA | 62% | 66% |
| Koszt na zadanie | $7,47 | $13,04 |
| Czas na zadanie | 29,4 min | 1,1 godz. |
| Tokeny na zadanie | 3,3 mln | 15,6 mln |
Coding Agent Index v1.5, każdy model we własnym harnessie. Opus 5.5 prowadzi na każdym benchmarku poza DeepSWE, gdzie jest remis.
Opus 5.5 bierze szczyt tej tabeli i prowadzi na Terminal-Bench o siedem punktów, czyli na benchmarku, który oddziela model piszący kod od takiego, który umie prowadzić środowisko. Płaci za to 75% więcej na zadanie i ponad dwukrotnością czasu.
Zastrzeżenie o harnessie dotyczy każdego wiersza: liczby Astry pochodzą z Codeksa, a Opusa 5.5 z Claude Code, a harness przesuwa wyniki tak samo mocno jak model.
Linia 272 tys. nadal należy do Anthropica
OpenAI przelicza zapytanie do Astry powyżej 272 tys. tokenów wejścia dla całego żądania: 2x wejście i cache, 1,5x wyjście, czyli $20 / $75. Anthropic liczy pełne okno 1 mln Opusa 5.5 jedną stawką.
Za tą linią Opus 5.5 kosztuje piątą część Astry na wejściu i poniżej jednej trzeciej na wyjściu, w dodatku do tego, że i tak jest tańszy za token. Przy długich dokumentach, dużych fragmentach kodu trzymanych w kontekście i każdej pętli, której rozmowa przekracza 272 tys., odwrócenie kosztu na zadanie przestaje chronić Astrę. Arytmetykę po stronie Astry rozpisuje Astra kontra Claude Opus 5.
Czego bym użył
| Rodzaj pracy | Model | Dlaczego |
|---|---|---|
| Odpowiedź decyduje o wyniku | Claude Opus 5.5 | Pierwszy na 211 i prowadzi na każdym benchmarku programistycznym poza tym, na którym jest remis. |
| Duży wolumen, płacisz za ukończone zadanie | GPT-6 Astra | $3,26 wobec $5,98 w indeksie, $7,47 wobec $13,04 w kodzie. |
| Ktoś na to czeka | GPT-6 Astra | 29,4 minuty wobec 1,1 godziny, mimo że jest wolniejsza na token. |
| Prompty przekraczające 272 tys. | Claude Opus 5.5 | Jedna stawka w całym oknie 1 mln, a Astrze całe zapytanie podwaja wejście. |
| Pętle agentowe oparte na cache | Claude Opus 5.5 | $0,20 wobec $1 na linii, która dominuje rachunek długiej pętli. |
| Prowadzenie terminala | Claude Opus 5.5 | Siedem punktów na Terminal-Bench 4.0, benchmarku oddzielającym pisanie kodu od uruchamiania go. |
Opus 5.5 do jakości, długich promptów i pętli na cache. Astra do przepustowości i do wszystkiego, na co ktoś czeka.
Wewnątrz linii OpenAI tańszą wersję tej decyzji opisuje Sol kontra Astra. Po stronie Anthropica krok wyżej opisuje Opus 5.5 kontra Opus 5, razem z czterema łamiącymi zmianami w tym przejściu.
Co zmieniłoby moje zdanie
Oba modele w jednym harnessie. Każda liczba programistyczna tutaj to Astra w Codeksie wobec Opusa 5.5 w Claude Code, czyli dwie zmienne ruszają się naraz.
Przebieg przy niższym effortcie. Opus 5.5 domyślnie stoi na medium, a wszystkie liczby wyżej to max effort, z czego biorą się te 260 mln tokenów. Różnica na zadanie może się domknąć albo odwrócić przy ustawieniach domyślnych.
Zmiana reguły 272 tys. To jedna linijka, która czyni Opusa 5.5 kilkakrotnie tańszym przy długich promptach.
Pytania, które padają
Czy Claude Opus 5.5 jest lepszy od GPT-6 Astry?
W każdym opublikowanym wyniku tak. Artificial Analysis daje Opusowi 5.5 58 w Intelligence Index v4.3.2, a Astrze 53, co stawia Opusa 5.5 na pierwszym miejscu wśród 211 modeli, a Astrę na szóstym. W harnessie programistycznym kolejność się powtarza: Claude Code z Opusem 5.5 ma 66, Codex z Astrą 62, a Opus 5.5 prowadzi na Terminal-Bench 4.0 o siedem punktów i na SWE-Atlas-QnA o cztery, przy remisie 68% na DeepSWE v1.1.
Co jest tańsze, GPT-6 Astra czy Claude Opus 5.5?
Zależy, którą liczbę masz na myśli, bo obie mówią co innego. Za token Opus 5.5 jest o 60% tańszy: $4 za wejście i $20 za wyjście za milion wobec $10 i $50 Astry, oraz $0,20 wobec $1 za cache. Na ukończone zadanie tańsza o 45% jest Astra: Artificial Analysis zmierzyło $3,26 wobec $5,98, bo Opus 5.5 wygenerował w przebiegu indeksu 260 mln tokenów, a Astra 60 mln. Na zadaniach programistycznych różnica rośnie do $7,47 wobec $13,04.
Co jest szybsze, GPT-6 Astra czy Claude Opus 5.5?
Opus 5.5 generuje szybciej i kończy później. Artificial Analysis mierzy dla Opusa 5.5 ok. 95 tokenów wyjściowych na sekundę, a dla Astry ok. 64, ale Opus 5.5 pisze mniej więcej cztery razy więcej tokenów, więc spędza nad tą samą pracą dużo więcej czasu. Na benchmarku programistycznym wychodzi to jako 1,1 godziny na zadanie wobec 29,4 minuty.
Wybierać GPT-6 Astrę czy Claude Opus 5.5?
Opusa 5.5, kiedy o wyniku decyduje jakość odpowiedzi, kiedy prompty są długie albo kiedy praca i tak siedzi w Claude Code: ma wyższe wyniki wszędzie, kosztuje piątą część Astry za cache i trzyma jedną stawkę w całym oknie 1 mln. Astrę, kiedy płacisz za ukończone zadanie przy dużym wolumenie albo kiedy ktoś czeka, bo kosztuje mniej więcej połowę na zadanie i oddaje robotę w ułamku czasu.
Jeśli wybierasz flagowca do produktu agentowego i chcesz mieć spisaną regułę routingu, strona kontaktowa to najszybsza droga do mnie.



