Przejdź do treści
wojciech.io
Porównania modeli
AI SystemsAIOpenAIClaudeAI Systems

Claude Opus 5.5 bije GPT-6 Astrę w każdym wyniku i nadal drożej kończy robotę

Opus 5.5 ma 58 wobec 53 Astry, kosztuje 60% mniej za token, a i tak płaci $5,98 za zadanie wobec $3,26. Pisze 260 mln tokenów wobec 60 mln.

Wojciech Łuszczyński

Wojciech Łuszczyński

GTM Architect & Growth Operator · Insights · 28 września 2026 · 7 min czytania

Udostępnij

TL;DR · Najważniejsze wnioski

  • Artificial Analysis daje Claude Opus 5.5 wynik 58, a GPT-6 Astrze 53. Opus 5.5 jest pierwszy na 211 modeli, Astra szósta. Opus 5.5 kosztuje też o 60% mniej za token, $4 / $20 wobec $10 / $50.
  • Mimo obu tych rzeczy to Astra jest tańsza na ukończone zadanie: $3,26 wobec $5,98. Opus 5.5 wypisał w przebiegu indeksu 260 mln tokenów, Astra 60 mln.
  • Opus 5.5 generuje szybciej, ok. 95 tokenów wyjściowych na sekundę wobec 64, i i tak kończy dużo później, bo tempo na token przegrywa z czterokrotnością tokenów.
  • W harnessie programistycznym ten sam kształt. Claude Code z Opusem 5.5 prowadzi w Coding Agent Index z wynikiem 66 wobec 62 Codeksa z Astrą i kosztuje $13,04 na zadanie przez 1,1 godziny wobec $7,47 przez 29,4 minuty.

Dwa flagowce i tablica wyników mówi jedno, a faktura drugie.

Claude Opus 5.5 jest pierwszy wśród 211 modeli w niezależnym indeksie. Jest też o 60% tańszy za token od GPT-6 Astry. Oba zdania są prawdziwe, a Astra i tak taniej kończy robotę.

InfoGPT-6 AstraClaude Opus 5.5
Wejście / wyjście za 1 mln$10 / $50$4 / $20
Cache na wejściu za 1 mln$1,00$0,20
Intelligence Index v4.3.25358
Miejsce wśród 211 modeli6.1.
Koszt zadania w indeksie$3,26$5,98
Tokeny wygenerowane w indeksie60 mln260 mln
Prędkość wyjścia, tokeny/sok. 64ok. 95
Powyżej 272 tys. tokenów, wej. / wyj.$20 / $75$4 / $20
Okno / maks. wyjście1 mln / 128 tys.1 mln / 128 tys.
Granica wiedzykwi 2026cze 2026

Ceny i reguła 272 tys. ze strony modelu GPT-6 Astra w OpenAI oraz ze stron cennika i modeli Anthropica. Wynik indeksu, koszt zadania, tokeny i prędkość z kart modeli Artificial Analysis, oba przy max effort. Odczyt 28 września 2026.

Opus 5.5 wygrywa tablicę wyników bezapelacyjnie

Pięć punktów w indeksie, 58 wobec 53, a miejsca robią z tego konkret: pierwsze na 211 wobec szóstego. Strona modeli Anthropica kieruje dziś niezdecydowanych na Opusa 5.5 przy większości zadań.

Ma też świeższe dane treningowe, czerwiec 2026 wobec kwietnia, co waży więcej niż zwykle w roku, w którym porównywane modele wyszły we wrześniu.

I przegrywa fakturę

Za token to Opus 5.5 jest tym tanim, i to z dużym zapasem. $4 i $20 wobec $10 i $50. Cache kosztuje $0,20 wobec $1, bo Anthropic wycenia trafienia w cache na tym modelu jako 0,05x ceny wejścia, kiedy reszta linii używa 0,1x.

A potem zmierzony przebieg wychodzi na $5,98 na zadanie wobec $3,26.

Całe odwrócenie siedzi w jednym wierszu tabeli. Opus 5.5 wypisał w indeksie 260 mln tokenów, a Astra 60 mln. Cztery i jedna trzecia razy więcej wyjścia przy 40% ceny za token daje w sumie jakieś 80% więcej na rachunku.

Key takeaway

Dwa modele, a tańszy cennik należy do droższego modelu. Jeśli budżetujesz z tabeli stawek, a nie ze zmierzonego przebiegu, to jest ta para, która cię na tym złapie.

Liczba o prędkości jest pułapką sama w sobie

Artificial Analysis mierzy Opusa 5.5 na ok. 95 tokenów wyjściowych na sekundę, a Astrę na ok. 64. To Opus 5.5 jest szybszym modelem, a Astrę Artificial Analysis opisuje jako wolniejszą od średniej.

I mimo to kończy dużo później. Tokeny na sekundę to tempo, a Opus 5.5 ma cztery razy dalszą drogę. Na benchmarku programistycznym, gdzie czas mierzy się wprost, czyta się to jako 1,1 godziny na zadanie wobec 29,4 minuty.

Szybszy model, który kończy w dwa razy dłuższym czasie, to nie sprzeczność. To różnica między prędkościomierzem a godziną przyjazdu, a tylko jedno z nich masz w kalendarzu.

Agenci programistyczni: ten sam kształt, głośniej

Opus 5.5 jest już w Coding Agent Index od Artificial Analysis, czego nie było, kiedy te modele wychodziły.

InfoCodex + AstraClaude Code + Opus 5.5
Coding Agent Index v1.56266
DeepSWE v1.168%68%
Terminal-Bench 4.056%63%
SWE-Atlas-QnA62%66%
Koszt na zadanie$7,47$13,04
Czas na zadanie29,4 min1,1 godz.
Tokeny na zadanie3,3 mln15,6 mln

Coding Agent Index v1.5, każdy model we własnym harnessie. Opus 5.5 prowadzi na każdym benchmarku poza DeepSWE, gdzie jest remis.

Opus 5.5 bierze szczyt tej tabeli i prowadzi na Terminal-Bench o siedem punktów, czyli na benchmarku, który oddziela model piszący kod od takiego, który umie prowadzić środowisko. Płaci za to 75% więcej na zadanie i ponad dwukrotnością czasu.

Zastrzeżenie o harnessie dotyczy każdego wiersza: liczby Astry pochodzą z Codeksa, a Opusa 5.5 z Claude Code, a harness przesuwa wyniki tak samo mocno jak model.

Linia 272 tys. nadal należy do Anthropica

OpenAI przelicza zapytanie do Astry powyżej 272 tys. tokenów wejścia dla całego żądania: 2x wejście i cache, 1,5x wyjście, czyli $20 / $75. Anthropic liczy pełne okno 1 mln Opusa 5.5 jedną stawką.

Za tą linią Opus 5.5 kosztuje piątą część Astry na wejściu i poniżej jednej trzeciej na wyjściu, w dodatku do tego, że i tak jest tańszy za token. Przy długich dokumentach, dużych fragmentach kodu trzymanych w kontekście i każdej pętli, której rozmowa przekracza 272 tys., odwrócenie kosztu na zadanie przestaje chronić Astrę. Arytmetykę po stronie Astry rozpisuje Astra kontra Claude Opus 5.

Czego bym użył

Rodzaj pracyModelDlaczego
Odpowiedź decyduje o wynikuClaude Opus 5.5Pierwszy na 211 i prowadzi na każdym benchmarku programistycznym poza tym, na którym jest remis.
Duży wolumen, płacisz za ukończone zadanieGPT-6 Astra$3,26 wobec $5,98 w indeksie, $7,47 wobec $13,04 w kodzie.
Ktoś na to czekaGPT-6 Astra29,4 minuty wobec 1,1 godziny, mimo że jest wolniejsza na token.
Prompty przekraczające 272 tys.Claude Opus 5.5Jedna stawka w całym oknie 1 mln, a Astrze całe zapytanie podwaja wejście.
Pętle agentowe oparte na cacheClaude Opus 5.5$0,20 wobec $1 na linii, która dominuje rachunek długiej pętli.
Prowadzenie terminalaClaude Opus 5.5Siedem punktów na Terminal-Bench 4.0, benchmarku oddzielającym pisanie kodu od uruchamiania go.

Opus 5.5 do jakości, długich promptów i pętli na cache. Astra do przepustowości i do wszystkiego, na co ktoś czeka.

Wewnątrz linii OpenAI tańszą wersję tej decyzji opisuje Sol kontra Astra. Po stronie Anthropica krok wyżej opisuje Opus 5.5 kontra Opus 5, razem z czterema łamiącymi zmianami w tym przejściu.

Co zmieniłoby moje zdanie

Oba modele w jednym harnessie. Każda liczba programistyczna tutaj to Astra w Codeksie wobec Opusa 5.5 w Claude Code, czyli dwie zmienne ruszają się naraz.

Przebieg przy niższym effortcie. Opus 5.5 domyślnie stoi na medium, a wszystkie liczby wyżej to max effort, z czego biorą się te 260 mln tokenów. Różnica na zadanie może się domknąć albo odwrócić przy ustawieniach domyślnych.

Zmiana reguły 272 tys. To jedna linijka, która czyni Opusa 5.5 kilkakrotnie tańszym przy długich promptach.

Pytania, które padają

Czy Claude Opus 5.5 jest lepszy od GPT-6 Astry?

W każdym opublikowanym wyniku tak. Artificial Analysis daje Opusowi 5.5 58 w Intelligence Index v4.3.2, a Astrze 53, co stawia Opusa 5.5 na pierwszym miejscu wśród 211 modeli, a Astrę na szóstym. W harnessie programistycznym kolejność się powtarza: Claude Code z Opusem 5.5 ma 66, Codex z Astrą 62, a Opus 5.5 prowadzi na Terminal-Bench 4.0 o siedem punktów i na SWE-Atlas-QnA o cztery, przy remisie 68% na DeepSWE v1.1.

Co jest tańsze, GPT-6 Astra czy Claude Opus 5.5?

Zależy, którą liczbę masz na myśli, bo obie mówią co innego. Za token Opus 5.5 jest o 60% tańszy: $4 za wejście i $20 za wyjście za milion wobec $10 i $50 Astry, oraz $0,20 wobec $1 za cache. Na ukończone zadanie tańsza o 45% jest Astra: Artificial Analysis zmierzyło $3,26 wobec $5,98, bo Opus 5.5 wygenerował w przebiegu indeksu 260 mln tokenów, a Astra 60 mln. Na zadaniach programistycznych różnica rośnie do $7,47 wobec $13,04.

Co jest szybsze, GPT-6 Astra czy Claude Opus 5.5?

Opus 5.5 generuje szybciej i kończy później. Artificial Analysis mierzy dla Opusa 5.5 ok. 95 tokenów wyjściowych na sekundę, a dla Astry ok. 64, ale Opus 5.5 pisze mniej więcej cztery razy więcej tokenów, więc spędza nad tą samą pracą dużo więcej czasu. Na benchmarku programistycznym wychodzi to jako 1,1 godziny na zadanie wobec 29,4 minuty.

Wybierać GPT-6 Astrę czy Claude Opus 5.5?

Opusa 5.5, kiedy o wyniku decyduje jakość odpowiedzi, kiedy prompty są długie albo kiedy praca i tak siedzi w Claude Code: ma wyższe wyniki wszędzie, kosztuje piątą część Astry za cache i trzyma jedną stawkę w całym oknie 1 mln. Astrę, kiedy płacisz za ukończone zadanie przy dużym wolumenie albo kiedy ktoś czeka, bo kosztuje mniej więcej połowę na zadanie i oddaje robotę w ułamku czasu.

Jeśli wybierasz flagowca do produktu agentowego i chcesz mieć spisaną regułę routingu, strona kontaktowa to najszybsza droga do mnie.

Udostępnij artykuł

O autorze

Wojciech Łuszczyński

Wojciech Łuszczyński

Architekt GTM i operator wzrostu budujący natywne dla AI systemy przychodów dla B2B SaaS i firm technologicznych. Łączę pozycjonowanie, SEO, treści, płatne pozyskiwanie, CRM, automatyzację, analitykę i przepływy pracy AI w praktyczną infrastrukturę wzrostu.

Newsletter

Najpierw zdobądź następny.

Kiedy opublikuję nowy artykuł na temat systemów AI, architektury GTM lub modeli operacyjnych wzrostu, dowiesz się o tym jako pierwszy.

Subskrybuj