Przejdź do treści
wojciech.io
Wszystkie spostrzeżenia
AI SystemsAIOpenAIAI Systems

GPT-6 Sol bije Astrę na benchmarku SWE i przegrywa pracę w terminalu o trzynaście punktów

Sol kosztuje jedną piątą ceny Astry i ma 48 wobec 53. W tym samym harnessie wygrywa DeepSWE i przegrywa Terminal-Bench. Routuj po zadaniu.

Wojciech Łuszczyński

Wojciech Łuszczyński

GTM Architect & Growth Operator · Insights · 23 września 2026 · 6 min czytania

Udostępnij

TL;DR · Najważniejsze wnioski

  • GPT-6 Sol kosztuje $2 / $10 za milion tokenów, a GPT-6 Astra $10 / $50. Pięć razy drożej za pięć punktów w indeksie Artificial Analysis, 48 wobec 53.
  • Na zadanie różnica spada do około trzech razy: $1,06 wobec $3,26, bo to Astra jest zwięźlejsza, 60 mln tokenów w przebiegu wobec 77 mln Sola.
  • W tym samym harnessie Codex Sol ma 69% na DeepSWE v1.1 wobec 68% Astry, a potem przegrywa Terminal-Bench 4.0 o trzynaście punktów, 43% do 56%. Jeden model, dwie przeciwne odpowiedzi.
  • Sol generuje w tempie ok. 125 tokenów wyjściowych na sekundę wobec 53 Astry i kończył zadanie programistyczne w 22,3 minuty wobec 29,4.

OpenAI sprzedaje teraz dwa modele do tej samej roboty przy pięciokrotnej różnicy ceny. Tabelka poziomów mówi: bierz Astrę, kiedy zadanie jest trudne. Tabela benchmarków mówi, że ta rada jest za gruba, żeby dało się jej użyć.

W tym samym harnessie, tego samego dnia, Sol wygrywa jeden benchmark programistyczny i przegrywa drugi o trzynaście punktów. To jest reguła routingu, a nie poziom cennika.

InfoGPT-6 SolGPT-6 Astra
Wejście / wyjście za 1 mln$2 / $10$10 / $50
Cache na wejściu za 1 mln$0,20$1,00
Powyżej 272 tys. tokenów, wej. / wyj.$4 / $15$20 / $75
Intelligence Index v4.3.24853
Koszt zadania w indeksie$1,06$3,26
Tokeny wygenerowane w indeksie77 mln60 mln
Prędkość wyjścia, tokeny/sok. 125ok. 53
Coding Agent Index, harness Codex5762
Koszt zadania programistycznego$2,99$7,47
Czas na zadanie programistyczne22,3 min29,4 min

Ceny i reguła 272 tys. ze stron modeli OpenAI. Wynik indeksu, koszt zadania, tokeny i prędkość z kart modeli Artificial Analysis; liczby programistyczne z Coding Agent Index v1.5. Odczyt 23 września 2026.

Pięć punktów, pięć razy cena

Artificial Analysis daje Astrze 53, a Solowi 48 w Intelligence Index v4.3.2. Astra stoi szósta wśród 212 modeli, Sol osiemnasty.

W cenniku ta różnica kosztuje pięć razy więcej za token. Na ukończonym zadaniu kosztuje około trzy razy, $3,26 wobec $1,06, a powód jest taki, że to Astra jest zwięźlejsza z tej dwójki: 60 mln tokenów w przebiegu indeksu wobec 77 mln Sola, co odbiera część tego, co zabiera cennik. Astra myśli mniej. I bierze więcej za każde słowo tego myślenia.

Rozjazd benchmarków jest tu najciekawszy

Oba modele zmierzono w harnessie Codex na tych samych trzech benchmarkach programistycznych. Wynik nie układa się w jedną kolejność.

BenchmarkGPT-6 SolGPT-6 AstraCo to znaczy
DeepSWE v1.169%68%Inżynieria oprogramowania na skalę repo. Sol jest na równi z modelem pięć razy droższym.
Terminal-Bench 4.043%56%Agentowa praca w terminalu i środowisku. Trzynaście punktów, największa różnica w zestawie.
SWE-Atlas-QnA58%62%Odpowiadanie na pytania o kod. Cztery punkty dla Astry.
Coding Agent Index5762Wynik zbiorczy. Niesie go głównie przewaga Astry w terminalu.
Tokeny na zadanie9,8 mln3,3 mlnSol pisze trzy razy więcej, żeby tam dojść, i i tak płaci mniej.

Oba modele mierzone wewnątrz Codeksa, więc harness jest stały. Wynik zbiorczy ukrywa rozjazd ważniejszy niż on sam.

Key takeaway

Sol dorównuje Astrze w pisaniu i naprawianiu kodu, i rozsypuje się przy prowadzeniu terminala. Jeśli trudną częścią twojego agenta jest środowisko, a nie diff, tańszy model nie jest tym, na który routować.

Prędkość to druga pięciokrotna różnica

Sol generuje w tempie ok. 125 tokenów wyjściowych na sekundę. Astra wyciąga ok. 53, co Artificial Analysis oznacza jako wyraźnie wolno na tle modeli, które śledzi.

Na zadaniach programistycznych wyszło 22,3 minuty wobec 29,4. Różnica jest mniejsza, niż sugeruje surowe tempo, bo Sol pisze trzy razy więcej tokenów, żeby dojść w to samo miejsce. Mimo to, jeśli ktoś patrzy na pasek postępu, Sol jest tym modelem, przy którym pętla wygląda na żywą.

Reguła 272 tys. łapie oba

Każdy prompt powyżej 272 tys. tokenów wejścia jest przeliczany dla całego zapytania na obu modelach: 2x wejście i cache, 1,5x wyjście. Sol idzie na $4 / $15, Astra na $20 / $75.

Stosunek między nimi się nie rusza. Więc to nie jest powód, żeby wybrać jeden zamiast drugiego: to powód, żeby trzymać prompty pod tą linią na obu, a arytmetykę po stronie Astry rozpisuje Astra kontra Claude Opus 5.

Czego bym użył

Rodzaj pracyModelDlaczego
Pisanie i naprawianie kodu w repoGPT-6 SolNa równi na DeepSWE v1.1, 69% do 68%, za 40% kosztu zadania.
Agenci w terminalu, shellu i środowiskuGPT-6 AstraTrzynaście punktów przewagi na Terminal-Bench 4.0. Jedyne miejsce, gdzie różnica ceny jest zarobiona.
Cokolwiek, na co ktoś czekaGPT-6 SolOk. 125 tokenów wyjściowych na sekundę wobec 53.
Masowe przebiegi z weryfikatoremGPT-6 SolPuść wszystko na tanim poziomie i powtórz porażki na Astrze. Podział zwraca się poniżej 30% porażek.
Najtrudniejszy pojedynczy krok rozumowaniaGPT-6 AstraPięć punktów indeksu, i dochodzi tam na jedną trzecią mniej tokenów.

Sol jest domyślny, Astra jest wyjątkiem, a praca w terminalu to wyjątek, który da się nazwać z góry.

Astrę wobec całej linii Anthropica opisuje GPT-6 Astra kontra Claude. Między dostawcami to samo pytanie z inną drabinką cen stawia Sol kontra Claude Opus 5.5.

Co zmieniłoby moje zdanie

Wynik Terminal-Bench, który się domyka. Trzynaście punktów to jedyna różnica tutaj, która zmienia architekturę, a jedno wydanie punktowe może ją zmniejszyć o połowę.

Sol na niższym poziomie effort. Każda liczba w tym tekście to max effort. Przewagą Sola jest koszt, a większość tego kosztu to myślenie, którego może nie potrzebować.

Harness inny niż Codex. Oba modele zmierzono wewnątrz jednego harnessu, co jest właściwą kontrolą, ale to jeden harness.

Pytania, które padają

Czy GPT-6 Astra jest lepsza od GPT-6 Sol?

O pięć punktów w ogólnym indeksie i nie jednolicie w kodowaniu. Artificial Analysis daje Astrze 53, a Solowi 48 w Intelligence Index v4.3.2. W pomiarach w harnessie Codex Astra prowadzi w indeksie, 62 do 57, i na Terminal-Bench 4.0 o trzynaście punktów, ale Sol wygrywa na DeepSWE v1.1, 69% do 68%. Kolejność poziomów trzyma się średnio i pęka na konkretnych kształtach zadań.

O ile GPT-6 Sol jest tańszy od GPT-6 Astry?

Pięć razy za token i około trzy razy na zadanie. Sol kosztuje $2 za milion tokenów wejściowych i $10 za wyjściowe wobec $10 i $50 Astry, a cache $0,20 wobec $1. Artificial Analysis zmierzyło $1,06 na zadanie w indeksie na Solu i $3,26 na Astrze; na zadaniach programistycznych w harnessie Codex wyszło $2,99 i $7,47.

Co jest szybsze, GPT-6 Sol czy GPT-6 Astra?

Sol, ponad dwukrotnie. Artificial Analysis mierzy ok. 125 tokenów wyjściowych na sekundę dla Sola i ok. 53 dla Astry, którą nazywa wyraźnie wolną. Na zadaniach programistycznych Sol brał średnio 22,3 minuty wobec 29,4 Astry.

Wybierać GPT-6 Sol czy GPT-6 Astrę?

Sola jako domyślny model do objętości: kodowanie agentowe, retrieval, wszystko co puszczasz tysiące razy albo możesz zweryfikować i powtórzyć. Astrę do pracy w terminalu i środowisku, gdzie prowadzi o trzynaście punktów, i do trudnych kroków, gdzie pięć punktów indeksu zmienia wynik. Oba przeliczają cenę powyżej 272 tys. tokenów wejścia, więc długi kontekst jest drogi na obu.

Jeśli chcesz mieć regułę routingu między tą dwójką wpisaną w działający stos agentowy, strona kontaktowa to najszybsza droga do mnie.

Udostępnij artykuł

O autorze

Wojciech Łuszczyński

Wojciech Łuszczyński

Architekt GTM i operator wzrostu budujący natywne dla AI systemy przychodów dla B2B SaaS i firm technologicznych. Łączę pozycjonowanie, SEO, treści, płatne pozyskiwanie, CRM, automatyzację, analitykę i przepływy pracy AI w praktyczną infrastrukturę wzrostu.

Newsletter

Najpierw zdobądź następny.

Kiedy opublikuję nowy artykuł na temat systemów AI, architektury GTM lub modeli operacyjnych wzrostu, dowiesz się o tym jako pierwszy.

Subskrybuj