Zum Inhalt springen
wojciech.io
Modellvergleiche
AI SystemsAIOpenAIAI Systems

GPT-6 Sol hält bei Code mit GPT-6 Astra mit, zum Fünftel des Preises, und scheitert dann am Terminal

Sol listet zum Fünftel von Astras Preis und erreicht 48 gegen 53. Im selben Codex-Harness gewinnt es DeepSWE und verliert Terminal-Bench. Routen Sie nach Aufgabe, nicht nach Stufe.

Wojciech Luszczynski

Wojciech Luszczynski

GTM Architect & Growth Operator · Insights · 23. September 2026 · 6 Min. Lesezeit

Teilen

Kurzfassung · Die wichtigsten Punkte

  • GPT-6 Sol listet zu 2 / 10 Dollar je Million Token und GPT-6 Astra zu 10 / 50 Dollar. Fünffacher Preis für fünf Punkte im Index von Artificial Analysis, 48 gegen 53.
  • Pro Aufgabe schrumpft der Abstand auf etwa das Dreifache: 1,06 gegen 3,26 Dollar, weil Astra das knappere der beiden ist, mit 60 Millionen Token im Lauf gegen Sols 77 Millionen.
  • Im selben Codex-Harness erreicht Sol 69% auf DeepSWE v1.1 gegen Astras 68% und verliert dann Terminal-Bench 4.0 um dreizehn Punkte, 43% zu 56%. Ein Modell, zwei gegensätzliche Antworten.
  • Sol erzeugt etwa 125 Ausgabetoken pro Sekunde gegen Astras 53 und beendete den Coding-Benchmark in 22,3 Minuten je Aufgabe gegen 29,4.

OpenAI verkauft nun zwei Modelle für dieselbe Aufgabe mit fünffachem Preisunterschied. Die Stufentabelle sagt: Nehmen Sie Astra, wenn die Arbeit hart ist. Die Benchmark-Tabelle sagt, dieser Rat ist zu grob, um damit zu arbeiten.

Im selben Harness, am selben Tag, gewinnt Sol einen Coding-Benchmark und verliert einen anderen um dreizehn Punkte. Das ist eine Routing-Regel, keine Stufe.

InfoGPT-6 SolGPT-6 Astra
Eingabe / Ausgabe je 1 Mio.$2 / $10$10 / $50
Gecachte Eingabe je 1 Mio.$0.20$1.00
Über 272K Eingabetoken, ein / aus$4 / $15$20 / $75
Intelligence Index v4.3.24853
Kosten je Indexaufgabe$1.06$3.26
Im Index erzeugte Token77 Mio.60 Mio.
Ausgabetempo, Token/setwa 125etwa 53
Coding Agent Index, Codex-Harness5762
Kosten je Coding-Aufgabe$2.99$7.47
Zeit je Coding-Aufgabe22,3 Min.29,4 Min.

Preise und die 272K-Regel von OpenAIs Modellseiten. Indexwert, Kosten je Aufgabe, Token und Tempo von den Modellseiten von Artificial Analysis, Coding-Werte aus dessen Coding Agent Index v1.5. Gelesen am 23. September 2026.

Fünf Punkte, fünffacher Preis

Artificial Analysis bewertet Astra mit 53 und Sol mit 48 im Intelligence Index v4.3.2. Astra steht auf Platz sechs von 212 Modellen, Sol auf Platz achtzehn.

Auf der Preisliste kostet dieser Unterschied das Fünffache je Token. Bei einer fertigen Aufgabe kostet er etwa das Dreifache, 3,26 gegen 1,06 Dollar, und der Grund ist, dass Astra das knappere der beiden ist: 60 Millionen Token im Indexlauf gegen Sols 77 Millionen, was einen Teil dessen zurückholt, was die Preisliste nimmt. Astra denkt weniger. Es verlangt mehr für jedes Wort davon.

Die Aufspaltung der Benchmarks ist der nützliche Teil

Beide Modelle wurden im Codex-Harness auf denselben drei Coding-Benchmarks gemessen. Das Ergebnis ordnet sich nicht in eine einzige Reihenfolge.

BenchmarkGPT-6 SolGPT-6 AstraWas es bedeutet
DeepSWE v1.169%68%Softwareentwicklung auf Repository-Grösse. Sol liegt gleichauf mit einem Modell, das fünfmal so viel kostet.
Terminal-Bench 4.043%56%Agentische Terminal- und Umgebungsarbeit. Dreizehn Punkte, der breiteste Abstand im Satz.
SWE-Atlas-QnA58%62%Fragen zur Codebasis. Vier Punkte für Astra.
Coding Agent Index5762Der Gesamtwert. Astras Terminal-Vorsprung trägt den grössten Teil davon.
Token je Aufgabe9,8 Mio.3,3 Mio.Sol schreibt dreimal so viel, um dorthin zu kommen, und stellt trotzdem weniger in Rechnung.

Beide Modelle wurden innerhalb von Codex gemessen, der Harness ist also konstant gehalten. Der Gesamtwert verbirgt eine Aufspaltung, die mehr zählt als der Gesamtwert selbst.

Key takeaway

Sol hält beim Schreiben und Reparieren von Code mit Astra mit und fällt beim Steuern eines Terminals auseinander. Wenn der harte Teil Ihres Agenten die Umgebung ist und nicht das Diff, ist das günstigere Modell nicht das Ziel Ihres Routings.

Tempo ist der andere fünffache Unterschied

Sol erzeugt etwa 125 Ausgabetoken pro Sekunde. Astra schafft etwa 53, was Artificial Analysis unter den beobachteten Modellen als auffällig langsam kennzeichnet.

Bei Coding-Aufgaben ergab das 22,3 Minuten gegen 29,4. Der Abstand ist kleiner, als die reine Rate nahelegt, weil Sol dreimal so viele Token schreibt, um an dieselbe Stelle zu kommen. Wenn allerdings ein Mensch auf eine Fortschrittsanzeige schaut, ist Sol das Modell, das die Schleife lebendig wirken lässt.

Die 272K-Regel erwischt beide

Jeder Prompt über 272K Eingabetoken wird bei beiden Modellen für die gesamte Anfrage neu bepreist: doppelte Eingabe- und Cache-Sätze, anderthalbfache Ausgabe. Sol geht auf $4 / $15, Astra auf $20 / $75.

Das Verhältnis zwischen beiden bewegt sich nicht. Das ist also kein Grund, eines dem anderen vorzuziehen, sondern ein Grund, Prompts auf beiden unter dieser Linie zu halten.

Welches ich nehmen würde

Die ArbeitModellWarum
Code in einem Repository schreiben und reparierenGPT-6 SolGleichauf bei DeepSWE v1.1, 69% zu 68%, bei 40% der Kosten je Aufgabe.
Terminal-, Shell- und UmgebungsagentenGPT-6 AstraDreizehn Punkte Vorsprung bei Terminal-Bench 4.0. Die eine Stelle, an der der Preisabstand verdient ist.
Alles, worauf ein Mensch wartetGPT-6 SolEtwa 125 Ausgabetoken pro Sekunde gegen 53.
Läufe in Menge mit PrüferGPT-6 SolAlles auf der günstigen Stufe fahren, Fehlschläge auf Astra wiederholen. Die Aufteilung rechnet sich unterhalb einer Fehlerquote von 30%.
Der härteste einzelne DenkschrittGPT-6 AstraFünf Indexpunkte, und es kommt mit einem Drittel weniger Token dorthin.

Sol ist der Standard und Astra die Ausnahme, wobei Terminal-Arbeit die Ausnahme ist, die sich vorab leicht benennen lässt.

Anbieterübergreifend ist Sol gegen Claude Opus 5.5 dieselbe Frage mit einer anderen Preisleiter. Alle weiteren Paarungen stehen im Modellvergleich.

Was meine Meinung ändern würde

Ein Terminal-Bench-Ergebnis, das aufschliesst. Dreizehn Punkte sind der einzige Abstand hier, der eine Architektur verändert, und eine Punktversion könnte ihn halbieren.

Sol auf einer niedrigeren Aufwandsstufe. Jeder Wert hier ist max effort. Sols Vorteil sind die Kosten, und der grösste Teil dieser Kosten ist Denken, das es womöglich nicht braucht.

Ein anderer Harness als Codex. Beide Modelle wurden im selben Harness gemessen, was die richtige Kontrolle ist, aber es ist ein Harness.

Fragen, die gestellt wurden

Ist GPT-6 Astra besser als GPT-6 Sol?

Um fünf Punkte im allgemeinen Index und nicht durchgängig beim Programmieren. Artificial Analysis bewertet Astra mit 53 und Sol mit 48 im Intelligence Index v4.3.2. In den Coding-Messungen im Codex-Harness führt Astra im Index mit 62 zu 57 und bei Terminal-Bench 4.0 um dreizehn Punkte, aber Sol liegt bei DeepSWE v1.1 knapp vorn, 69% zu 68%. Die Stufenordnung hält im Mittel und bricht bei bestimmten Aufgabenformen.

Wie viel günstiger ist GPT-6 Sol als GPT-6 Astra?

Fünfmal pro Token und etwa dreimal pro Aufgabe. Sol listet zu $2 je Million Eingabetoken und $10 Ausgabe gegen Astras $10 und $50, gecachte Eingabe kostet $0.20 gegen $1. Artificial Analysis mass $1.06 je Indexaufgabe auf Sol und $3.26 auf Astra, bei Coding-Aufgaben im Codex-Harness lagen die Werte bei $2.99 und $7.47.

Was ist schneller, GPT-6 Sol oder GPT-6 Astra?

Sol, um mehr als das Doppelte. Artificial Analysis misst etwa 125 Ausgabetoken pro Sekunde für Sol und etwa 53 für Astra, das es als auffällig langsam einstuft. Bei Coding-Aufgaben lag Sol im Schnitt bei 22,3 Minuten gegen Astras 29,4.

Soll ich GPT-6 Sol oder GPT-6 Astra einsetzen?

Sol als Standard für Menge: agentisches Programmieren, Retrieval, alles, was Sie tausendfach fahren oder prüfen und wiederholen können. Astra für Terminal- und Umgebungsarbeit, wo es um dreizehn Punkte führt, und für die harten Schritte, bei denen fünf Indexpunkte das Ergebnis drehen. Beide bepreisen oberhalb von 272K Eingabetoken neu, lange Kontexte sind also auf beiden teuer.

Wenn Sie die Routing-Regel zwischen diesen beiden in einem laufenden Agenten-Stack festgeschrieben haben wollen, ist die Kontaktseite der schnellste Weg zu mir.

Artikel teilen

Über den Autor

Wojciech Luszczynski

Wojciech Luszczynski

GTM-Architekt und Growth Operator, der KI-native Umsatzsysteme für B2B-SaaS- und Technologieunternehmen baut. Ich verbinde Positionierung, SEO, Content, bezahlte Akquise, CRM, Automatisierung, Analytics und KI-Workflows zu einer praktikablen Wachstumsinfrastruktur.

Newsletter

Den nächsten zuerst lesen.

Wenn ich einen neuen Beitrag über KI-Systeme, GTM-Architektur oder operative Wachstumsmodelle veröffentliche, erfahren Sie es als Erstes.

Abonnieren