GPT-5.6 gegen Claude 5: Die ersten Tests sagen, die größte Verschiebung ist kein neuer Benchmark-Sieger
GPT-5.6 Luna erreicht 51,2 Punkte gegen 53 von Claude Sonnet 5, zu einem Zehntel des Preises. Wann das günstige Modell gewinnt und wann nicht.
GTM Architect & Growth Operator · Insights · 8. September 2026
Kurzfassung · Die wichtigsten Punkte
- Claude Fable 5 führt den Artificial Analysis Intelligence Index mit 60 Punkten. GPT-5.6 Sol liegt bei 59 und absolviert denselben Benchmark zu etwa einem Drittel der Kosten von Fable. Der Abstand ist inzwischen Geld, nicht Können.
- GPT-5.6 sind drei Modelle statt einem: Sol als Flaggschiff, Terra als ausgewogene Stufe mit Index 55 zu 2 / 12 Dollar und Luna für Menge mit Index 51 zu 0,20 / 1,20 Dollar. Die kluge Voreinstellung ist Terra, mit Sol als Eskalation.
- Günstiger je Token heißt nicht günstiger je Ergebnis. Sonnet 5 verbrauchte in einem Benchmark rund 300 Millionen Token, das Fünffache des Medians.
- Hören Sie auf zu fragen, welches Modell das beste ist. Verteilen Sie die Arbeit: Luna zu Terra zu Sol, oder Sonnet zum Ausführen und Fable zum Planen. Gewinner ist die Architektur, nicht die Zeile mit der höchsten Zahl.
OpenAI und Anthropic haben ihre neuesten Modellgenerationen im Abstand weniger Wochen veröffentlicht. Oberflächlich sieht das nach der nächsten Runde Benchmark-Krieg aus. Ist es nicht. Der interessante Schritt ist struktureller Art, und er ändert, wie ich auf beiden Stacks bauen würde.
OpenAI verkauft nicht mehr ein einziges bestes GPT. GPT-5.6 ist eine Familie aus drei Modellen:
- GPT-5.6 Sol, das Flaggschiff,
- GPT-5.6 Terra, die ausgewogene Stufe aus Leistung und Kosten,
- GPT-5.6 Luna, die schnelle, günstige Stufe für Menge.
Anthropic positioniert zwei:
- Claude Fable 5 als leistungsfähigstes breit verfügbares Modell,
- Claude Sonnet 5 als praktisches agentisches Modell für Alltag, Automatisierung und Code.
Alle fünf tragen rund eine Million Token Kontext und bis zu 128.000 Ausgabetoken. Das Kontextfenster ist kein Unterscheidungsmerkmal mehr. Was sie heute trennt, sind Verlässlichkeit, Kosten je fertiger Aufgabe, Werkzeugnutzung, Geschwindigkeit und wie viel Aufsicht sie brauchen, um ohne mich zu laufen.
| Modell | Intelligence Index | In / Out je 1M | Sinnvollste Rolle |
|---|---|---|---|
| Claude Fable 5 | 60 | 10 $ / 50 $ | Schwerste Probleme, Analyse, Planung, riskanter Code |
| GPT-5.6 Sol | 59 | 4 $ / 20 $ | Spitzenleistung zu besserer Ökonomie, starke Codex-Anbindung |
| GPT-5.6 Terra | 55 | 2 $ / 12 $ | Standardmodell für den beruflichen Alltag |
| Claude Sonnet 5 | 53 | 2 $ / 10 $ | Klar beschriebene agentische Ausführung und Claude Code |
| GPT-5.6 Luna | 51 | 0,20 $ / 1,20 $ | Schnelle, mengenstarke, günstige Arbeitslasten |
Fünf Modelle auf einen Blick. Artificial Analysis Intelligence Index, veröffentlichte API-Listenpreise und der Platz, an dem sich jedes rechnet. Der Rest dieses Textes erklärt, warum die hervorgehobene Zeile nicht die ganze Geschichte ist.
Der zentrale Befund: Fable führt, Sol liegt einen Punkt dahinter zum Drittel des Preises
Claude Fable 5 erreichte 60 Punkte im Artificial Analysis Intelligence Index. GPT-5.6 Sol kam bei maximalem Reasoning auf 59. Artificial Analysis bezifferte Sols Kosten in dieser Auswertung auf etwa 1,04 Dollar je Aufgabe, ungefähr ein Drittel von Fable. Sol übernahm zudem die Führung im Coding Agent Index mit 80 Punkten.
Artificial Analysis Intelligence Index
+2% vs baselineDas ist kein Niederschlag. Es ist eine Veränderung der Marktökonomie.
Fable kann weiterhin die richtige Wahl für das eine schwerste Problem sein, wo die Modellkosten weniger zählen als die Wahrscheinlichkeit einer richtigen Antwort. Sol wirkt wie die bessere Voreinstellung für wiederholte Arbeit auf Spitzenniveau, besonders für alles, was Sie mehrmals täglich ausführen.
Was GPT-5.6 tatsächlich ändert
Sol: nah an Fable, spürbar günstiger
GPT-5.6 Sol kostet 4 Dollar pro Million Input-Token und 20 Dollar Output. Fable 5 kostet 10 und 50 Dollar.
Der Tokenpreis allein sagt nie die Wahrheit, denn Modelle verbrauchen unterschiedlich viel Reasoning, brauchen unterschiedlich viele Schritte und unterschiedlich viel menschliche Korrektur. Aber die unabhängige Zahl zu den Kosten je Aufgabe zeigt, dass Sols Vorteil mehr ist als ein Trick der Preistabelle.
Sol-Kosten je Aufgabe
1,04 $
Artificial-Analysis-Auswertung
Fable gegenüber Sol
~3x
günstiger
gleicher Benchmark
Sol, Coding Agent Index
80
derzeit führend
Claire Vo ließ Sol, Terra, Luna, Fable und Sonnet gegen PRDs, Prototypen, Wireframes, Debugging und agentische Sprachaufgaben antreten. Sol gewann den Gesamttest, am stärksten bei PRDs, Prototyping und Browsernutzung. Fables Problem war nicht die reine Leistungsfähigkeit. Es waren übertriebene Genauigkeit und ein sperrigerer Umgangsstil während der Arbeit selbst.
Frühe Entwicklerberichte zeigen in dieselbe Richtung. Sol wird als nah an Fable beschrieben, dabei schneller, günstiger und verlässlicher bei Änderungen, die mehrere Schichten eines Systems zugleich berühren. Anekdoten, keine kontrollierten Versuche, aber die Richtung passt zu den unabhängigen Zahlen.
Fable hat nicht an Leistungsfähigkeit verloren. Es hat daran verloren, wie viel Arbeit die Zusammenarbeit war.
Terra ist womöglich das wichtigste Modell der Veröffentlichung
Sol bekommt die Aufmerksamkeit. Terra hat womöglich die größere betriebliche Wirkung.
Terra kostet 2 Dollar pro Million Input-Token und 12 Dollar Output. OpenAI beschreibt es als konkurrenzfähig zu GPT-5.5 zur Hälfte der Kosten. Artificial Analysis gab ihm 55 Punkte im Index, vier hinter Sol.
Das reicht für einen großen Teil echter Produktionsarbeit:
Betriebswirtschaftliche Analyse
TerraLiest, fasst zusammen und denkt über unaufgeräumte Eingaben gut genug nach, um eine Entscheidung vorzubereiten.
Dokumenten- und Recherchearbeit
TerraDie Mengenschicht professioneller Ergebnisse: Entwürfe, Extraktion, Synthese über mehrere Quellen.
Codeerzeugung und Refactoring
TerraÄnderungen mittlerer Schwierigkeit mit klarem Umfang, nicht die mehrdeutigen Architekturentscheidungen.
Werkzeugnutzung und Agentenausführung
TerraMehrstufige Läufe, bei denen der Plan feststeht und das Modell ihn ausführt.
Nicht alle sind überzeugt. Manche Tester weisen darauf hin, dass Terra bei mehreren einzelnen Benchmarks unter GPT-5.5 liegt und sich eher wie ein destilliertes Mittelklassemodell verhält als wie ein günstigeres Sol. Berechtigt. Ein starker Gesamtwert bedeutet keine gleichmäßige Qualität über jede Arbeitslast. Für ein Unternehmen lautet die Frage aber nicht “gewinnt Terra jede Auswertung”. Sie lautet:
Erledigt Terra genug unserer Aufgaben, dass sich Sol als Voreinstellung erübrigt?
Für viele Arbeitslasten lautet die Antwort ja.
Luna zeigt, wie schnell Leistungsfähigkeit billig wird
GPT-5.6 Luna kostet 0,20 Dollar pro Million Input-Token und 1,20 Dollar Output. Es erreichte 51,2 Punkte im Index, nur knapp unter Sonnet 5 bei maximalem Reasoning.
Das heißt nicht, dass Luna Sonnet bei jeder Aufgabe schlägt. Sonnet kann bei bestimmter agentischer, programmierender oder langlaufender Arbeit deutlich besser sein. Was Luna zeigt, ist der Preisdruck, den GPT-5.6 erzeugt: Leistung, die vor Kurzem ein teures Spitzenmodell brauchte, sitzt jetzt in einer Zwanzig-Cent-Stufe.
Wo Luna die vernünftige Wahl ist
Beurteilen Sie Luna nach der Arbeit, die es wirtschaftlich erst möglich macht, nicht danach, ob es Fable beim schwersten denkbaren Problem schlägt.
Große Menge, wenig Mehrdeutigkeit, klares Bestanden oder Durchgefallen. Die klassische Aufgabe für ein günstiges Modell.
Erste Entwürfe, Varianten, Umschreibungen in Menge, bei denen ohnehin ein Mensch nachbearbeitet.
Aufgabe sichten, Schwierigkeit bestimmen, die schweren an eine stärkere Stufe weiterreichen.
Die beste Architektur ist also nicht Sol für alles. Sie verteilt Arbeit nach Schwierigkeit und Risiko.
Fable 5 hat weiterhin das stärkste Argument bei reiner Leistungsfähigkeit
Claude Fable 5 bleibt Erster im allgemeinen Index und schneidet besonders gut bei langen analytischen Aufgaben, agentischem Programmieren, Prototyping, Tabellenarbeit und Problemen ab, die Selbstprüfung verlangen. Anthropics frühe Partner beschrieben es als fähig, Arbeit abzuschließen, die früher viele Anläufe brauchte, und die eigene Ausgabe bei höchster Anstrengung zu prüfen.
Fable erreichte außerdem 80 Prozent bei SWE-Bench Pro gegen 64,6 Prozent von Sol. Sol führte dagegen Terminal-Bench 2.1 mit 88,8 Prozent gegen 83,1 Prozent von Fable.
SWE-Bench Pro
+24% vs baselineTerminal-Bench 2.1
+7% vs baselineDie beiden Benchmarks messen verschiedene Aufgaben, und die Umgebung zählt so viel wie das Modell:
- SWE-Bench belohnt das Beheben definierter Probleme in einem Repository.
- Terminal-Bench prüft Arbeit in einer Terminalumgebung.
- Codex und Claude Code legen ihre eigene Umgebung, Systemprompts, Kontextverwaltung und Werkzeugstrategien darüber.
Dasselbe zugrundeliegende Modell verhält sich anders über eine rohe API, in Claude Code, in Codex oder in einem fremden Agenten-Framework. Beurteilen Sie die Umgebung, nicht nur die Gewichte.
Fables echte Nachteile sind Kosten und Zugang. Nach der zeitweiligen Aussetzung kam das Modell weltweit zurück, aber viele Nutzer kritisierten Anthropic dafür, die Fable-Nutzung aus den normalen Kontingenten heraus und auf zusätzlich bezahlte Credits verlagert zu haben. Fable ist womöglich der beste Spezialist, ohne die beste Standardbesetzung zu sein.
Sonnet 5: ein fähiges Modell mit einem Positionierungsproblem
Sonnet 5 sollte eine einfache Frage beantworten: Welches Claude-Modell soll man täglich nutzen?
Die Produktgeschichte ist attraktiv. Sonnet 5 ist über alle Claude-Pläne verfügbar, Voreinstellung für Free und Pro, läuft in Claude Code und kostet 2 Dollar pro Million Input-Token und 10 Dollar Output. Das begann als Einführungspreis, der am 31. August 2026 auslaufen sollte, doch Anthropic hat bestätigt, dass die geplante Erhöhung auf 3 und 15 Dollar nicht kommt und 2 / 10 Dollar nun der Standardpreis ist. Anthropic bewirbt es als spürbar agentischer als Sonnet 4.6: besser darin, mehrstufige Aufgaben zu beenden, die eigene Ausgabe zu prüfen und in unaufgeräumten bestehenden Codebasen zu arbeiten.
Das unabhängige Bild ist gemischter.
Das macht Sonnet 5 nicht schwach. Es legt nahe, dass die Planung stark mehrdeutiger Arbeit nicht seine natürliche Rolle ist. Eine vernünftigere Aufteilung:
| Die Aufgabe | Meine Wahl | Warum |
|---|---|---|
| Architektur, Planung, hohe Unsicherheit | Fable oder Sol | Teuer ist es, falsch zu liegen. Zahlen Sie für das Modell, das Sie am unwahrscheinlichsten auf einen falschen Weg schickt. |
| Eine klar beschriebene Aufgabe umsetzen | Sonnet 5 | Der Umfang steht, die Arbeit ist die Ausführung. Hier zeigt sich die agentische Stärke, und der Preis stimmt. |
| Wirtschaftliche tägliche Analyse und Ausführung | Terra | Spitzennahe Qualität zur Hälfte der Flaggschiffkosten, für die Masse professioneller Ergebnisse. |
| Menge und risikoarme Abläufe | Luna | Menge, die nie ein Spitzenmodell rechtfertigte, läuft heute für zwanzig Cent je Million Eingang. |
Passen Sie das Modell an das Risiko der Aufgabe an, nicht an eine einzelne Zeile einer Rangliste.
Der eigentliche Wettbewerb: ChatGPT Work und Codex gegen Claude Cowork und Claude Code
Vergleiche allein zwischen Modellen beschreiben echte Produktivität von Monat zu Monat schlechter.
OpenAI hat GPT-5.6 über ChatGPT, ChatGPT Work, Codex und die API verteilt. Zahlende Nutzer wählen Sol, Terra oder Luna innerhalb von Work und Codex und steuern den Reasoning-Aufwand. Anthropic bietet ein vergleichbares System über Claude Chat, Cowork und Claude Code.
OpenAI: ChatGPT Work + Codex
bessere ÖkonomieSol, Terra und Luna wählbar in Work und Codex, Steuerung des Aufwands, Max- und Ultra-Modi, programmatische Werkzeugaufrufe und parallele Subagenten. Der Reiz liegt in der engeren Verzahnung mit dem übrigen ChatGPT und der aggressiveren Modellökonomie.
Anthropic: Cowork + Claude Code
reifere Entwickler-UXDieselbe Spanne an Aufgaben über Claude Chat, Cowork und Claude Code. Der Vorsprung bleibt Claude Code: weiterhin die reifste Entwicklererfahrung, besonders für die natürliche Arbeit an einer bestehenden, unaufgeräumten Codebasis.
Die ersten Rückmeldungen krönen keinen allgemeinen Sieger. Manche Entwickler bevorzugen weiterhin Claude für Frontend-Arbeit, für das Einhalten von Projektkonventionen und für Code, der näher an der Absicht liegt. Andere berichten, Codex mit Sol sei verlässlicher, wenn ein Problem mehrere Schichten eines Systems durchquert, und bleibe seltener in einer lokalen Lösung stecken.
Was die Zahlen wirklich sagen
Zwei Schlüsse überstehen alle Vorbehalte.
Erstens schrumpft der Leistungsabstand zwischen Flaggschiff und günstigeren Stufen. Ein Punkt trennt Fable und Sol im allgemeinen Index. Vier Punkte trennen Sol und Terra. Die teuren Modelle sind keine andere Liga mehr, nur eine andere Preisklasse.
Zweitens ist der Tokenpreis nicht die entscheidende Zahl. Ein günstigeres Modell kann je Ergebnis teurer sein, wenn es mehr Reasoning-Token erzeugt, mehr Schritte braucht oder mehr Korrektur verlangt. Kosten je fertigem Ergebnis sind die einzige Größe, die eine Gewinn- und Verlustrechnung berührt, und sie steht auf keiner Preisseite.
Was die Preisseite zeigt
Kosten je Token
Was Ihr Budget wirklich trifft
Kosten je fertigem Ergebnis
Wie ich die Arbeit verteilen würde
Für die meiste berufliche Arbeit: Terra
Terra ist der beste Ausgangspunkt für Analyse, Recherche, Dokumentenarbeit, Inhalte und mittelschweres Programmieren. Sol sollte ein Eskalationsweg sein, keine allgemeine Voreinstellung.
Für die schwersten Probleme: Sol oder Fable
Fable behält einen knappen Gesamtvorsprung und ist bei langen, komplexen Aufgaben stark. Sol liefert nahezu dieselbe Leistung zu deutlich besserer Ökonomie und ist die pragmatischere Voreinstellung für eine Organisation.
In Claude Code: Sonnet führt aus, Fable plant
Sonnet 5 passt zu klar definierter Umsetzung. Bei mehrdeutiger Architekturarbeit kostet es meist weniger, den Plan mit einem stärkeren Modell vorzubereiten, als das günstigere dreimal zu korrigieren.
Für Automatisierung in großer Menge: Luna
Beurteilen Sie Luna nicht danach, ob es Fable beim schwersten Problem schlägt. Sein Wert liegt darin, ganze Arbeitsbereiche zu ermöglichen, die sich mit Spitzenmodellen nie gerechnet haben.
Fazit
OpenAI musste Fable nicht deutlich schlagen. Es musste nur zu deutlich geringeren Kosten nah herankommen und dann dieselbe Generation an Leistung über drei wirtschaftliche Stufen verteilen. Dadurch wird “welches Modell ist das beste” zur schwächeren Frage.
Bessere Fragen:
- Welches Modell beendet meinen konkreten Arbeitsablauf tatsächlich?
- Wie viel Aufsicht braucht es?
- Was kostet ein richtiges Ergebnis, nicht eine Million Token?
- Kann es über meine Dokumente, Anwendungen und Repositories hinweg arbeiten?
- Wann soll die Arbeit automatisch an ein stärkeres Modell eskalieren?
Spitzen-KI ist kein einzelnes Modell mehr. Sie wird zu einem gestuften Produktionssystem. In diesem System gewinnt nicht das Modell mit der höchsten Zahl in einer Tabelle. Es gewinnt die Architektur, die die richtige Aufgabe an die richtige Stufe von Intelligenz weiterreicht.
Häufige Fragen zu GPT-5.6 und Claude 5
Ist GPT-5.6 Luna besser als Claude Sonnet 5?
Bei der reinen Leistungsfähigkeit nein: Luna erreicht 51,2 Punkte im Index, Sonnet 5 bei maximalem Reasoning 53. Beim Preis ist es umgekehrt deutlich: Luna kostet 0,20 Dollar je Million Input-Token und 1,20 Dollar Output, gegen 2 und 10 Dollar bei Sonnet 5. Das ist ein Zehntel der Eingangskosten für zwei Indexpunkte. Nehmen Sie Luna für Menge mit wenig Mehrdeutigkeit, wo ein falsches Ergebnis billig auffällt. Nehmen Sie Sonnet 5, wo die Aufgabe agentisch oder langlaufend ist. Die Falle ist, beide nach dem Preis je Token zu beurteilen statt nach den Kosten je fertiger Aufgabe.
Welches KI-Modell ist gerade das beste, GPT-5.6 oder Claude 5?
Im Index führt Claude Fable 5 mit 60 Punkten, GPT-5.6 Sol liegt mit 59 einen Punkt dahinter, absolviert den Benchmark aber zu etwa einem Drittel der Kosten. Terra ist möglicherweise das kommerziell nützlichste der fünf. Einen einzelnen Sieger gibt es nicht.
Ist GPT-5.6 günstiger als Claude Fable 5?
Ja. Sol kostet 4 / 20 Dollar gegen 10 / 50 Dollar bei Fable 5, und unabhängige Tests beziffern Sol auf etwa ein Drittel der Kosten je abgeschlossener Aufgabe. Terra mit 2 / 12 und Luna mit 0,20 / 1,20 Dollar unterbieten jede Claude-Stufe noch deutlicher.
Soll ich Claude Sonnet 5 in Claude Code nutzen?
Für klar beschriebene Umsetzung ja. Für mehrdeutige Architekturfragen planen Sie zuerst mit einem stärkeren Modell: Sonnet 5 braucht dort mehr Schritte, verbraucht mehr Kontext und kann je fertiger Aufgabe teurer werden.
Welches GPT-5.6-Modell eignet sich für den beruflichen Alltag?
Terra für das meiste, mit Sol als Eskalation für die schwersten Probleme und Luna für Menge mit geringem Risiko.
Wenn Sie das auf Ihren eigenen Stack angewandt haben möchten, ist die Kontaktseite der schnellste Weg zu mir.
