ModellatlasBENCHMARKS & KOSTEN
Datenstand 26.09.2026Quellen & Methodik ↗
Das interaktive Vergleichsstudio

Modelle vergleichen.
Abstände verstehen.

Vergleiche GPT-6, GPT-5.6, Claude, Gemini und Grok: Wähle einen Benchmark und zwei Modellstufen. Du siehst sofort, wie weit Leistung und Kosten auseinanderliegen.

So liest du die Grafik Oben links ist stark. Mehr Leistung bei geringeren Kosten.
01 / Benchmark

Was möchtest du messen?

Thema wählen oder nach einem Benchmark suchen.

FrontierCode 1.1 Main

02 / Direktvergleich

A gegen B: der Unterschied auf einen Blick

A
Abstand A zu B
B
03 / Leistung × Kosten

FrontierCode 1.1 Main

↑ höherer Score   ·   ← geringere Kosten
Kostenansicht

Punkt anklicken für
04 / Alle Werte

Ergebnisse im Benchmark

Wähle A oder B direkt in der Liste.

#ModellStufeScoreKosten je AufgabeHinweisQuelleVergleich
05 / Modell-Werkstatt

Vom Auftrag zur Modellwahl.

Ein Ablauf zum Mitspielen: Situation wählen, Prioritäten ändern und die Entscheidung verfolgen.

Interaktive Illustration
Was möchtest du erledigen?
Was zählt für dich?

Ablaufillustration · keine Live-Ausführung
01 / Dein Auftrag

02 / Modelle abwägen
03 / Auswahl & Prüfung Vorschlag nach deiner Regel

Score
Danach prüfen

Warum diese Auswahl?

Benchmark-Quelle ↗

Ein Benchmark liefert Anhaltspunkte, keine Eignungsgarantie für deinen konkreten Auftrag. Fehlende Preise und Kostenuntergrenzen werden nicht als exakte Kosten einsortiert. Die Ablaufgeschwindigkeit zeigt keine Modelllatenz.

Quellen, Preisgrundlagen und Vergleichbarkeit

Gemessene Kosten: FrontierCode zeigt den von Cognition ausgewiesenen mittleren USD-Aufwand je Rollout. AutomationBench verwendet den von OpenAI veröffentlichten Aufwand je Aufgabe. Abgeleitete Werte tragen ein „≈“, Untergrenzen ein „>“.

Token-Schätzung: Gleiche Eingabe- und Ausgabetoken werden mit den verlinkten API-Basispreisen multipliziert. Die Ausgabe enthält Reasoning-Tokens. Effort kann den tatsächlichen Verbrauch verändern. Langkontext-Aufschläge, Tools, Caching, Suche und Hosting sind nicht enthalten. Bei GPT-5.6 greifen beispielsweise ab mehr als 272.000 Eingabetokens je Anfrage erhöhte Tarife. Die Schätzung ist ein Vergleich zum Basistarif.

Preisstand: GPT-5.6 Sol verwendet den Aktionspreis von 4 / 20 USD je Million Eingabe-/Ausgabetokens, laut Anbieter mindestens bis 21.11.2026. Für Gemini 3.7/3.8 Flash gilt der Einführungspreis von 0,75 / 3,75 USD bis 31.12.2026. Diese lokale Datei aktualisiert Preise nicht automatisch.

Scores und Ultra: Benchmarkbetreiber und Modellanbieter nutzen teils unterschiedliche Harnesses, Tools, Effort-Stufen und Messzeitpunkte. Ein fehlender Wert bedeutet, dass in diesen Quellen kein belastbarer Wert für genau die ausgewählte Kombination steht. Für die Ultra-Einstellung liegen hier keine eigenen Messwerte vor. Daraus lässt sich weder ein Score noch ein fester Kostenaufschlag ableiten.