ModellatlasBENCHMARKS & KOSTEN
Modelle vergleichen.
Abstände verstehen.
Vergleiche GPT-6, GPT-5.6, Claude, Gemini und Grok: Wähle einen Benchmark und zwei Modellstufen. Du siehst sofort, wie weit Leistung und Kosten auseinanderliegen.
Was möchtest du messen?
Thema wählen oder nach einem Benchmark suchen.
A gegen B: der Unterschied auf einen Blick
FrontierCode 1.1 Main
Ergebnisse im Benchmark
Wähle A oder B direkt in der Liste.
| # | Modell | Stufe | Score | Kosten je Aufgabe | Hinweis | Quelle | Vergleich |
|---|
Vom Auftrag zur Modellwahl.
Ein Ablauf zum Mitspielen: Situation wählen, Prioritäten ändern und die Entscheidung verfolgen.
Ein Benchmark liefert Anhaltspunkte, keine Eignungsgarantie für deinen konkreten Auftrag. Fehlende Preise und Kostenuntergrenzen werden nicht als exakte Kosten einsortiert. Die Ablaufgeschwindigkeit zeigt keine Modelllatenz.
Quellen, Preisgrundlagen und Vergleichbarkeit
Gemessene Kosten: FrontierCode zeigt den von Cognition ausgewiesenen mittleren USD-Aufwand je Rollout. AutomationBench verwendet den von OpenAI veröffentlichten Aufwand je Aufgabe. Abgeleitete Werte tragen ein „≈“, Untergrenzen ein „>“.
Token-Schätzung: Gleiche Eingabe- und Ausgabetoken werden mit den verlinkten API-Basispreisen multipliziert. Die Ausgabe enthält Reasoning-Tokens. Effort kann den tatsächlichen Verbrauch verändern. Langkontext-Aufschläge, Tools, Caching, Suche und Hosting sind nicht enthalten. Bei GPT-5.6 greifen beispielsweise ab mehr als 272.000 Eingabetokens je Anfrage erhöhte Tarife. Die Schätzung ist ein Vergleich zum Basistarif.
Preisstand: GPT-5.6 Sol verwendet den Aktionspreis von 4 / 20 USD je Million Eingabe-/Ausgabetokens, laut Anbieter mindestens bis 21.11.2026. Für Gemini 3.7/3.8 Flash gilt der Einführungspreis von 0,75 / 3,75 USD bis 31.12.2026. Diese lokale Datei aktualisiert Preise nicht automatisch.
Scores und Ultra: Benchmarkbetreiber und Modellanbieter nutzen teils unterschiedliche Harnesses, Tools, Effort-Stufen und Messzeitpunkte. Ein fehlender Wert bedeutet, dass in diesen Quellen kein belastbarer Wert für genau die ausgewählte Kombination steht. Für die Ultra-Einstellung liegen hier keine eigenen Messwerte vor. Daraus lässt sich weder ein Score noch ein fester Kostenaufschlag ableiten.