Was nutze ich wann? — Modelle & Tools im Vergleich
Sieben typische Situationen, ein Klick: Wir zeigen dir Tool, Modell und ein Beispiel zum Nachmachen. Danach findest du alle aktuellen Modelle der großen Anbieter und was jedes Tool standardmäßig nutzt.
Stand / as of: 2026-07-28 · Benchmarks-Übersicht → · 📊 Modell-Timeline →
🧭 WAS WILLST DU TUN? — KLICK DEIN SZENARIO
Intelligenz pro Dollar: alle großen Modelle auf einen Blick
Jeder Punkt ist ein Modell. Nach rechts wird es teurer (Preis pro 1 Mio. Token, gemischt 3:1 Eingabe:Ausgabe, log-Skala), nach oben schlauer (Intelligenz-Index von Artificial Analysis, v4.1). Links oben ist der Sweet Spot.
Preise = offizielle API-Listenpreise (ohne Batch/Cache), Index = Artificial Analysis Intelligence Index v4.1 in der dort getesteten Konfiguration (meist höchstes Reasoning). Stand: 17.07.2026 — Zahlen ändern sich schnell.
🎬 ALS KURZES VIDEO
Das Diagramm in 10 Sekunden: teurer nach rechts, schlauer nach oben — und wo der Sweet Spot liegt.
Das Ranking: Intelligenz pro Dollar
Intelligenz-Index geteilt durch den gemischten Preis (3 Teile Eingabe + 1 Teil Ausgabe, pro 1 Mio. Token). Höher = mehr Denkleistung pro Dollar. Das sagt nichts über die absolute Spitze — dafür steht der Index selbst.
| # | MODELL | INTELLIGENZ/$ |
|---|---|---|
| 1 | DeepSeek-V4-Pro ✳ · DeepSeek | 81.4 |
| 2 | GLM-4.7 ✳ · Zhipu/Z.ai | 33.7 |
| 3 | Kimi K2.5 ✳ · Moonshot | 29.5 |
| 4 | Muse Spark 1.1 · Meta | 25.3 |
| 5 | GPT-5.6 Luna · OpenAI | 22.8 |
| 6 | Grok 4.5 · xAI | 17.9 |
| 7 | Gemini 3.5 Flash · Google | 14.9 |
| 8 | Sonnet 5 (Intro-Preis) · Anthropic | 13.3 |
| 9 | Qwen3.7-Max · Alibaba | 12.3 |
| 10 | Haiku 4.5 · Anthropic | 11.9 |
| 11 | Gemini 3.1 Pro · Google | 10.3 |
| 12 | Mistral Medium 3.5 ✳ · Mistral | 10.0 |
| 13 | GPT-5.6 Terra · OpenAI | 9.8 |
| 14 | Kimi K3 · Moonshot | 9.5 |
| 15 | Opus 5 · Anthropic | 6.1 |
| 16 | Opus 4.8 · Anthropic | 5.6 |
| 17 | GPT-5.6 Sol · OpenAI | 5.2 |
| 18 | Fable 5 · Anthropic | 3.0 |
- Grok 4.5: Preis gilt bis 200K Kontext — darüber verdoppelt er sich (Ratio dann ~9,0).
- Gemini 3.1 Pro: Preis gilt bis 200K Prompt — darüber 4 $/18 $ (Ratio dann ~6,2).
- Qwen3.7-Max: aktuell zeitlich begrenzte 50-%-Aktion (Ratio dann ~24,5) — hier zählt der Listenpreis.
- Sonnet 5: Einführungspreis bis 31.08.2026, danach 3 $/15 $ (Ratio 8,9).
- Mistral Large 3 (0,50 $/1,50 $) und Llama 4 Maverick (ab ~0,27 $/0,85 $ bei Hostern) fehlen im Ranking, weil Artificial Analysis für sie keinen Index listet.
- Quellen: offizielle Preisseiten der Anbieter + artificialanalysis.ai, alle abgerufen am 17.07.2026.
Die Modelle der großen Anbieter
Die aktuellen Modelle von Anthropic, OpenAI, Google, xAI — und jetzt auch Moonshot (Kimi), DeepSeek, Zhipu (GLM), Meta, Alibaba (Qwen) und Mistral. Mit Preis, Kontext, Stärken und wofür sie gedacht sind.
ANTHROPIC
Fable 5
Anthropics fähigstes breit verfügbares Modell – gebaut für die anspruchsvollsten Reasoning- und lang laufenden Agenten-Aufgaben (laut Anthropic).
- ✅ Höchste Fähigkeitsstufe laut Anthropic, für lange autonome Agenten-Läufe
- ✅ 1M-Token-Kontext Standard
- ✅ Prüft eigene Arbeit öfter nach als kleinere Modelle
- ✅ Ab 20.07.2026 dauerhaft in Max und Team Premium enthalten (bei 50 % der regulären Limits); Pro und Team Standard erhalten 100 $ Einmalguthaben und zahlen danach API-Preise.
- ⚠️ Teuerstes Modell der aktuellen Claude-Generation (10 $/50 $, Stand: Juli 2026)
- ⚠️ In Claude Code nicht Standard — musst du explizit wählen (`/model fable`)
→ Nimm es für sehr große, mehrstündige Aufgaben, bei denen viel auf dem Spiel steht.
Opus 5
Für komplexe agentische Coding- und Enterprise-Arbeit – kommt nahe an die Frontier-Intelligenz von Fable 5, aber zum halben Preis (laut Anthropic).
- ✅ Laut Anthropic State-of-the-Art bei Coding-Benchmarks (Frontier-Bench, GDPval-AA) und stärker bei Recherche/Wissensarbeit als Opus 4.8
- ✅ Effort-Regler in fünf Stufen (niedrig bis maximal) zum Abwägen von Intelligenz und Tokenverbrauch
- ✅ Intelligenz-Index 60,69 (Artificial Analysis v4.1, Max-Effort-Konfiguration) — damit rechnerisch sogar leicht vor Fable 5 (59,86)
- ✅ Seit Claude Code v2.1.219 (24.07.2026) neuer Standard-Opus in Claude Code sowie neues Default-Modell auf Claude Max
- ✅ 1M-Token-Kontext Standard, 128K Max-Output
- ⚠️ Fast-Mode kostet doppelt so viel (10 $ / 50 $ pro MTok) und läuft nur über die Anthropic-API bzw. Abo-Guthaben — nicht auf Amazon Bedrock, Google Clouds Agent Platform, Microsoft Foundry oder Claude Platform on AWS
- ⚠️ Teurer als Sonnet 5 bei Alltagsaufgaben
→ Nimm es für komplexe agentische Coding-Aufgaben und Enterprise-Wissensarbeit, wenn du nahe an Fable-5-Qualität willst, ohne deren Preis zu zahlen.
Opus 4.8
Für komplexe agentische Coding- und Enterprise-Arbeit – ein Premium-Modell für ernsthaftes Coding und Wissensarbeit (laut Anthropic).
- ✅ Für komplexe Architektur-Entscheidungen und Multi-Step-Reasoning empfohlen
- ✅ 1M-Token-Kontext
- ⚠️ Teurer als Sonnet 5 bei ähnlichen Alltagsaufgaben
- ⚠️ Von Opus 5 abgelöst: gleicher Preis, höherer Intelligenz-Index. Anthropic führt Opus 4.8 nicht mehr in der Hauptvergleichstabelle und bietet einen Migrationsleitfaden an — deprecated ist es aber nicht, ein Retirement-Datum gibt es bislang nicht
→ Für neue Projekte ist Opus 5 die bessere Wahl: gleicher Preis, aktuellere Generation. Opus 4.8 bleibt sinnvoll, wenn bestehende Abläufe nicht umgestellt werden sollen.
Sonnet 5
Die beste Kombination aus Geschwindigkeit und Intelligenz – die agentischste Sonnet-Generation bisher (laut Anthropic).
- ✅ Erledigt die meisten Coding-Aufgaben gut
- ✅ Günstiger als Opus
- ✅ Standard-Modell in Claude Code für Pro-/Team-Standard-Accounts
- ⚠️ Bei sehr komplexen Architektur-Fragen schwächer als Opus/Fable
→ Nimm es als Alltags-Modell für die meisten Coding-Aufgaben.
Haiku 4.5
Das schnellste Modell mit Nah-Frontier-Intelligenz – leichtgewichtige Version des stärksten Anthropic-Modells zum günstigeren Preis (laut Anthropic).
- ✅ Günstigstes Claude-Modell
- ✅ Sehr schnell
- ✅ 73,3 % SWE-bench Verified laut Anthropics eigener Angabe
- ⚠️ Kleineres Kontextfenster (200K statt 1M)
- ⚠️ Bei sehr komplexen Aufgaben schwächer als Sonnet/Opus
→ Nimm es zum günstigen Experimentieren und für einfache, klar umrissene Aufgaben.
OPENAI
GPT-5.6 Sol
Frontier-Modell für komplexe professionelle Arbeit – Flaggschiff für komplexes Reasoning und Coding (laut OpenAI).
- ✅ Stärkstes Modell der GPT-5.6-Familie
- ✅ Standard in Codex CLI (Reasoning-Effort „medium")
- ⚠️ Teuerstes Modell der 5.6-Familie
→ Nimm es für Aufgaben, bei denen Detail und Präzision zählen.
GPT-5.6 Terra
Balanciert Intelligenz und Kosten – entspricht ungefähr der Mini-Modell-Stufe früherer GPT-5-Familien (laut OpenAI).
- ✅ Guter Mittelweg aus Kosten und Fähigkeit
- ✅ In Codex CLI als „everyday workhorse" empfohlen
- ⚠️ Schwächer als Sol bei den härtesten Aufgaben
→ Nimm es als Alltags-Modell, wenn Sol zu teuer ist.
GPT-5.6 Luna
Optimiert für kostensensitive Workloads – entspricht ungefähr der Nano-Modell-Stufe (laut OpenAI).
- ✅ Günstigstes Modell der 5.6-Familie
- ✅ In Codex CLI für „klare, wiederholbare Arbeit" empfohlen
- ⚠️ Von OpenAI nur für klare, wiederholbare Arbeit positioniert
→ Nimm es für einfache, sich wiederholende Coding-Aufgaben in großer Zahl.
GPT-5.3-Codex
Das fähigste agentische Coding-Modell bis heute – optimiert für agentische Coding-Aufgaben in Codex oder ähnlichen Umgebungen (laut OpenAI).
- ✅ Speziell für agentisches Coding optimiert
- ✅ Günstiger als Sol bei starker Coding-Leistung
- ⚠️ Bei ChatGPT-Login in Codex als deprecated markiert — Verfügbarkeit uneinheitlich (Stand: Juli 2026)
→ Nimm es, wenn du speziell für agentisches Coding optimierte Qualität willst statt eines Allzweckmodells.
Gemini 3.5 Flash
Intelligentestes Modell für nachhaltige Frontier-Leistung bei agentischen und Coding-Aufgaben (laut Google).
- ✅ Von Google als „intelligentestes" Modell positioniert — trotz Flash-Namen
- ✅ Kostenloser Free-Tier vorhanden
- ✅ Günstiger als Googles eigenes Pro-Modell
- ⚠️ Knowledge-Cutoff Januar 2025
→ Nimm es als Googles Top-Empfehlung für agentische Coding-Aufgaben.
Gemini 3.1 Flash-Lite
Frontier-Klasse-Leistung, die größere Modelle erreicht, zu einem Bruchteil der Kosten – kosteneffizientestes Modell für hochvolumige agentische Aufgaben (laut Google).
- ✅ Günstigstes Modell im gesamten Vergleich
- ✅ Kostenloser Free-Tier vorhanden
- ⚠️ Nicht für komplexe Aufgaben positioniert
→ Nimm es für Übersetzung, einfache Datenverarbeitung und hochvolumige, einfache Agenten-Läufe.
Gemini 3.1 Pro
Fortgeschrittene Intelligenz, komplexe Problemlösung und starke agentische sowie Vibe-Coding-Fähigkeiten (laut Google) — noch im Preview-Status.
- ✅ Googles fähigstes Modell für komplexe Multi-Step-Aufgaben
- ✅ Starke Vibe-Coding-Fähigkeiten laut Google
- ⚠️ Noch Preview-Status, kein Free-Tier
- ⚠️ Teurer als Flash (bei >200K-Prompts nochmals gestaffelt)
→ Nimm es für komplexe, mehrstufige Probleme, bei denen Flash nicht reicht.
XAI
Grok 4.5
xAI: „For everything else, including code, use Grok 4.5. It is the most intelligent and fastest model we’ve built." Cursor co-trainiert es und nennt es sein Flaggschiff-Modell.
- ✅ Von Cursor als Flaggschiff-Partnermodell co-trainiert
- ✅ Günstiger als die meisten Spitzenmodelle anderer Anbieter
- ⚠️ Kleineres Kontextfenster als die Konkurrenz (500K statt 1M)
→ Nimm es in Cursor für die schwierigsten Aufgaben — laut xAI ihr intelligentestes und schnellstes Modell.
Grok 4.3
Keine offizielle Positionierungsaussage auffindbar — auf derselben xAI-Modellseite wie Grok 4.5 als günstigeres Geschwistermodell mit größerem Kontext gelistet.
- ✅ Größerer Kontext als Grok 4.5 (1M statt 500K)
- ✅ Günstiger als Grok 4.5
- ⚠️ Kaum dokumentiert — keine eigene Positionierung oder Modellseite gefunden
→ Nimm es als günstigere xAI-Alternative mit mehr Kontext, wenn Grok 4.5 zu teuer ist.
MOONSHOT AI
Kimi K3
Brandneu (16.07.2026): laut Moonshot das größte Open-Weight-Modell der Welt (2,8 Billionen Parameter, MoE) — Platz 3 im Intelligenz-Index, direkt hinter Fable 5 und GPT-5.6 Sol.
- ✅ Intelligenz-Index 57,11 — Platz 3 aller Modelle (Artificial Analysis, 17.07.2026)
- ✅ Agentische Web-Recherche: BrowseComp 91,2 (Moonshot-Angabe)
- ✅ Flacher Preis über den gesamten 1M-Kontext, automatisches Caching
- ⚠️ Weights zum Stand 17.07.2026 noch NICHT herunterladbar — offener Release erst am 27.07.2026 angekündigt
- ⚠️ Thinking permanent aktiv — schnelle Billig-Antworten sind nicht sein Ding
→ Nimm es für anspruchsvolle Agenten- und Recherche-Aufgaben, wenn du Frontier-Leistung günstiger als bei Fable/Sol willst.
Kimi K2.5
Der Vorgänger: 1-Billion-Parameter-MoE, Open Weights (Modified MIT), weiter verfügbar und deutlich günstiger.
- ✅ SWE-bench Verified 76,8 % (Moonshot-Angabe) bei Budget-Preis
- ✅ Open Weights — selbst hostbar
- ✅ Multimodal + Agentic Search
- ⚠️ Index 35,37 — merklich unter K3 und den Frontier-Modellen
→ Nimm es für günstiges agentisches Coden oder Self-Hosting mit ordentlicher Leistung.
DEEPSEEK
DeepSeek-V4-Pro
Der Preis-Leistungs-König dieser Übersicht: Intelligenz pro Dollar unerreicht (Ratio 81) — Open Weights unter MIT-Lizenz.
- ✅ Mit Abstand bestes Intelligenz-pro-Dollar-Verhältnis (Index 44,27 bei 0,54 $ gemischt)
- ✅ SWE-bench Verified 80,6 % (DeepSeek-Angabe, Pro-Max-Modus)
- ✅ OpenAI- UND Anthropic-kompatible API, Open Weights (MIT)
- ⚠️ Absolute Spitzenleistung liegt unter den Frontier-Modellen
- ⚠️ Benchmark-Zahlen sind Herstellerangaben, nicht unabhängig validiert
→ Nimm es, wenn du viel Volumen günstig verarbeiten willst — oder ein starkes Modell selbst hosten möchtest.
ZHIPU / Z.AI
GLM-4.7
Chinas Open-Source-Arbeitspferd fürs Coden: 358B-MoE unter MIT-Lizenz, stark bei agentischem Coding und Frontend-Generierung.
- ✅ SWE-bench Verified 73,8 % (Zhipu-Angabe) zum Budget-Preis
- ✅ Open Weights (MIT) — Self-Hosting via vLLM/SGLang, 44 quantisierte Varianten
- ✅ Kostenlose Flash-Variante zum Ausprobieren
- ⚠️ Index 33,70 — für komplexes Reasoning nehmen andere die Krone
- ⚠️ Zhipu hat schon eine neuere GLM-5-Serie — 4.7 ist nicht mehr das Spitzenmodell des Hauses
→ Nimm es für günstiges agentisches Coden, Web-/Frontend-Generierung oder als Self-Hosting-Basis.
META
Muse Spark 1.1
Metas erstes Closed-Weight-Frontier-Modell (09.07.2026) — über die neue Meta Model API, gebaut für agentische Orchestrierung über Apps, MCP-Server und Skills.
- ✅ Index 50,62 bei nur 2 $ gemischt — viertbestes Intelligenz-pro-Dollar-Verhältnis
- ✅ Agentische Orchestrierung (Apps/MCP/Skills, zero-shot) als Kern-Positionierung
- ✅ OpenAI-SDK-kompatible API, 20 $ Startguthaben
- ⚠️ NICHT open-weights — Bruch mit Metas Llama-Tradition
- ⚠️ Öffentliche Benchmarks teils nur als Chart-Bilder publiziert
→ Nimm es für Multi-App-Agenten und Tool-Orchestrierung mit gutem Preis.
Llama 4 Maverick
Metas aktuelles Open-Weights-Flaggschiff (400B MoE, nativ multimodal) — läuft bei Hostern wie Together, Groq oder Fireworks extrem günstig.
- ✅ Günstigster Eintrag dieser Übersicht
- ✅ Open Weights + Self-Hosting
- ✅ Multimodal, 12 Sprachen
- ⚠️ Kein Artificial-Analysis-Index gelistet — Vergleichbarkeit eingeschränkt
- ⚠️ Llama-4-Community-Lizenz ist nicht OSI-konform (Auflagen ab 700M Nutzern)
→ Nimm es für Massen-Verarbeitung zum Minimalpreis oder eigenes Hosting.
ALIBABA (QWEN)
Qwen3.7-Max
Alibabas Agenten-Flaggschiff („designed for the agent era") — erstmals proprietär statt open-weight, mit Hybrid-Reasoning zum gleichen Preis.
- ✅ SWE-bench Verified 80,4 % und GPQA Diamond 92,4 (Alibaba-Angaben)
- ✅ Long-Horizon-Agentik über hunderte Schritte als Kern-Fokus
- ✅ Sehr stark mehrsprachig (WMT24++ 85,8)
- ⚠️ Kein Self-Hosting — Bruch mit der Qwen-Open-Weight-Tradition
- ⚠️ Index 45,99 liegt unter den West-Frontier-Modellen
→ Nimm es für lange Agenten-Ketten und mehrsprachige Aufgaben — besonders während der Rabatt-Aktion.
MISTRAL
Mistral Large 3
Europas Open-Weights-Flaggschiff (675B MoE, Apache 2.0) — Vision, Function Calling und EU-Hosting-Option.
- ✅ Apache-2.0-Open-Weights — die freieste Lizenz unter den Großen
- ✅ Sehr günstig für die Größe
- ✅ EU-Hosting/Datensouveränität
- ⚠️ Kein Artificial-Analysis-Index gelistet
- ⚠️ Benchmark-Zahlen größtenteils nur als Chart-Bilder publiziert
→ Nimm es, wenn Open Source, EU-Hosting oder die Apache-Lizenz entscheidend sind.
Mistral Medium 3.5
Mistrals Coding-Spezialist: 128B dense, Modified MIT, mit starkem SWE-bench-Wert für die Größe.
- ✅ SWE-bench Verified 77,6 % (Mistral-Angabe)
- ✅ Open Weights (Modified MIT)
- ✅ Kompakt genug für eigenes Hosting
- ⚠️ Index 29,95 — fürs breite Reasoning schwächer als die MoE-Riesen
→ Nimm es für Coding-Agenten auf eigener Infrastruktur.
Claude Docs: Models Overview ↗ · Claude Docs: Pricing ↗ · Anthropic: Claude Sonnet 5 Launch ↗ · OpenAI Docs: Pricing ↗ · OpenAI Docs: GPT-5.6 Sol ↗ · Google AI: Gemini Models ↗ · Google AI: Gemini Pricing ↗ · xAI Docs: Models ↗ · Moonshot AI: Kimi K3 Pricing ↗ · DeepSeek API Docs: Pricing ↗ · Z.ai Docs: Pricing ↗ · Meta Model API (Developer) ↗ · Alibaba Cloud Model Studio: Pricing ↗ · Mistral Docs: Models ↗ · Artificial Analysis: Intelligence Index ↗ · Claude Docs: Migrating to Claude Opus 5 ↗
Modell-Duelle
Nicht „welches Modell ist am besten“, sondern „welches Modell für diese eine Aufgabe“. Vier direkte Vergleiche, abgeleitet aus Preisen und Anbieter-eigenen Angaben — inklusive der Antwort auf die wichtigste Frage: Wann sich das teurere Modell NICHT lohnt. Preise und Zahlen: Stand Juli 2026.
⚔️ Haiku 4.5 vs. Sonnet 5
Ist die Aufgabe mechanisch und eindeutig — oder brauchst du ein Modell, das mitdenkt?Claude Haiku 4.5
für mechanische, klar umrissene Aufgaben ohne Interpretationsspielraum — die Anweisung ist eindeutig, es gibt nichts zu entscheiden, nur auszuführen.
- Commit-Messages aus einem Diff erzeugen
- 100 Log-Zeilen nach einem bekannten Fehlermuster durchfiltern
- Ein JSON-Feld konsistent in 40 Dateien umbenennen
Claude Sonnet 5
wenn du ein Feature baust, mehrstufig debuggst, oder erst verstehen musst, wie der Code funktioniert, bevor du ihn änderst.
- Ein neues Feature bauen, das mehrere Dateien und Module berührt
- Einen Bug jagen, dessen Ursache nicht in der Fehlermeldung steht
- Fremden Code verstehen und dann sauber erweitern
💸 Wann es sich NICHT lohnt: Faustregel: Sonnet 5 für simple, eindeutige Edits einzusetzen ist verschwendetes Geld — Sonnet kostet $2/$10 pro MTok (In/Out, Einführungspreis bis 31.08.2026) bzw. $3/$15 danach, Haiku 4.5 nur $1/$5 (Stand: Juli 2026) — also 2x bis 3x mehr für eine Aufgabe, die Haiku genauso gut löst. Umgekehrt scheitert Haiku, sobald Anforderungen implizit sind: „mach das sauberer“ ohne Definition von „sauber“, eine Architektur-Entscheidung zwischen zwei validen Ansätzen, oder eine Aufgabe, bei der du erst den Code-Kontext verstehen musst, um zu wissen, was überhaupt zu tun ist.
📊 SWE-bench Verified: 73,3 % — Anthropic gibt für Haiku 4.5 selbst 73,3 % auf SWE-bench Verified an — nah an deutlich teureren Modellen. Das ist Anthropics eigene Angabe, kein unabhängiger Testlauf, zeigt aber: Bei klar formulierten Coding-Aufgaben ist Haiku stark, nicht nur „schnell und billig“. (Stand: Juli 2026)
Anthropic: Claude Haiku ↗ · Anthropic-Plattform: Preise ↗ · Claude Code Doku: Kosten ↗
⚔️ Sonnet 5 vs. Opus 4.8 / Fable 5
Reicht das Standard-Arbeitspferd — oder brauchst du das Spitzenmodell?Claude Sonnet 5
als Standard für alltägliche Coding-Arbeit. Anthropics eigene Guidance für Claude Code: „Sonnet handles most coding tasks well and costs less than Opus.“
- Alltägliche Features und Bugfixes im laufenden Projekt
- Code-Reviews und normale Refactorings
- Debugging-Sessions, die keine Stunden autonomer Selbstkorrektur brauchen
Claude Opus 4.8 / Fable 5
für komplexe Architektur-Entscheidungen, harte Bugs über viele Dateien und Subsysteme hinweg, oder lange autonome Agenten-Läufe mit viel Selbstkorrektur.
- Ein Architektur-Redesign planen, das mehrere Module gleichzeitig betrifft
- Einen Bug jagen, der sich über 10+ Dateien und mehrere Subsysteme zieht
- Ein stundenlanger autonomer Lauf, bei dem das Modell selbst recherchiert, handelt und sein eigenes Ergebnis verifiziert — laut Anthropic die Stärke von Fable 5: „sustains long autonomous sessions, investigates before acting, and verifies its work more often than smaller models.“
💸 Wann es sich NICHT lohnt: Faustregel: Alltags-Edits mit dem Spitzenmodell zu machen ist Geld verbrennen. Sonnet 5 kostet $2/$10 pro MTok (In/Out, Einführungspreis bis 31.08.2026) bzw. $3/$15 danach. Opus 4.8 kostet $5/$25 — das 1,7- bis 2,5-fache von Sonnet, je nachdem welche Preisstufe du vergleichst. Fable 5 kostet $10/$50 — das 3,3- bis 5-fache (alle Zahlen Stand: Juli 2026). Anthropics eigene Guidance reserviert Opus für „complex architectural decisions or multi-step reasoning“; Fable 5 ist auf keinem Account-Typ Default und muss explizit per `/model fable` gewählt werden — für Routine-Arbeit ist es nicht positioniert.
Anthropic: Claude Opus ↗ · Anthropic-Plattform: Einführung Fable 5 ↗ · Anthropic-Plattform: Preise ↗ · Claude Code Doku: Modellwahl ↗ · Claude Code Doku: Kosten ↗
⚔️ Gemini 3.5 Flash vs. Gemini 3.1 Pro Preview
Das schnelle Modell, das Google selbst „am intelligentesten“ nennt — oder das teurere Preview-Flaggschiff?Gemini 3.5 Flash
als Standard für agentische und Coding-Aufgaben. Google positioniert es selbst als „most intelligent model for sustained frontier performance on agentic and coding tasks“ — nicht das Pro-Modell.
- Agentische Coding-Workflows mit vielen aufeinanderfolgenden Tool-Aufrufen
- Aufgaben mit Such- und Grounding-Bedarf (Google nennt es „superior search and grounding“)
- Der erste Versuch für so gut wie alles, wofür du früher automatisch zu „Pro“ gegriffen hättest
Gemini 3.1 Pro Preview
wenn du gezielt Googles Pro-Positionierung für komplexe Problemlösung testen willst — und den Preview-Status akzeptierst. Achtung: Den 1M-Kontext haben Flash und Pro gleichermaßen.
- Komplexe Problemlösungs-Sessions, für die Google Pro ausdrücklich positioniert — wissend, dass Prompts über 200.000 Tokens bei Pro in die teurere Preisstufe fallen
- Explorative Sessions, für die Google Pro als „the best model family … for multimodal understanding, agentic capabilities, and vibe-coding“ beschreibt
💸 Wann es sich NICHT lohnt: Kurioser Fakt (Stand: Juli 2026): In Googles eigener Modell-Doku ist ausgerechnet das schnelle Flash-Modell als „most intelligent model“ gelistet, während das Pro-Modell noch im Preview-Status steckt und pro Token spürbar mehr kostet: Flash $1,50/$9 pro MTok (In/Out) gegen Pro $2–4/$12–18 (gestaffelt nach Promptlänge). Faustregel: Für die meisten Coding-Aufgaben ist der Aufpreis für Pro Preview aktuell schwer zu rechtfertigen — du zahlst mehr für ein Modell, das Google selbst nicht als das intelligenteste einstuft. Beide Modelle haben denselben ~1M-Kontext — langer Kontext ist also kein Pro-Argument; bei Prompts über 200k wird Pro sogar nochmal teurer, Flash bleibt flat. Pro lohnt sich nur, wenn du gezielt seine Pro-Positionierung für komplexe Problemlösung brauchst.
Google AI: Gemini-Modelle im Überblick ↗ · Google AI: Preise ↗ · Google AI: Gemini 3.5 Flash ↗ · Google AI: Gemini 3.1 Pro Preview ↗
⚔️ Abo vs. API-Preise (Pay-per-Token)
Feste Kosten mit Limit — oder nutzungsbasiert ohne Deckel?Abo (z. B. Claude Pro/Max, ChatGPT Plus/Pro, Cursor-Abo)
wenn du planbare, gedeckelte Kosten willst und regelmäßig, aber nicht extrem nutzt — ein Fixpreis pro Monat statt einer schwankenden Rechnung.
- Täglicher persönlicher Gebrauch von Claude Code oder Cursor als Einzelentwickler
- Team-Seats mit vorhersehbarem Monatsbudget statt variabler API-Rechnung
API / Pay-per-Token
wenn dein Verbrauch stark schwankt, du automatisierte Batch-Jobs fährst, oder mehr Volumen brauchst, als ein Abo-Limit hergibt.
- Große Batch-Verarbeitung über Nacht — die Batch-API gibt 50 % Rabatt auf In- und Output bei allen Claude-Modellen (Stand: Juli 2026)
- Ein CI-Schritt, der wenige Male am Tag automatisch ein günstiges Modell wie Haiku 4.5 aufruft
- Wiederholte große Kontexte per Prompt-Caching — ein Cache-Hit kostet nur 0,1x des normalen Input-Preises, also 90 % weniger (Stand: Juli 2026)
💸 Wann es sich NICHT lohnt: Faustregel: API-Pay-per-Token für Gelegenheits-Nutzer lohnt sich selten — bei unregelmäßiger, geringer Nutzung ist ein Abo mit Fixpreis meist günstiger, und du musst keine Tokens im Blick behalten. Umgekehrt ist ein Abo für Massen-Batch-Verarbeitung die falsche Wahl: Abo-Limits sind für interaktive Session-Nutzung gedacht, nicht für tausende automatisierte Calls — dafür ist die API mit Batch-Rabatt (50 % bei Claude) und Prompt-Caching (bis zu 90 % Rabatt auf wiederholte Kontexte) klar günstiger (Stand: Juli 2026).
Anthropic-Plattform: Preise (Batch, Caching) ↗ · Claude: Pricing (Abos) ↗
💶 PREISRECHNER — WAS KOSTET DEIN SETUP PRO MONAT?
≈ MONATSKOSTEN (30 TAGE, LISTENPREISE)
Sonnet 5: Einführungspreis 2/10 $ bis 31.08.2026 — Rechner nutzt den regulären Preis 3/15 $. Gemini 3.1 Pro: Preis gilt bis 200k-Prompts; darüber 4/18 $.
Listenpreise der Anbieter-Preisseiten (Stand: Juli 2026), ohne Caching/Rabatte/Abos — reale Kosten können abweichen. Quellen: Anthropic Pricing · OpenAI Models · Gemini API Pricing · xAI Models · Kimi Pricing · DeepSeek Pricing · Z.ai Pricing · Meta Model API · Alibaba Model Studio
Im Tool: welches Modell wofür?
Jedes Tool hat ein Standard-Modell und eigene Empfehlungen für bestimmte Aufgaben. So wechselst du das Modell — und wann sich das lohnt.
Claude Code
Default hängt vom Account ab (seit Claude Code v2.1.219 meist Opus 5 oder Sonnet 5) — wechseln mit `/model <name>` oder dem Picker über `/model`.
Alltägliche Coding-Aufgaben
sonnet handhabt die meisten Aufgaben gut und kostet weniger als Opus (laut Anthropic).
Komplexe Architektur-Entscheidungen
opus für komplexe Reasoning-Aufgaben empfohlen (laut Anthropic).
Einfache Subagent-Tasks
haiku schnell und effizient für einfache Aufgaben (laut Anthropic).
Claude Code Doku: Model Config ↗ · Claude Code Doku: Costs ↗
Codex CLI
Default ist GPT-5.6 Sol mit Reasoning-Effort „medium" — wechseln mit `/model` oder `codex --model <id>`.
Detail- und Präzisionsarbeit
5.6 Sol „für Detail und Politur" — bei Unsicherheit mit Sol starten (laut OpenAI).
Alltags-Workhorse
5.6 Terra konkurriert mit GPT-5.5 zu niedrigeren Kosten (laut OpenAI).
Klare, wiederholbare Arbeit
5.6 Luna niedrigste Kosten der Familie (laut OpenAI).
Cursor
Modell wird per Picker gewählt; „Auto" balanciert Intelligenz, Kosten und Zuverlässigkeit automatisch.
Alltägliche Aufgaben
Auto „gut für Alltagsaufgaben" (laut Cursor).
Komplexe, mehrstufige Aufgaben
Premium / Grok 4.5 Premium wählt die fähigsten Modelle; Grok 4.5 ist Cursors eigenes Flaggschiff-Modell (laut Cursor).
Schnelles interaktives Coden
Composer Cursors schnelles, kosteneffizientes Modell, gebaut für interaktives Coden (laut Cursor).
Aider
Kein einheitliches, aktuell dokumentiertes Standard-Modell — du gibst dein Modell per `--model` oder API-Key-Umgebungsvariable an.
Modell wählen
--model <name> Aider ist bewusst modell-agnostisch — läuft mit fast jedem LLM (laut Aider-Doku).
Modelle eines Anbieters auflisten
--list-models anthropic/ zeigt verfügbare Modelle eines Providers vor der Wahl.
Feineinstellungen (z. B. Thinking-Budget)
.aider.model.settings.yml persistente, erweiterte Modell-Einstellungen pro Projekt.
Antigravity CLI
Alle Pläne haben die beiden Gemini-Kernmodelle (3.5 Flash, 3.1 Pro) — wechseln mit `/model`; Drittmodelle (Claude, GPT-OSS) gibt es auf allen Plänen außer Enterprise.
Schnelle Alltagsaufgaben
Gemini 3.5 Flash auf allen Plänen verfügbar, für agentische und Coding-Aufgaben positioniert (laut Google).
Komplexere Probleme
Gemini 3.1 Pro fortgeschrittenere Intelligenz, ebenfalls auf allen Plänen verfügbar (laut Google).
Drittanbieter-Modelle nutzen
Claude Opus/Sonnet 4.6 (nicht auf Enterprise) auf Free, Google AI Plus, Pro und Ultra wählbar; einzig der Enterprise-Plan bietet sie nicht.
Die Tools im Direktvergleich
Claude Code
Agentisches Arbeiten im Terminal: lange Aufgaben, Automatisierung, Loops, Subagents.
- ✅ Subagents, Hooks und MCP-Anbindung eingebaut
- ✅ Artifacts: teilbare Live-Seiten direkt aus der Session
- ✅ Default-Modell je nach Abo (Opus 4.8 oder Sonnet 5, 1M-Token-Kontext bei Sonnet 5) — Wechsel per /model
- ⚠️ Kein grafischer Editor — Terminal-first ist Geschmackssache
- ⚠️ Bindung ans Claude-Ökosystem
Claude Code Doku: What's new ↗ · Claude Code Doku: Subagents ↗
Cursor
IDE-first: sehen, klicken, editieren — mit Agenten im Hintergrund.
- ✅ Background- und Cloud-Agents arbeiten weiter, während du editierst
- ✅ Composer für Multi-File-Änderungen
- ✅ Automations: Agents starten auf Repo-Events oder Timer
- ⚠️ Closed source, Abo-Modell
- ⚠️ Übernahme durch SpaceX angekündigt (16.06.2026) — Zukunft beobachten
OpenAI Codex CLI
Wer im OpenAI-Ökosystem lebt und ein offenes CLI will.
- ✅ Subagents: bis zu 6 parallel
- ✅ Schnelle Roundtrips über persistenten WebSocket
- ✅ In der ChatGPT-Desktop-App gebündelt
- ⚠️ Stärken hängen stark am OpenAI-Modell-Lineup
- ⚠️ Jünger als die Konkurrenz, Ökosystem wächst noch
Aider
Volle Kontrolle: eigenes Modell, eigene Keys, git-natives Arbeiten.
- ✅ Model-agnostisch — läuft mit fast jedem LLM
- ✅ Git-nativ: saubere Auto-Commits pro Änderung
- ✅ Komplett open source, keine Vendor-Bindung
- ⚠️ Weniger Automatisierungs-Komfort als die großen Suiten
- ⚠️ Setup und Modellwahl sind deine Aufgabe
Antigravity CLI
Nachfolger von Gemini CLI für Einzel-Nutzer: Terminal-Agent im Google-Ökosystem mit MCP, Plugins und Skills.
- ✅ Von Google offiziell benannter Nachfolger von Gemini CLI für Individual-Nutzer
- ✅ Vollwertiger MCP-Support (stdio + Remote) plus eigenes Plugin-/Skill-System (`agy plugin`, `/skills`)
- ✅ Non-interaktiver Modus (`agy -p`) für Skripte, wie bei den anderen CLIs
- ⚠️ Sehr junges Produkt (Repo seit Mai 2026) — kein Open-Source-Lizenzfile im Repo (`license: null`)
- ⚠️ Freies Kontingent nur qualitativ beschrieben ("meaningful"/"generous"), keine konkreten Zahlen
Google Blog: Transition von Gemini CLI zu Antigravity CLI ↗ · Antigravity CLI Doku: Command-Referenz ↗
Quellen: Alle Angaben aus den verlinkten offiziellen Quellen; gemeldete Fehler korrigiert die Loop. 🐛-Button unten rechts.