promptgarten 🌱

Was nutze ich wann? — Modelle & Tools im Vergleich

Sieben typische Situationen, ein Klick: Wir zeigen dir Tool, Modell und ein Beispiel zum Nachmachen. Danach findest du alle aktuellen Modelle der großen Anbieter und was jedes Tool standardmäßig nutzt.

Stand / as of: 2026-07-28 · Benchmarks-Übersicht → · 📊 Modell-Timeline →

🧭 WAS WILLST DU TUN? — KLICK DEIN SZENARIO

Intelligenz pro Dollar: alle großen Modelle auf einen Blick

Jeder Punkt ist ein Modell. Nach rechts wird es teurer (Preis pro 1 Mio. Token, gemischt 3:1 Eingabe:Ausgabe, log-Skala), nach oben schlauer (Intelligenz-Index von Artificial Analysis, v4.1). Links oben ist der Sweet Spot.

0.5 $1 $2 $5 $10 $20 $25354555Preis pro 1M Token (gemischt 3:1, log-Skala)Intelligenz-Index (Artificial Analysis v4.1)Opus 5Fable 5GPT-5.6 SolKimi K3Opus 4.8GPT-5.6 TerraGrok 4.5Sonnet 5GPT-5.6 LunaMuse Spark 1.1Gemini 3.5 FlashGemini 3.1 ProQwen3.7-MaxDeepSeek-V4-ProRatio-KönigKimi K2.5GLM-4.7Mistral Medium 3.5Haiku 4.5
FrontierMaximale Fähigkeit — wenn das Ergebnis wichtiger ist als der Preis.
Preis-LeistungViel Intelligenz fürs Geld — der Alltags-Bereich für die meisten Aufgaben.
BudgetGünstig für Masse, einfache Tasks und Experimente — oft Open Weights.
Open Weights (selbst hostbar)

Preise = offizielle API-Listenpreise (ohne Batch/Cache), Index = Artificial Analysis Intelligence Index v4.1 in der dort getesteten Konfiguration (meist höchstes Reasoning). Stand: 17.07.2026 — Zahlen ändern sich schnell.

🎬 ALS KURZES VIDEO

Das Diagramm in 10 Sekunden: teurer nach rechts, schlauer nach oben — und wo der Sweet Spot liegt.

Das Ranking: Intelligenz pro Dollar

Intelligenz-Index geteilt durch den gemischten Preis (3 Teile Eingabe + 1 Teil Ausgabe, pro 1 Mio. Token). Höher = mehr Denkleistung pro Dollar. Das sagt nichts über die absolute Spitze — dafür steht der Index selbst.

#MODELLINTELLIGENZ/$INDEXPREIS (GEMISCHT)
1DeepSeek-V4-Pro · DeepSeek81.444.270,54 $
2GLM-4.7 · Zhipu/Z.ai33.733.701,00 $
3Kimi K2.5 · Moonshot29.535.371,20 $
4Muse Spark 1.1 · Meta25.350.622,00 $
5GPT-5.6 Luna · OpenAI22.851.242,25 $
6Grok 4.5 · xAI17.953.833,00 $
7Gemini 3.5 Flash · Google14.950.203,38 $
8Sonnet 5 (Intro-Preis) · Anthropic13.353.354,00 $
9Qwen3.7-Max · Alibaba12.345.993,75 $
10Haiku 4.5 · Anthropic11.923.712,00 $
11Gemini 3.1 Pro · Google10.346.464,50 $
12Mistral Medium 3.5 · Mistral10.029.953,00 $
13GPT-5.6 Terra · OpenAI9.854.955,63 $
14Kimi K3 · Moonshot9.557.116,00 $
15Opus 5 · Anthropic6.160.6910,00 $
16Opus 4.8 · Anthropic5.655.6910,00 $
17GPT-5.6 Sol · OpenAI5.258.8911,25 $
18Fable 5 · Anthropic3.059.8620,00 $
  • Grok 4.5: Preis gilt bis 200K Kontext — darüber verdoppelt er sich (Ratio dann ~9,0).
  • Gemini 3.1 Pro: Preis gilt bis 200K Prompt — darüber 4 $/18 $ (Ratio dann ~6,2).
  • Qwen3.7-Max: aktuell zeitlich begrenzte 50-%-Aktion (Ratio dann ~24,5) — hier zählt der Listenpreis.
  • Sonnet 5: Einführungspreis bis 31.08.2026, danach 3 $/15 $ (Ratio 8,9).
  • Mistral Large 3 (0,50 $/1,50 $) und Llama 4 Maverick (ab ~0,27 $/0,85 $ bei Hostern) fehlen im Ranking, weil Artificial Analysis für sie keinen Index listet.
  • Quellen: offizielle Preisseiten der Anbieter + artificialanalysis.ai, alle abgerufen am 17.07.2026.

Die Modelle der großen Anbieter

Die aktuellen Modelle von Anthropic, OpenAI, Google, xAI — und jetzt auch Moonshot (Kimi), DeepSeek, Zhipu (GLM), Meta, Alibaba (Qwen) und Mistral. Mit Preis, Kontext, Stärken und wofür sie gedacht sind.

ANTHROPIC

Fable 5

Anthropics fähigstes breit verfügbares Modell – gebaut für die anspruchsvollsten Reasoning- und lang laufenden Agenten-Aufgaben (laut Anthropic).

🧠 1M Token💶 10 $ / 50 $ pro MTok (Stand: Juli 2026)
  • Höchste Fähigkeitsstufe laut Anthropic, für lange autonome Agenten-Läufe
  • 1M-Token-Kontext Standard
  • Prüft eigene Arbeit öfter nach als kleinere Modelle
  • Ab 20.07.2026 dauerhaft in Max und Team Premium enthalten (bei 50 % der regulären Limits); Pro und Team Standard erhalten 100 $ Einmalguthaben und zahlen danach API-Preise.
  • ⚠️ Teuerstes Modell der aktuellen Claude-Generation (10 $/50 $, Stand: Juli 2026)
  • ⚠️ In Claude Code nicht Standard — musst du explizit wählen (`/model fable`)

Nimm es für sehr große, mehrstündige Aufgaben, bei denen viel auf dem Spiel steht.

Opus 5

Für komplexe agentische Coding- und Enterprise-Arbeit – kommt nahe an die Frontier-Intelligenz von Fable 5, aber zum halben Preis (laut Anthropic).

🧠 1M Token💶 5 $ / 25 $ pro MTok (Stand: Juli 2026)
  • Laut Anthropic State-of-the-Art bei Coding-Benchmarks (Frontier-Bench, GDPval-AA) und stärker bei Recherche/Wissensarbeit als Opus 4.8
  • Effort-Regler in fünf Stufen (niedrig bis maximal) zum Abwägen von Intelligenz und Tokenverbrauch
  • Intelligenz-Index 60,69 (Artificial Analysis v4.1, Max-Effort-Konfiguration) — damit rechnerisch sogar leicht vor Fable 5 (59,86)
  • Seit Claude Code v2.1.219 (24.07.2026) neuer Standard-Opus in Claude Code sowie neues Default-Modell auf Claude Max
  • 1M-Token-Kontext Standard, 128K Max-Output
  • ⚠️ Fast-Mode kostet doppelt so viel (10 $ / 50 $ pro MTok) und läuft nur über die Anthropic-API bzw. Abo-Guthaben — nicht auf Amazon Bedrock, Google Clouds Agent Platform, Microsoft Foundry oder Claude Platform on AWS
  • ⚠️ Teurer als Sonnet 5 bei Alltagsaufgaben

Nimm es für komplexe agentische Coding-Aufgaben und Enterprise-Wissensarbeit, wenn du nahe an Fable-5-Qualität willst, ohne deren Preis zu zahlen.

Opus 4.8

Für komplexe agentische Coding- und Enterprise-Arbeit – ein Premium-Modell für ernsthaftes Coding und Wissensarbeit (laut Anthropic).

🧠 1M Token💶 5 $ / 25 $ pro MTok (Stand: Juli 2026)
  • Für komplexe Architektur-Entscheidungen und Multi-Step-Reasoning empfohlen
  • 1M-Token-Kontext
  • ⚠️ Teurer als Sonnet 5 bei ähnlichen Alltagsaufgaben
  • ⚠️ Von Opus 5 abgelöst: gleicher Preis, höherer Intelligenz-Index. Anthropic führt Opus 4.8 nicht mehr in der Hauptvergleichstabelle und bietet einen Migrationsleitfaden an — deprecated ist es aber nicht, ein Retirement-Datum gibt es bislang nicht

Für neue Projekte ist Opus 5 die bessere Wahl: gleicher Preis, aktuellere Generation. Opus 4.8 bleibt sinnvoll, wenn bestehende Abläufe nicht umgestellt werden sollen.

Sonnet 5

Die beste Kombination aus Geschwindigkeit und Intelligenz – die agentischste Sonnet-Generation bisher (laut Anthropic).

🧠 1M Token💶 2 $ / 10 $ pro MTok bis 31.08.2026, danach 3 $ / 15 $ (Stand: Juli 2026)
  • Erledigt die meisten Coding-Aufgaben gut
  • Günstiger als Opus
  • Standard-Modell in Claude Code für Pro-/Team-Standard-Accounts
  • ⚠️ Bei sehr komplexen Architektur-Fragen schwächer als Opus/Fable

Nimm es als Alltags-Modell für die meisten Coding-Aufgaben.

Haiku 4.5

Das schnellste Modell mit Nah-Frontier-Intelligenz – leichtgewichtige Version des stärksten Anthropic-Modells zum günstigeren Preis (laut Anthropic).

🧠 200K Token💶 1 $ / 5 $ pro MTok (Stand: Juli 2026)
  • Günstigstes Claude-Modell
  • Sehr schnell
  • 73,3 % SWE-bench Verified laut Anthropics eigener Angabe
  • ⚠️ Kleineres Kontextfenster (200K statt 1M)
  • ⚠️ Bei sehr komplexen Aufgaben schwächer als Sonnet/Opus

Nimm es zum günstigen Experimentieren und für einfache, klar umrissene Aufgaben.

OPENAI

GPT-5.6 Sol

Frontier-Modell für komplexe professionelle Arbeit – Flaggschiff für komplexes Reasoning und Coding (laut OpenAI).

🧠 ~1,05M Token💶 5 $ / 30 $ pro MTok, Cached In 0,50 $ (Stand: Juli 2026)
  • Stärkstes Modell der GPT-5.6-Familie
  • Standard in Codex CLI (Reasoning-Effort „medium")
  • ⚠️ Teuerstes Modell der 5.6-Familie

Nimm es für Aufgaben, bei denen Detail und Präzision zählen.

GPT-5.6 Terra

Balanciert Intelligenz und Kosten – entspricht ungefähr der Mini-Modell-Stufe früherer GPT-5-Familien (laut OpenAI).

🧠 ~1,05M Token💶 2,50 $ / 15 $ pro MTok, Cached In 0,25 $ (Stand: Juli 2026)
  • Guter Mittelweg aus Kosten und Fähigkeit
  • In Codex CLI als „everyday workhorse" empfohlen
  • ⚠️ Schwächer als Sol bei den härtesten Aufgaben

Nimm es als Alltags-Modell, wenn Sol zu teuer ist.

GPT-5.6 Luna

Optimiert für kostensensitive Workloads – entspricht ungefähr der Nano-Modell-Stufe (laut OpenAI).

🧠 ~1,05M Token💶 1 $ / 6 $ pro MTok, Cached In 0,10 $ (Stand: Juli 2026)
  • Günstigstes Modell der 5.6-Familie
  • In Codex CLI für „klare, wiederholbare Arbeit" empfohlen
  • ⚠️ Von OpenAI nur für klare, wiederholbare Arbeit positioniert

Nimm es für einfache, sich wiederholende Coding-Aufgaben in großer Zahl.

GPT-5.3-Codex

Das fähigste agentische Coding-Modell bis heute – optimiert für agentische Coding-Aufgaben in Codex oder ähnlichen Umgebungen (laut OpenAI).

🧠 400K Token💶 1,75 $ / 14 $ pro MTok, Cached In 0,175 $ (Stand: Juli 2026)
  • Speziell für agentisches Coding optimiert
  • Günstiger als Sol bei starker Coding-Leistung
  • ⚠️ Bei ChatGPT-Login in Codex als deprecated markiert — Verfügbarkeit uneinheitlich (Stand: Juli 2026)

Nimm es, wenn du speziell für agentisches Coding optimierte Qualität willst statt eines Allzweckmodells.

GOOGLE

Gemini 3.5 Flash

Intelligentestes Modell für nachhaltige Frontier-Leistung bei agentischen und Coding-Aufgaben (laut Google).

🧠 ~1M Token (Output bis 65K)💶 1,50 $ / 9 $ pro MTok, Batch/Flex 0,75 $ / 4,50 $ (Stand: Juli 2026)
  • Von Google als „intelligentestes" Modell positioniert — trotz Flash-Namen
  • Kostenloser Free-Tier vorhanden
  • Günstiger als Googles eigenes Pro-Modell
  • ⚠️ Knowledge-Cutoff Januar 2025

Nimm es als Googles Top-Empfehlung für agentische Coding-Aufgaben.

Gemini 3.1 Flash-Lite

Frontier-Klasse-Leistung, die größere Modelle erreicht, zu einem Bruchteil der Kosten – kosteneffizientestes Modell für hochvolumige agentische Aufgaben (laut Google).

🧠 ~1M Token (Output bis 65K)💶 0,25 $ (Text/Bild/Video) bzw. 0,50 $ (Audio) / 1,50 $ pro MTok (Stand: Juli 2026)
  • Günstigstes Modell im gesamten Vergleich
  • Kostenloser Free-Tier vorhanden
  • ⚠️ Nicht für komplexe Aufgaben positioniert

Nimm es für Übersetzung, einfache Datenverarbeitung und hochvolumige, einfache Agenten-Läufe.

Gemini 3.1 Pro

Fortgeschrittene Intelligenz, komplexe Problemlösung und starke agentische sowie Vibe-Coding-Fähigkeiten (laut Google) — noch im Preview-Status.

🧠 ~1M Token (Output bis 65K)💶 2–4 $ / 12–18 $ pro MTok, gestaffelt nach Promptlänge (Stand: Juli 2026)
  • Googles fähigstes Modell für komplexe Multi-Step-Aufgaben
  • Starke Vibe-Coding-Fähigkeiten laut Google
  • ⚠️ Noch Preview-Status, kein Free-Tier
  • ⚠️ Teurer als Flash (bei >200K-Prompts nochmals gestaffelt)

Nimm es für komplexe, mehrstufige Probleme, bei denen Flash nicht reicht.

XAI

Grok 4.5

xAI: „For everything else, including code, use Grok 4.5. It is the most intelligent and fastest model we’ve built." Cursor co-trainiert es und nennt es sein Flaggschiff-Modell.

🧠 500K Token💶 2 $ / 6 $ pro MTok, Cached In 0,50 $ (Stand: Juli 2026)
  • Von Cursor als Flaggschiff-Partnermodell co-trainiert
  • Günstiger als die meisten Spitzenmodelle anderer Anbieter
  • ⚠️ Kleineres Kontextfenster als die Konkurrenz (500K statt 1M)

Nimm es in Cursor für die schwierigsten Aufgaben — laut xAI ihr intelligentestes und schnellstes Modell.

Grok 4.3

Keine offizielle Positionierungsaussage auffindbar — auf derselben xAI-Modellseite wie Grok 4.5 als günstigeres Geschwistermodell mit größerem Kontext gelistet.

🧠 1M Token💶 1,25 $ / 2,50 $ pro MTok (Stand: Juli 2026)
  • Größerer Kontext als Grok 4.5 (1M statt 500K)
  • Günstiger als Grok 4.5
  • ⚠️ Kaum dokumentiert — keine eigene Positionierung oder Modellseite gefunden

Nimm es als günstigere xAI-Alternative mit mehr Kontext, wenn Grok 4.5 zu teuer ist.

MOONSHOT AI

Kimi K3

Brandneu (16.07.2026): laut Moonshot das größte Open-Weight-Modell der Welt (2,8 Billionen Parameter, MoE) — Platz 3 im Intelligenz-Index, direkt hinter Fable 5 und GPT-5.6 Sol.

🧠 1M Token (Ausgabe bis 1M möglich)💶 3 $ / 15 $ pro MTok, Cache-Hit-Eingabe 0,30 $ (Stand: Juli 2026)
  • Intelligenz-Index 57,11 — Platz 3 aller Modelle (Artificial Analysis, 17.07.2026)
  • Agentische Web-Recherche: BrowseComp 91,2 (Moonshot-Angabe)
  • Flacher Preis über den gesamten 1M-Kontext, automatisches Caching
  • ⚠️ Weights zum Stand 17.07.2026 noch NICHT herunterladbar — offener Release erst am 27.07.2026 angekündigt
  • ⚠️ Thinking permanent aktiv — schnelle Billig-Antworten sind nicht sein Ding

Nimm es für anspruchsvolle Agenten- und Recherche-Aufgaben, wenn du Frontier-Leistung günstiger als bei Fable/Sol willst.

Kimi K2.5

Der Vorgänger: 1-Billion-Parameter-MoE, Open Weights (Modified MIT), weiter verfügbar und deutlich günstiger.

🧠 256K Token💶 0,60 $ / 3 $ pro MTok, Cache-Hit 0,10 $ (Stand: Juli 2026)
  • SWE-bench Verified 76,8 % (Moonshot-Angabe) bei Budget-Preis
  • Open Weights — selbst hostbar
  • Multimodal + Agentic Search
  • ⚠️ Index 35,37 — merklich unter K3 und den Frontier-Modellen

Nimm es für günstiges agentisches Coden oder Self-Hosting mit ordentlicher Leistung.

DEEPSEEK

DeepSeek-V4-Pro

Der Preis-Leistungs-König dieser Übersicht: Intelligenz pro Dollar unerreicht (Ratio 81) — Open Weights unter MIT-Lizenz.

🧠 1M Token (Ausgabe bis 384K)💶 0,435 $ / 0,87 $ pro MTok, Cache-Hit-Eingabe ~99 % günstiger (Stand: Juli 2026)
  • Mit Abstand bestes Intelligenz-pro-Dollar-Verhältnis (Index 44,27 bei 0,54 $ gemischt)
  • SWE-bench Verified 80,6 % (DeepSeek-Angabe, Pro-Max-Modus)
  • OpenAI- UND Anthropic-kompatible API, Open Weights (MIT)
  • ⚠️ Absolute Spitzenleistung liegt unter den Frontier-Modellen
  • ⚠️ Benchmark-Zahlen sind Herstellerangaben, nicht unabhängig validiert

Nimm es, wenn du viel Volumen günstig verarbeiten willst — oder ein starkes Modell selbst hosten möchtest.

ZHIPU / Z.AI

GLM-4.7

Chinas Open-Source-Arbeitspferd fürs Coden: 358B-MoE unter MIT-Lizenz, stark bei agentischem Coding und Frontend-Generierung.

🧠 200K Token (Ausgabe bis 128K)💶 0,60 $ / 2,20 $ pro MTok; Flash-Variante kostenlos (Stand: Juli 2026)
  • SWE-bench Verified 73,8 % (Zhipu-Angabe) zum Budget-Preis
  • Open Weights (MIT) — Self-Hosting via vLLM/SGLang, 44 quantisierte Varianten
  • Kostenlose Flash-Variante zum Ausprobieren
  • ⚠️ Index 33,70 — für komplexes Reasoning nehmen andere die Krone
  • ⚠️ Zhipu hat schon eine neuere GLM-5-Serie — 4.7 ist nicht mehr das Spitzenmodell des Hauses

Nimm es für günstiges agentisches Coden, Web-/Frontend-Generierung oder als Self-Hosting-Basis.

META

Muse Spark 1.1

Metas erstes Closed-Weight-Frontier-Modell (09.07.2026) — über die neue Meta Model API, gebaut für agentische Orchestrierung über Apps, MCP-Server und Skills.

🧠 1M Token (mit eingebauter Context-Compaction)💶 1,25 $ / 4,25 $ pro MTok, Cached In 0,15 $ (Stand: Juli 2026)
  • Index 50,62 bei nur 2 $ gemischt — viertbestes Intelligenz-pro-Dollar-Verhältnis
  • Agentische Orchestrierung (Apps/MCP/Skills, zero-shot) als Kern-Positionierung
  • OpenAI-SDK-kompatible API, 20 $ Startguthaben
  • ⚠️ NICHT open-weights — Bruch mit Metas Llama-Tradition
  • ⚠️ Öffentliche Benchmarks teils nur als Chart-Bilder publiziert

Nimm es für Multi-App-Agenten und Tool-Orchestrierung mit gutem Preis.

Llama 4 Maverick

Metas aktuelles Open-Weights-Flaggschiff (400B MoE, nativ multimodal) — läuft bei Hostern wie Together, Groq oder Fireworks extrem günstig.

🧠 ~1M Token💶 ab ~0,27 $ / 0,85 $ pro MTok je nach Hoster (Together AI, Stand: Juli 2026)
  • Günstigster Eintrag dieser Übersicht
  • Open Weights + Self-Hosting
  • Multimodal, 12 Sprachen
  • ⚠️ Kein Artificial-Analysis-Index gelistet — Vergleichbarkeit eingeschränkt
  • ⚠️ Llama-4-Community-Lizenz ist nicht OSI-konform (Auflagen ab 700M Nutzern)

Nimm es für Massen-Verarbeitung zum Minimalpreis oder eigenes Hosting.

ALIBABA (QWEN)

Qwen3.7-Max

Alibabas Agenten-Flaggschiff („designed for the agent era") — erstmals proprietär statt open-weight, mit Hybrid-Reasoning zum gleichen Preis.

🧠 1M Token (Ausgabe bis 65K)💶 2,50 $ / 7,50 $ pro MTok Listenpreis; aktuell zeitweise −50 % (Stand: Juli 2026)
  • SWE-bench Verified 80,4 % und GPQA Diamond 92,4 (Alibaba-Angaben)
  • Long-Horizon-Agentik über hunderte Schritte als Kern-Fokus
  • Sehr stark mehrsprachig (WMT24++ 85,8)
  • ⚠️ Kein Self-Hosting — Bruch mit der Qwen-Open-Weight-Tradition
  • ⚠️ Index 45,99 liegt unter den West-Frontier-Modellen

Nimm es für lange Agenten-Ketten und mehrsprachige Aufgaben — besonders während der Rabatt-Aktion.

MISTRAL

Mistral Large 3

Europas Open-Weights-Flaggschiff (675B MoE, Apache 2.0) — Vision, Function Calling und EU-Hosting-Option.

🧠 256K Token💶 0,50 $ / 1,50 $ pro MTok (Modellseite; ältere FAQ nennt noch 2 $/6 $) (Stand: Juli 2026)
  • Apache-2.0-Open-Weights — die freieste Lizenz unter den Großen
  • Sehr günstig für die Größe
  • EU-Hosting/Datensouveränität
  • ⚠️ Kein Artificial-Analysis-Index gelistet
  • ⚠️ Benchmark-Zahlen größtenteils nur als Chart-Bilder publiziert

Nimm es, wenn Open Source, EU-Hosting oder die Apache-Lizenz entscheidend sind.

Mistral Medium 3.5

Mistrals Coding-Spezialist: 128B dense, Modified MIT, mit starkem SWE-bench-Wert für die Größe.

🧠 256K Token💶 1,50 $ / 7,50 $ pro MTok (Stand: Juli 2026)
  • SWE-bench Verified 77,6 % (Mistral-Angabe)
  • Open Weights (Modified MIT)
  • Kompakt genug für eigenes Hosting
  • ⚠️ Index 29,95 — fürs breite Reasoning schwächer als die MoE-Riesen

Nimm es für Coding-Agenten auf eigener Infrastruktur.

Claude Docs: Models Overview · Claude Docs: Pricing · Anthropic: Claude Sonnet 5 Launch · OpenAI Docs: Pricing · OpenAI Docs: GPT-5.6 Sol · Google AI: Gemini Models · Google AI: Gemini Pricing · xAI Docs: Models · Moonshot AI: Kimi K3 Pricing · DeepSeek API Docs: Pricing · Z.ai Docs: Pricing · Meta Model API (Developer) · Alibaba Cloud Model Studio: Pricing · Mistral Docs: Models · Artificial Analysis: Intelligence Index · Claude Docs: Migrating to Claude Opus 5

Modell-Duelle

Nicht „welches Modell ist am besten“, sondern „welches Modell für diese eine Aufgabe“. Vier direkte Vergleiche, abgeleitet aus Preisen und Anbieter-eigenen Angaben — inklusive der Antwort auf die wichtigste Frage: Wann sich das teurere Modell NICHT lohnt. Preise und Zahlen: Stand Juli 2026.

⚔️ Haiku 4.5 vs. Sonnet 5

Ist die Aufgabe mechanisch und eindeutig — oder brauchst du ein Modell, das mitdenkt?

Claude Haiku 4.5

für mechanische, klar umrissene Aufgaben ohne Interpretationsspielraum — die Anweisung ist eindeutig, es gibt nichts zu entscheiden, nur auszuführen.

  • Commit-Messages aus einem Diff erzeugen
  • 100 Log-Zeilen nach einem bekannten Fehlermuster durchfiltern
  • Ein JSON-Feld konsistent in 40 Dateien umbenennen

Claude Sonnet 5

wenn du ein Feature baust, mehrstufig debuggst, oder erst verstehen musst, wie der Code funktioniert, bevor du ihn änderst.

  • Ein neues Feature bauen, das mehrere Dateien und Module berührt
  • Einen Bug jagen, dessen Ursache nicht in der Fehlermeldung steht
  • Fremden Code verstehen und dann sauber erweitern

💸 Wann es sich NICHT lohnt: Faustregel: Sonnet 5 für simple, eindeutige Edits einzusetzen ist verschwendetes Geld — Sonnet kostet $2/$10 pro MTok (In/Out, Einführungspreis bis 31.08.2026) bzw. $3/$15 danach, Haiku 4.5 nur $1/$5 (Stand: Juli 2026) — also 2x bis 3x mehr für eine Aufgabe, die Haiku genauso gut löst. Umgekehrt scheitert Haiku, sobald Anforderungen implizit sind: „mach das sauberer“ ohne Definition von „sauber“, eine Architektur-Entscheidung zwischen zwei validen Ansätzen, oder eine Aufgabe, bei der du erst den Code-Kontext verstehen musst, um zu wissen, was überhaupt zu tun ist.

📊 SWE-bench Verified: 73,3 % — Anthropic gibt für Haiku 4.5 selbst 73,3 % auf SWE-bench Verified an — nah an deutlich teureren Modellen. Das ist Anthropics eigene Angabe, kein unabhängiger Testlauf, zeigt aber: Bei klar formulierten Coding-Aufgaben ist Haiku stark, nicht nur „schnell und billig“. (Stand: Juli 2026)

Anthropic: Claude Haiku · Anthropic-Plattform: Preise · Claude Code Doku: Kosten

⚔️ Sonnet 5 vs. Opus 4.8 / Fable 5

Reicht das Standard-Arbeitspferd — oder brauchst du das Spitzenmodell?

Claude Sonnet 5

als Standard für alltägliche Coding-Arbeit. Anthropics eigene Guidance für Claude Code: „Sonnet handles most coding tasks well and costs less than Opus.“

  • Alltägliche Features und Bugfixes im laufenden Projekt
  • Code-Reviews und normale Refactorings
  • Debugging-Sessions, die keine Stunden autonomer Selbstkorrektur brauchen

Claude Opus 4.8 / Fable 5

für komplexe Architektur-Entscheidungen, harte Bugs über viele Dateien und Subsysteme hinweg, oder lange autonome Agenten-Läufe mit viel Selbstkorrektur.

  • Ein Architektur-Redesign planen, das mehrere Module gleichzeitig betrifft
  • Einen Bug jagen, der sich über 10+ Dateien und mehrere Subsysteme zieht
  • Ein stundenlanger autonomer Lauf, bei dem das Modell selbst recherchiert, handelt und sein eigenes Ergebnis verifiziert — laut Anthropic die Stärke von Fable 5: „sustains long autonomous sessions, investigates before acting, and verifies its work more often than smaller models.“

💸 Wann es sich NICHT lohnt: Faustregel: Alltags-Edits mit dem Spitzenmodell zu machen ist Geld verbrennen. Sonnet 5 kostet $2/$10 pro MTok (In/Out, Einführungspreis bis 31.08.2026) bzw. $3/$15 danach. Opus 4.8 kostet $5/$25 — das 1,7- bis 2,5-fache von Sonnet, je nachdem welche Preisstufe du vergleichst. Fable 5 kostet $10/$50 — das 3,3- bis 5-fache (alle Zahlen Stand: Juli 2026). Anthropics eigene Guidance reserviert Opus für „complex architectural decisions or multi-step reasoning“; Fable 5 ist auf keinem Account-Typ Default und muss explizit per `/model fable` gewählt werden — für Routine-Arbeit ist es nicht positioniert.

Anthropic: Claude Opus · Anthropic-Plattform: Einführung Fable 5 · Anthropic-Plattform: Preise · Claude Code Doku: Modellwahl · Claude Code Doku: Kosten

⚔️ Gemini 3.5 Flash vs. Gemini 3.1 Pro Preview

Das schnelle Modell, das Google selbst „am intelligentesten“ nennt — oder das teurere Preview-Flaggschiff?

Gemini 3.5 Flash

als Standard für agentische und Coding-Aufgaben. Google positioniert es selbst als „most intelligent model for sustained frontier performance on agentic and coding tasks“ — nicht das Pro-Modell.

  • Agentische Coding-Workflows mit vielen aufeinanderfolgenden Tool-Aufrufen
  • Aufgaben mit Such- und Grounding-Bedarf (Google nennt es „superior search and grounding“)
  • Der erste Versuch für so gut wie alles, wofür du früher automatisch zu „Pro“ gegriffen hättest

Gemini 3.1 Pro Preview

wenn du gezielt Googles Pro-Positionierung für komplexe Problemlösung testen willst — und den Preview-Status akzeptierst. Achtung: Den 1M-Kontext haben Flash und Pro gleichermaßen.

  • Komplexe Problemlösungs-Sessions, für die Google Pro ausdrücklich positioniert — wissend, dass Prompts über 200.000 Tokens bei Pro in die teurere Preisstufe fallen
  • Explorative Sessions, für die Google Pro als „the best model family … for multimodal understanding, agentic capabilities, and vibe-coding“ beschreibt

💸 Wann es sich NICHT lohnt: Kurioser Fakt (Stand: Juli 2026): In Googles eigener Modell-Doku ist ausgerechnet das schnelle Flash-Modell als „most intelligent model“ gelistet, während das Pro-Modell noch im Preview-Status steckt und pro Token spürbar mehr kostet: Flash $1,50/$9 pro MTok (In/Out) gegen Pro $2–4/$12–18 (gestaffelt nach Promptlänge). Faustregel: Für die meisten Coding-Aufgaben ist der Aufpreis für Pro Preview aktuell schwer zu rechtfertigen — du zahlst mehr für ein Modell, das Google selbst nicht als das intelligenteste einstuft. Beide Modelle haben denselben ~1M-Kontext — langer Kontext ist also kein Pro-Argument; bei Prompts über 200k wird Pro sogar nochmal teurer, Flash bleibt flat. Pro lohnt sich nur, wenn du gezielt seine Pro-Positionierung für komplexe Problemlösung brauchst.

Google AI: Gemini-Modelle im Überblick · Google AI: Preise · Google AI: Gemini 3.5 Flash · Google AI: Gemini 3.1 Pro Preview

⚔️ Abo vs. API-Preise (Pay-per-Token)

Feste Kosten mit Limit — oder nutzungsbasiert ohne Deckel?

Abo (z. B. Claude Pro/Max, ChatGPT Plus/Pro, Cursor-Abo)

wenn du planbare, gedeckelte Kosten willst und regelmäßig, aber nicht extrem nutzt — ein Fixpreis pro Monat statt einer schwankenden Rechnung.

  • Täglicher persönlicher Gebrauch von Claude Code oder Cursor als Einzelentwickler
  • Team-Seats mit vorhersehbarem Monatsbudget statt variabler API-Rechnung

API / Pay-per-Token

wenn dein Verbrauch stark schwankt, du automatisierte Batch-Jobs fährst, oder mehr Volumen brauchst, als ein Abo-Limit hergibt.

  • Große Batch-Verarbeitung über Nacht — die Batch-API gibt 50 % Rabatt auf In- und Output bei allen Claude-Modellen (Stand: Juli 2026)
  • Ein CI-Schritt, der wenige Male am Tag automatisch ein günstiges Modell wie Haiku 4.5 aufruft
  • Wiederholte große Kontexte per Prompt-Caching — ein Cache-Hit kostet nur 0,1x des normalen Input-Preises, also 90 % weniger (Stand: Juli 2026)

💸 Wann es sich NICHT lohnt: Faustregel: API-Pay-per-Token für Gelegenheits-Nutzer lohnt sich selten — bei unregelmäßiger, geringer Nutzung ist ein Abo mit Fixpreis meist günstiger, und du musst keine Tokens im Blick behalten. Umgekehrt ist ein Abo für Massen-Batch-Verarbeitung die falsche Wahl: Abo-Limits sind für interaktive Session-Nutzung gedacht, nicht für tausende automatisierte Calls — dafür ist die API mit Batch-Rabatt (50 % bei Claude) und Prompt-Caching (bis zu 90 % Rabatt auf wiederholte Kontexte) klar günstiger (Stand: Juli 2026).

Anthropic-Plattform: Preise (Batch, Caching) · Claude: Pricing (Abos)

💶 PREISRECHNER — WAS KOSTET DEIN SETUP PRO MONAT?

≈ MONATSKOSTEN (30 TAGE, LISTENPREISE)

DeepSeek-V4-Pro
$15.66
GLM-4.7
$24.60
Kimi K2.5
$27.00
Haiku 4.5
$45.00
GPT-5.6 Luna
$48.00
Muse Spark 1.1
$50.25
Gemini 3.5 Flash
$72.00
Grok 4.5
$78.00
Gemini 3.1 Pro
$96.00
Qwen3.7-Max
$97.50
GPT-5.6 Terra
$120
Sonnet 5
$135
Kimi K3
$135
Opus 4.8
$225
GPT-5.6 Sol
$240
Fable 5
$450

Sonnet 5: Einführungspreis 2/10 $ bis 31.08.2026 — Rechner nutzt den regulären Preis 3/15 $. Gemini 3.1 Pro: Preis gilt bis 200k-Prompts; darüber 4/18 $.
Listenpreise der Anbieter-Preisseiten (Stand: Juli 2026), ohne Caching/Rabatte/Abos — reale Kosten können abweichen. Quellen: Anthropic Pricing · OpenAI Models · Gemini API Pricing · xAI Models · Kimi Pricing · DeepSeek Pricing · Z.ai Pricing · Meta Model API · Alibaba Model Studio

Im Tool: welches Modell wofür?

Jedes Tool hat ein Standard-Modell und eigene Empfehlungen für bestimmte Aufgaben. So wechselst du das Modell — und wann sich das lohnt.

Claude Code

Default hängt vom Account ab (seit Claude Code v2.1.219 meist Opus 5 oder Sonnet 5) — wechseln mit `/model <name>` oder dem Picker über `/model`.

Alltägliche Coding-Aufgaben

sonnet handhabt die meisten Aufgaben gut und kostet weniger als Opus (laut Anthropic).

Komplexe Architektur-Entscheidungen

opus für komplexe Reasoning-Aufgaben empfohlen (laut Anthropic).

Einfache Subagent-Tasks

haiku schnell und effizient für einfache Aufgaben (laut Anthropic).

Claude Code Doku: Model Config · Claude Code Doku: Costs

Codex CLI

Default ist GPT-5.6 Sol mit Reasoning-Effort „medium" — wechseln mit `/model` oder `codex --model <id>`.

Detail- und Präzisionsarbeit

5.6 Sol „für Detail und Politur" — bei Unsicherheit mit Sol starten (laut OpenAI).

Alltags-Workhorse

5.6 Terra konkurriert mit GPT-5.5 zu niedrigeren Kosten (laut OpenAI).

Klare, wiederholbare Arbeit

5.6 Luna niedrigste Kosten der Familie (laut OpenAI).

OpenAI: Codex-Modelle · OpenAI: Codex CLI Quickstart

Cursor

Modell wird per Picker gewählt; „Auto" balanciert Intelligenz, Kosten und Zuverlässigkeit automatisch.

Alltägliche Aufgaben

Auto „gut für Alltagsaufgaben" (laut Cursor).

Komplexe, mehrstufige Aufgaben

Premium / Grok 4.5 Premium wählt die fähigsten Modelle; Grok 4.5 ist Cursors eigenes Flaggschiff-Modell (laut Cursor).

Schnelles interaktives Coden

Composer Cursors schnelles, kosteneffizientes Modell, gebaut für interaktives Coden (laut Cursor).

Cursor Docs: Models · Cursor Help: Available Models

Aider

Kein einheitliches, aktuell dokumentiertes Standard-Modell — du gibst dein Modell per `--model` oder API-Key-Umgebungsvariable an.

Modell wählen

--model <name> Aider ist bewusst modell-agnostisch — läuft mit fast jedem LLM (laut Aider-Doku).

Modelle eines Anbieters auflisten

--list-models anthropic/ zeigt verfügbare Modelle eines Providers vor der Wahl.

Feineinstellungen (z. B. Thinking-Budget)

.aider.model.settings.yml persistente, erweiterte Modell-Einstellungen pro Projekt.

Aider Docs: LLMs · Aider Docs: Anthropic

Antigravity CLI

Alle Pläne haben die beiden Gemini-Kernmodelle (3.5 Flash, 3.1 Pro) — wechseln mit `/model`; Drittmodelle (Claude, GPT-OSS) gibt es auf allen Plänen außer Enterprise.

Schnelle Alltagsaufgaben

Gemini 3.5 Flash auf allen Plänen verfügbar, für agentische und Coding-Aufgaben positioniert (laut Google).

Komplexere Probleme

Gemini 3.1 Pro fortgeschrittenere Intelligenz, ebenfalls auf allen Plänen verfügbar (laut Google).

Drittanbieter-Modelle nutzen

Claude Opus/Sonnet 4.6 (nicht auf Enterprise) auf Free, Google AI Plus, Pro und Ultra wählbar; einzig der Enterprise-Plan bietet sie nicht.

Antigravity Doku: Modelle · Antigravity Doku: Pläne

Die Tools im Direktvergleich

Claude Code

CLI + IDE-Extensions + WebOpen Source: neinClaude-Abo oder API-Kosten

Agentisches Arbeiten im Terminal: lange Aufgaben, Automatisierung, Loops, Subagents.

  • Subagents, Hooks und MCP-Anbindung eingebaut
  • Artifacts: teilbare Live-Seiten direkt aus der Session
  • Default-Modell je nach Abo (Opus 4.8 oder Sonnet 5, 1M-Token-Kontext bei Sonnet 5) — Wechsel per /model
  • ⚠️ Kein grafischer Editor — Terminal-first ist Geschmackssache
  • ⚠️ Bindung ans Claude-Ökosystem

Claude Code Doku: What's new · Claude Code Doku: Subagents

Cursor

IDE (VS-Code-Basis)Open Source: neinAbo

IDE-first: sehen, klicken, editieren — mit Agenten im Hintergrund.

  • Background- und Cloud-Agents arbeiten weiter, während du editierst
  • Composer für Multi-File-Änderungen
  • Automations: Agents starten auf Repo-Events oder Timer
  • ⚠️ Closed source, Abo-Modell
  • ⚠️ Übernahme durch SpaceX angekündigt (16.06.2026) — Zukunft beobachten

Cursor Changelog · TechCrunch: SpaceX to acquire Cursor

OpenAI Codex CLI

CLIOpen Source: jaChatGPT-Abo oder API

Wer im OpenAI-Ökosystem lebt und ein offenes CLI will.

  • Subagents: bis zu 6 parallel
  • Schnelle Roundtrips über persistenten WebSocket
  • In der ChatGPT-Desktop-App gebündelt
  • ⚠️ Stärken hängen stark am OpenAI-Modell-Lineup
  • ⚠️ Jünger als die Konkurrenz, Ökosystem wächst noch

OpenAI Codex Changelog

Aider

CLIOpen Source: jakostenlos — du zahlst nur deine Modell-API

Volle Kontrolle: eigenes Modell, eigene Keys, git-natives Arbeiten.

  • Model-agnostisch — läuft mit fast jedem LLM
  • Git-nativ: saubere Auto-Commits pro Änderung
  • Komplett open source, keine Vendor-Bindung
  • ⚠️ Weniger Automatisierungs-Komfort als die großen Suiten
  • ⚠️ Setup und Modellwahl sind deine Aufgabe

Aider — offizielle Seite

Antigravity CLI

CLIOpen Source: neinGoogle-Konto — Free/Pro/Ultra-Kontingent (kein eigener API-Key)

Nachfolger von Gemini CLI für Einzel-Nutzer: Terminal-Agent im Google-Ökosystem mit MCP, Plugins und Skills.

  • Von Google offiziell benannter Nachfolger von Gemini CLI für Individual-Nutzer
  • Vollwertiger MCP-Support (stdio + Remote) plus eigenes Plugin-/Skill-System (`agy plugin`, `/skills`)
  • Non-interaktiver Modus (`agy -p`) für Skripte, wie bei den anderen CLIs
  • ⚠️ Sehr junges Produkt (Repo seit Mai 2026) — kein Open-Source-Lizenzfile im Repo (`license: null`)
  • ⚠️ Freies Kontingent nur qualitativ beschrieben ("meaningful"/"generous"), keine konkreten Zahlen

Google Blog: Transition von Gemini CLI zu Antigravity CLI · Antigravity CLI Doku: Command-Referenz

Quellen: Alle Angaben aus den verlinkten offiziellen Quellen; gemeldete Fehler korrigiert die Loop. 🐛-Button unten rechts.