promptgarten đŸŒ±

Benchmarks

Ein Benchmark ist ein standardisierter Test, mit dem Forscher messen, wie gut eine KI bestimmte Aufgaben löst – zum Beispiel Programmieraufgaben lösen oder Terminal-Befehle ausfĂŒhren. Du findest hier bewusst keine Punktzahlen: Sie Ă€ndern sich fast wöchentlich, und fĂŒr einen einzigen Benchmark kursieren oft mehrere unterschiedliche „offizielle“ Ergebnisse gleichzeitig. Wir erklĂ€ren dir stattdessen, was jeder Benchmark wirklich misst, und verlinken zum aktuellen Leaderboard.

→ Guide: Benchmarks lesen, ohne reinzufallen · Stand / as of: 2026-07-28

SWE-bench (+Verified/Pro)

Testet, ob ein KI-Agent echte GitHub-Probleme löst, indem er einen Patch schreibt, der die versteckten Tests des Repos besteht.

UrsprĂŒnglich Princeton & Stanford; die Verified-Variante wurde mit OpenAI kuratiert, die Pro-Variante betreibt Scale AI.

⚠ UnabhĂ€ngige Audits fanden Lösungen, die im Issue-Thread schon verraten waren, und zu schwache Tests – und fĂŒr SWE-bench Pro kursieren mehrere widersprĂŒchliche „offizielle“ Werte, je nachdem welches Scaffold und welcher Datensplit benutzt wurde.

Live-Leaderboard ↗

Terminal-Bench

PrĂŒft, ob ein Agent echte Mehrschritt-Aufgaben im Terminal löst, bei denen jede Befehlsausgabe die nĂ€chste Entscheidung verĂ€ndert.

Stanford x Laude (Anthropic-nah), Teil des offenen „Harbor“-Frameworks.

Live-Leaderboard ↗

Aider Polyglot

Testet, ob ein Modell Anweisungen befolgt und Code ohne Hilfe korrekt bearbeitet – ĂŒber ProgrammierĂŒbungen in mehreren Sprachen hinweg.

Wird von Paul Gauthier betrieben, dem Aider-Ersteller – nicht von einem Labor oder Konsortium.

⚠ Das Leaderboard wird nicht bei jedem neuen Modell aktualisiert – es kann monatelang veraltete Modelle oben zeigen, einfach weil neuere noch nicht getestet wurden.

Live-Leaderboard ↗

LiveCodeBench

Testet Code-Generierung, Selbstkorrektur, Vorhersage von Test-Output und Code-AusfĂŒhrung – mit laufend neuen Wettbewerbsaufgaben, damit alte Aufgaben nicht ins Training durchsickern können.

Forscher von UC Berkeley, MIT und Cornell (Leitung: Naman Jain).

Live-Leaderboard ↗

LMArena Code Arena / WebDev Arena

Misst menschliche PrÀferenz statt Korrektheit: Echte Nutzer stimmen blind ab, welche von zwei Modell-Ausgaben (Code oder Web-App) ihnen besser gefÀllt.

Arena.ai (das LMArena- bzw. LMSYS-Projekt).

⚠ Eine große Analyse von Anbieter-Einreichungen zeigte: Wer gezielt nur die beste Variante einreicht, kann den eigenen Score spĂŒrbar aufblĂ€hen.

Live-Leaderboard ↗

HumanEval

Testet funktionale Korrektheit auf handgeschriebenen Python-Aufgaben, indem der generierte Code tatsĂ€chlich gegen Unit-Tests ausgefĂŒhrt wird.

Erstellt von OpenAI-Forschern (Chen, Tworek, Jun u. a.).

⚠ GesĂ€ttigt: Fast alle Spitzenmodelle liegen ganz oben dicht beieinander, der Benchmark unterscheidet sie kaum noch. Dient nur noch als Mindest-Check, nicht zum Ranking von Spitzenmodellen.

Live-Leaderboard ↗

Artificial Analysis Coding Agent Index

Ein zusammengesetzter Score fĂŒr End-to-End-Leistung von Coding-Agenten – kombiniert mehrere Basis-Benchmarks plus Kosten-, Token- und Zeit-Effizienz zu einem Index.

Betrieben von Artificial Analysis, einem unabhÀngigen Benchmarking-Anbieter.

⚠ Bewertet Modell und Agent-Harness zusammen als Paar – dasselbe Modell kann je nach Scaffold sehr unterschiedlich abschneiden.

Live-Leaderboard ↗

ARC-AGI-2

Testet abstraktes, flexibles Schlussfolgern anhand visueller Grid-Transformations-RÀtsel, plus wie effizient (zu welchen Kosten) ein Modell sie löst. Kein Coding-Benchmark im engeren Sinn.

Betrieben von ARC Prize Inc., einer Non-Profit-Organisation (hÀlt Testdaten privat bzw. halb-privat, um Kontamination zu verhindern).

Live-Leaderboard ↗

MMLU / MMLU-Pro

Testet Allgemeinwissen und logisches Schlussfolgern mit Multiple-Choice-Fragen aus vielen akademischen Fachbereichen. Kein Coding-Benchmark.

UrsprĂŒnglich von Hendrycks und Kollegen (UC-Berkeley-nahe Forscher).

⚠ GesĂ€ttigt: Spitzenmodelle liegen zu eng beieinander, um sie zu unterscheiden. MMLU-Pro wurde gebaut, um das zu beheben, gilt aber bereits als beginnend zu sĂ€ttigen.

Live-Leaderboard ↗

METR „Time Horizon“

Misst, wie lange eine Aufgabe (in menschlicher Experten-Arbeitszeit) ein Agent selbststĂ€ndig durchhĂ€lt, bei einer festen ZuverlĂ€ssigkeits-Schwelle – als Trendlinie ĂŒber die Zeit, nicht als einzelner Score.

Betrieben von METR, einer unabhĂ€ngigen Non-Profit-Organisation fĂŒr KI-Evaluierung.

⚠ METR selbst warnt, dass Messungen fĂŒr sehr lange Aufgaben mit der aktuellen Aufgaben-Sammlung unzuverlĂ€ssig werden – als Trendlinie lesen, nicht als exakte Grenze.

Live-Leaderboard ↗

Frontier-Bench

Testet KI-Agenten an einem breiten, bewusst schwierigen und laufend erweiterten Aufgaben-Set aus der realen Agenten-Arbeit (u. a. Programmieraufgaben), ausgefĂŒhrt in einer Sandbox-Umgebung – stĂ€ndiger Nachschub an neuen Aufgaben soll verhindern, dass der Benchmark durchs Training kontaminiert oder gesĂ€ttigt wird.

Nachfolgeprojekt von Terminal-Bench, betrieben vom selben Team rund um das offene „Harbor“-Framework (Laude Institute, Stanford-nah).

⚠ Sehr junger, sich laufend weiterentwickelnder Datensatz – weil stĂ€ndig neue Aufgaben ergĂ€nzt werden, sind Ergebnisse von unterschiedlichen Zeitpunkten nicht direkt vergleichbar. Das Leaderboard bewertet außerdem Modell und Agent-Harness (z. B. Claude Code, Codex, mini-SWE-agent) gemeinsam als Paar – dasselbe Modell kann je nach Scaffold sehr unterschiedlich abschneiden.

Live-Leaderboard ↗

GDPval-AA

Testet KI-Modelle an realitĂ€tsnahen Wissensarbeits-Aufgaben aus zahlreichen Berufen und Branchen (etwa juristische SchriftsĂ€tze, technische Zeichnungen oder Finanzunterlagen) – aufbauend auf OpenAIs GDPval-Datensatz. Modelle erhalten in einem agentischen Loop Shell- und Web-Zugriff; ein LLM-Richter vergleicht zwei anonymisierte Modell-Ausgaben im direkten Duell, woraus eine an menschlicher Expertenleistung verankerte Elo-Wertung entsteht.

Betrieben von Artificial Analysis, aufbauend auf dem von OpenAI gemeinsam mit Branchenexperten entwickelten GDPval-Aufgabenset.

⚠ Die Bewertungsmethode weicht von OpenAIs eigener GDPval-Studie ab: Dort urteilten menschliche Branchenexperten, hier vergleicht ein LLM anonymisierte Paare – die Ergebnisse sind daher nicht direkt mit OpenAIs eigenen GDPval-Zahlen vergleichbar. Zudem handelt es sich um Ein-Schuss-Aufgaben ohne mehrere Überarbeitungsrunden, was reale Wissensarbeit laut OpenAI selbst nur unvollstĂ€ndig abbildet.

Live-Leaderboard ↗

GPQA / GPQA Diamond

Multiple-Choice-Fragen auf Doktorandenniveau in Biologie, Chemie und Physik, geschrieben und geprĂŒft von Fachexperten – so schwer, dass selbst kompetente Nicht-Experten mit uneingeschrĂ€nktem Internetzugang meist an ihnen scheitern (daher „Google-proof“). „GPQA Diamond“ ist eine kleinere, noch strenger gefilterte Teilmenge, bei der beide Fachgutachter unabhĂ€ngig die richtige Antwort fanden und die Mehrheit der Nicht-Experten falsch lag – diese hĂ€rtere Variante wird in Leaderboards meist zitiert, oft ohne das ausdrĂŒcklich zu kennzeichnen.

Erstellt von einem Forschungsteam um David Rein und Samuel Bowman, grĂ¶ĂŸtenteils an der New York University.

⚠ Anbieter nennen oft nur „GPQA“, ohne zu spezifizieren, ob das volle Set oder die kleinere, schwerere Diamond-Teilmenge gemeint ist – die Werte sind dann nicht vergleichbar. Weil der Datensatz samt Lösungen öffentlich zugĂ€nglich ist, betten die Autoren einen Canary-String ein, um Kontamination durchs Modelltraining zumindest zu erkennen – ausschließen lĂ€sst sie sich damit nicht.

Live-Leaderboard ↗

BrowseComp

Testet, ob ein KI-Agent schwer auffindbare, aber eindeutig ĂŒberprĂŒfbare Fakten im offenen Web aufspĂŒrt: kurze Fragen mit genau einer korrekten, kurzen Antwort, die absichtlich so konstruiert sind, dass eine einfache Suche nicht reicht – verifiziert dadurch, dass die zum Erstellungszeitpunkt stĂ€rksten verfĂŒgbaren Modelle die Fragen nicht lösen konnten.

Veröffentlicht von OpenAI, Datensatz offen im simple-evals-Repository.

⚠ OpenAI weist selbst darauf hin, dass der Fokus auf kurzen, eindeutigen Antworten unklar lĂ€sst, wie gut das Ergebnis auf echte, offene Rechercheanfragen ĂŒbertragbar ist – lange, mehrdeutige oder freitextliche Aufgaben deckt der Benchmark nicht ab. Selbst menschliche Tester, die die Fragen zur Verifikation bearbeiteten, konnten dabei nur einen kleinen Teil der Aufgaben lösen.

Live-Leaderboard ↗