Benchmarks
Ein Benchmark ist ein standardisierter Test, mit dem Forscher messen, wie gut eine KI bestimmte Aufgaben löst â zum Beispiel Programmieraufgaben lösen oder Terminal-Befehle ausfĂŒhren. Du findest hier bewusst keine Punktzahlen: Sie Ă€ndern sich fast wöchentlich, und fĂŒr einen einzigen Benchmark kursieren oft mehrere unterschiedliche âoffizielleâ Ergebnisse gleichzeitig. Wir erklĂ€ren dir stattdessen, was jeder Benchmark wirklich misst, und verlinken zum aktuellen Leaderboard.
â Guide: Benchmarks lesen, ohne reinzufallen · Stand / as of: 2026-07-28
SWE-bench (+Verified/Pro)
Testet, ob ein KI-Agent echte GitHub-Probleme löst, indem er einen Patch schreibt, der die versteckten Tests des Repos besteht.
UrsprĂŒnglich Princeton & Stanford; die Verified-Variante wurde mit OpenAI kuratiert, die Pro-Variante betreibt Scale AI.
â ïž UnabhĂ€ngige Audits fanden Lösungen, die im Issue-Thread schon verraten waren, und zu schwache Tests â und fĂŒr SWE-bench Pro kursieren mehrere widersprĂŒchliche âoffizielleâ Werte, je nachdem welches Scaffold und welcher Datensplit benutzt wurde.
Live-Leaderboard âTerminal-Bench
PrĂŒft, ob ein Agent echte Mehrschritt-Aufgaben im Terminal löst, bei denen jede Befehlsausgabe die nĂ€chste Entscheidung verĂ€ndert.
Stanford x Laude (Anthropic-nah), Teil des offenen âHarborâ-Frameworks.
Live-Leaderboard âAider Polyglot
Testet, ob ein Modell Anweisungen befolgt und Code ohne Hilfe korrekt bearbeitet â ĂŒber ProgrammierĂŒbungen in mehreren Sprachen hinweg.
Wird von Paul Gauthier betrieben, dem Aider-Ersteller â nicht von einem Labor oder Konsortium.
â ïž Das Leaderboard wird nicht bei jedem neuen Modell aktualisiert â es kann monatelang veraltete Modelle oben zeigen, einfach weil neuere noch nicht getestet wurden.
Live-Leaderboard âLiveCodeBench
Testet Code-Generierung, Selbstkorrektur, Vorhersage von Test-Output und Code-AusfĂŒhrung â mit laufend neuen Wettbewerbsaufgaben, damit alte Aufgaben nicht ins Training durchsickern können.
Forscher von UC Berkeley, MIT und Cornell (Leitung: Naman Jain).
Live-Leaderboard âLMArena Code Arena / WebDev Arena
Misst menschliche PrÀferenz statt Korrektheit: Echte Nutzer stimmen blind ab, welche von zwei Modell-Ausgaben (Code oder Web-App) ihnen besser gefÀllt.
Arena.ai (das LMArena- bzw. LMSYS-Projekt).
â ïž Eine groĂe Analyse von Anbieter-Einreichungen zeigte: Wer gezielt nur die beste Variante einreicht, kann den eigenen Score spĂŒrbar aufblĂ€hen.
Live-Leaderboard âHumanEval
Testet funktionale Korrektheit auf handgeschriebenen Python-Aufgaben, indem der generierte Code tatsĂ€chlich gegen Unit-Tests ausgefĂŒhrt wird.
Erstellt von OpenAI-Forschern (Chen, Tworek, Jun u. a.).
â ïž GesĂ€ttigt: Fast alle Spitzenmodelle liegen ganz oben dicht beieinander, der Benchmark unterscheidet sie kaum noch. Dient nur noch als Mindest-Check, nicht zum Ranking von Spitzenmodellen.
Live-Leaderboard âArtificial Analysis Coding Agent Index
Ein zusammengesetzter Score fĂŒr End-to-End-Leistung von Coding-Agenten â kombiniert mehrere Basis-Benchmarks plus Kosten-, Token- und Zeit-Effizienz zu einem Index.
Betrieben von Artificial Analysis, einem unabhÀngigen Benchmarking-Anbieter.
â ïž Bewertet Modell und Agent-Harness zusammen als Paar â dasselbe Modell kann je nach Scaffold sehr unterschiedlich abschneiden.
Live-Leaderboard âARC-AGI-2
Testet abstraktes, flexibles Schlussfolgern anhand visueller Grid-Transformations-RÀtsel, plus wie effizient (zu welchen Kosten) ein Modell sie löst. Kein Coding-Benchmark im engeren Sinn.
Betrieben von ARC Prize Inc., einer Non-Profit-Organisation (hÀlt Testdaten privat bzw. halb-privat, um Kontamination zu verhindern).
Live-Leaderboard âMMLU / MMLU-Pro
Testet Allgemeinwissen und logisches Schlussfolgern mit Multiple-Choice-Fragen aus vielen akademischen Fachbereichen. Kein Coding-Benchmark.
UrsprĂŒnglich von Hendrycks und Kollegen (UC-Berkeley-nahe Forscher).
â ïž GesĂ€ttigt: Spitzenmodelle liegen zu eng beieinander, um sie zu unterscheiden. MMLU-Pro wurde gebaut, um das zu beheben, gilt aber bereits als beginnend zu sĂ€ttigen.
Live-Leaderboard âMETR âTime Horizonâ
Misst, wie lange eine Aufgabe (in menschlicher Experten-Arbeitszeit) ein Agent selbststĂ€ndig durchhĂ€lt, bei einer festen ZuverlĂ€ssigkeits-Schwelle â als Trendlinie ĂŒber die Zeit, nicht als einzelner Score.
Betrieben von METR, einer unabhĂ€ngigen Non-Profit-Organisation fĂŒr KI-Evaluierung.
â ïž METR selbst warnt, dass Messungen fĂŒr sehr lange Aufgaben mit der aktuellen Aufgaben-Sammlung unzuverlĂ€ssig werden â als Trendlinie lesen, nicht als exakte Grenze.
Live-Leaderboard âFrontier-Bench
Testet KI-Agenten an einem breiten, bewusst schwierigen und laufend erweiterten Aufgaben-Set aus der realen Agenten-Arbeit (u. a. Programmieraufgaben), ausgefĂŒhrt in einer Sandbox-Umgebung â stĂ€ndiger Nachschub an neuen Aufgaben soll verhindern, dass der Benchmark durchs Training kontaminiert oder gesĂ€ttigt wird.
Nachfolgeprojekt von Terminal-Bench, betrieben vom selben Team rund um das offene âHarborâ-Framework (Laude Institute, Stanford-nah).
â ïž Sehr junger, sich laufend weiterentwickelnder Datensatz â weil stĂ€ndig neue Aufgaben ergĂ€nzt werden, sind Ergebnisse von unterschiedlichen Zeitpunkten nicht direkt vergleichbar. Das Leaderboard bewertet auĂerdem Modell und Agent-Harness (z. B. Claude Code, Codex, mini-SWE-agent) gemeinsam als Paar â dasselbe Modell kann je nach Scaffold sehr unterschiedlich abschneiden.
Live-Leaderboard âGDPval-AA
Testet KI-Modelle an realitĂ€tsnahen Wissensarbeits-Aufgaben aus zahlreichen Berufen und Branchen (etwa juristische SchriftsĂ€tze, technische Zeichnungen oder Finanzunterlagen) â aufbauend auf OpenAIs GDPval-Datensatz. Modelle erhalten in einem agentischen Loop Shell- und Web-Zugriff; ein LLM-Richter vergleicht zwei anonymisierte Modell-Ausgaben im direkten Duell, woraus eine an menschlicher Expertenleistung verankerte Elo-Wertung entsteht.
Betrieben von Artificial Analysis, aufbauend auf dem von OpenAI gemeinsam mit Branchenexperten entwickelten GDPval-Aufgabenset.
â ïž Die Bewertungsmethode weicht von OpenAIs eigener GDPval-Studie ab: Dort urteilten menschliche Branchenexperten, hier vergleicht ein LLM anonymisierte Paare â die Ergebnisse sind daher nicht direkt mit OpenAIs eigenen GDPval-Zahlen vergleichbar. Zudem handelt es sich um Ein-Schuss-Aufgaben ohne mehrere Ăberarbeitungsrunden, was reale Wissensarbeit laut OpenAI selbst nur unvollstĂ€ndig abbildet.
Live-Leaderboard âGPQA / GPQA Diamond
Multiple-Choice-Fragen auf Doktorandenniveau in Biologie, Chemie und Physik, geschrieben und geprĂŒft von Fachexperten â so schwer, dass selbst kompetente Nicht-Experten mit uneingeschrĂ€nktem Internetzugang meist an ihnen scheitern (daher âGoogle-proofâ). âGPQA Diamondâ ist eine kleinere, noch strenger gefilterte Teilmenge, bei der beide Fachgutachter unabhĂ€ngig die richtige Antwort fanden und die Mehrheit der Nicht-Experten falsch lag â diese hĂ€rtere Variante wird in Leaderboards meist zitiert, oft ohne das ausdrĂŒcklich zu kennzeichnen.
Erstellt von einem Forschungsteam um David Rein und Samuel Bowman, gröĂtenteils an der New York University.
â ïž Anbieter nennen oft nur âGPQAâ, ohne zu spezifizieren, ob das volle Set oder die kleinere, schwerere Diamond-Teilmenge gemeint ist â die Werte sind dann nicht vergleichbar. Weil der Datensatz samt Lösungen öffentlich zugĂ€nglich ist, betten die Autoren einen Canary-String ein, um Kontamination durchs Modelltraining zumindest zu erkennen â ausschlieĂen lĂ€sst sie sich damit nicht.
Live-Leaderboard âBrowseComp
Testet, ob ein KI-Agent schwer auffindbare, aber eindeutig ĂŒberprĂŒfbare Fakten im offenen Web aufspĂŒrt: kurze Fragen mit genau einer korrekten, kurzen Antwort, die absichtlich so konstruiert sind, dass eine einfache Suche nicht reicht â verifiziert dadurch, dass die zum Erstellungszeitpunkt stĂ€rksten verfĂŒgbaren Modelle die Fragen nicht lösen konnten.
Veröffentlicht von OpenAI, Datensatz offen im simple-evals-Repository.
â ïž OpenAI weist selbst darauf hin, dass der Fokus auf kurzen, eindeutigen Antworten unklar lĂ€sst, wie gut das Ergebnis auf echte, offene Rechercheanfragen ĂŒbertragbar ist â lange, mehrdeutige oder freitextliche Aufgaben deckt der Benchmark nicht ab. Selbst menschliche Tester, die die Fragen zur Verifikation bearbeiteten, konnten dabei nur einen kleinen Teil der Aufgaben lösen.
Live-Leaderboard â