promptgarten đŸŒ±

Benchmarks

Un benchmark est un test standardisĂ© que les chercheurs utilisent pour mesurer la capacitĂ© d'une IA Ă  accomplir un type de tĂąche prĂ©cis — rĂ©soudre des problĂšmes de code, par exemple, ou exĂ©cuter des commandes dans un terminal. Tu ne trouveras pas de scores ici, c'est volontaire : ils changent presque chaque semaine, et un mĂȘme benchmark a souvent plusieurs rĂ©sultats « officiels » contradictoires en circulation Ă  la fois. On t'explique plutĂŽt ce que chaque benchmark mesure vraiment, avec un lien vers son classement en direct.

→ Guide: how to read benchmarks · Stand / as of: 2026-07-28

SWE-bench (+Verified/Pro)

Teste si un agent IA résout de vrais problÚmes GitHub en écrivant un patch qui passe la suite de tests cachés du dépÎt.

À l'origine de Princeton et Stanford ; la variante Verified a Ă©tĂ© constituĂ©e avec OpenAI, la variante Pro est gĂ©rĂ©e par Scale AI.

⚠ Des audits indĂ©pendants ont trouvĂ© des solutions dĂ©jĂ  rĂ©vĂ©lĂ©es dans le fil de l'issue, ainsi que des tests trop faibles — et pour SWE-bench Pro, plusieurs valeurs « officielles » contradictoires circulent, selon le scaffold et le dĂ©coupage de donnĂ©es utilisĂ©s.

Live-Leaderboard ↗

Terminal-Bench

VĂ©rifie si un agent rĂ©sout de vraies tĂąches multi-Ă©tapes dans un terminal, oĂč chaque sortie de commande change la dĂ©cision suivante.

Stanford x Laude (proche d'Anthropic), qui fait partie du framework ouvert « Harbor ».

Live-Leaderboard ↗

Aider Polyglot

Teste si un modĂšle suit les instructions et modifie du code correctement, sans aide, Ă  travers des exercices de programmation dans plusieurs langages.

GĂ©rĂ© par Paul Gauthier, le crĂ©ateur d'Aider — pas par un laboratoire ni un consortium.

⚠ Le classement n'est pas mis Ă  jour Ă  chaque nouveau modĂšle — il peut afficher des modĂšles dĂ©passĂ©s en tĂȘte pendant des mois, simplement parce que les plus rĂ©cents n'ont pas encore Ă©tĂ© testĂ©s.

Live-Leaderboard ↗

LiveCodeBench

Teste la génération de code, l'autocorrection, la prédiction de la sortie des tests et l'exécution de code, avec des problÚmes de programmation compétitive renouvelés en continu pour que les anciens ne fuient pas dans les données d'entraßnement.

Des chercheurs de UC Berkeley, du MIT et de Cornell (dirigé par Naman Jain).

Live-Leaderboard ↗

LMArena Code Arena / WebDev Arena

Mesure la préférence humaine, pas la justesse : de vrais utilisateurs votent à l'aveugle pour dire laquelle de deux réponses de modÚles (code ou web-app) ils préfÚrent.

Arena.ai (le projet LMArena / LMSYS).

⚠ Une analyse Ă  grande Ă©chelle des soumissions des fournisseurs a montrĂ© que ne soumettre dĂ©libĂ©rĂ©ment que la meilleure variante peut gonfler sensiblement son propre score.

Live-Leaderboard ↗

HumanEval

Teste la justesse fonctionnelle sur des problÚmes Python écrits à la main, en exécutant réellement le code généré face à des tests unitaires.

Créé par des chercheurs d'OpenAI (Chen, Tworek, Jun et d'autres).

⚠ SaturĂ© : presque tous les modĂšles de pointe se retrouvent tassĂ©s en haut du classement, le benchmark ne les diffĂ©rencie presque plus. Il ne sert plus que de vĂ©rification minimale, pas pour classer les modĂšles de pointe.

Live-Leaderboard ↗

Artificial Analysis Coding Agent Index

Un score composite pour la performance de bout en bout des agents de code — combine plusieurs benchmarks de base ainsi que l'efficacitĂ© en coĂ»t, en tokens et en temps dans un seul indice.

Géré par Artificial Analysis, un fournisseur indépendant de benchmarking.

⚠ Évalue le modĂšle et le harnais de l'agent ensemble, comme une paire : le mĂȘme modĂšle peut donner des rĂ©sultats trĂšs diffĂ©rents selon le scaffold.

Live-Leaderboard ↗

ARC-AGI-2

Teste le raisonnement abstrait et flexible à travers des énigmes visuelles de transformation de grilles, ainsi que l'efficacité (à quel coût) avec laquelle un modÚle les résout. Ce n'est pas un benchmark de code à proprement parler.

Géré par ARC Prize Inc., une organisation à but non lucratif (garde les données de test privées ou semi-privées pour éviter la contamination).

Live-Leaderboard ↗

MMLU / MMLU-Pro

Teste les connaissances générales et le raisonnement logique avec des questions à choix multiples issues de nombreuses disciplines académiques. Pas un benchmark de code.

Créé à l'origine par Hendrycks et ses collÚgues (chercheurs proches de UC Berkeley).

⚠ SaturĂ© : les modĂšles de pointe sont trop proches les uns des autres pour ĂȘtre distinguĂ©s. MMLU-Pro a Ă©tĂ© créé pour corriger ça, mais il commencerait dĂ©jĂ  Ă  saturer lui aussi.

Live-Leaderboard ↗

METR "Time Horizon"

Mesure combien de temps (en temps de travail d'un expert humain) un agent tient de façon autonome sur une tĂąche, Ă  un seuil de fiabilitĂ© fixe — comme une courbe de tendance dans le temps, pas comme un score unique.

Géré par METR, une organisation à but non lucratif indépendante dédiée à l'évaluation de l'IA.

⚠ METR prĂ©vient elle-mĂȘme que les mesures pour les tĂąches trĂšs longues deviennent peu fiables avec le jeu de tĂąches actuel — Ă  lire comme une courbe de tendance, pas comme une limite exacte.

Live-Leaderboard ↗

Frontier-Bench

Teste des agents IA sur un ensemble de tĂąches large, dĂ©libĂ©rĂ©ment difficile et enrichi en continu, tirĂ© du travail agentique rĂ©el (dont des tĂąches de programmation), exĂ©cutĂ© dans un environnement sandbox — un apport constant de nouvelles tĂąches vise Ă  empĂȘcher que le benchmark soit contaminĂ© par l'entraĂźnement ou qu'il sature.

Projet successeur de Terminal-Bench, gĂ©rĂ© par la mĂȘme Ă©quipe autour du framework ouvert « Harbor » (Laude Institute, proche de Stanford).

⚠ Un jeu de donnĂ©es trĂšs jeune, en Ă©volution constante — comme de nouvelles tĂąches sont ajoutĂ©es en permanence, les rĂ©sultats de diffĂ©rentes pĂ©riodes ne sont pas directement comparables. Le classement Ă©value aussi le modĂšle et le harnais de l'agent (par ex. Claude Code, Codex, mini-SWE-agent) ensemble, comme une paire : le mĂȘme modĂšle peut donner des rĂ©sultats trĂšs diffĂ©rents selon le scaffold.

Live-Leaderboard ↗

GDPval-AA

Teste des modĂšles d'IA sur des tĂąches de travail intellectuel rĂ©alistes couvrant de nombreux mĂ©tiers et secteurs (comme des mĂ©moires juridiques, des plans techniques ou des documents financiers) — en s'appuyant sur le jeu de donnĂ©es GDPval d'OpenAI. Les modĂšles reçoivent un accĂšs shell et web dans une boucle agentique ; un juge LLM compare deux rĂ©sultats de modĂšles anonymisĂ©s en duel direct, ce qui produit un score Elo ancrĂ© sur la performance d'experts humains.

Géré par Artificial Analysis, en s'appuyant sur le jeu de tùches GDPval qu'OpenAI a développé avec des experts du secteur.

⚠ La mĂ©thode d'Ă©valuation diffĂšre de l'Ă©tude GDPval d'OpenAI elle-mĂȘme : lĂ , des experts humains du secteur jugeaient le travail ; ici, un LLM compare des paires anonymisĂ©es — les rĂ©sultats ne sont donc pas directement comparables aux chiffres GDPval d'OpenAI. Il s'agit en outre de tĂąches en un seul essai, sans cycle de rĂ©vision, ce qui, de l'aveu mĂȘme d'OpenAI, ne reflĂšte qu'incomplĂštement le travail intellectuel rĂ©el.

Live-Leaderboard ↗

GPQA / GPQA Diamond

Questions Ă  choix multiples de niveau doctorat en biologie, chimie et physique, rĂ©digĂ©es et validĂ©es par des experts du domaine — assez difficiles pour que mĂȘme des non-experts compĂ©tents avec un accĂšs illimitĂ© Ă  internet Ă©chouent le plus souvent (d'oĂč le terme « Google-proof »). « GPQA Diamond » est un sous-ensemble plus petit et filtrĂ© plus strictement, oĂč les deux relecteurs experts ont trouvĂ© indĂ©pendamment la bonne rĂ©ponse et oĂč la majoritĂ© des non-experts s'est trompĂ©e — cette variante plus difficile est celle gĂ©nĂ©ralement citĂ©e dans les classements, souvent sans le prĂ©ciser explicitement.

Créé par une équipe de recherche menée par David Rein et Samuel Bowman, en grande partie à l'université de New York.

⚠ Les fournisseurs se contentent souvent de dire « GPQA » sans prĂ©ciser s'ils parlent de l'ensemble complet ou du sous-ensemble Diamond, plus petit et plus difficile — les chiffres ne sont alors pas comparables. Comme le jeu de donnĂ©es, solutions comprises, est accessible publiquement, les auteurs y intĂšgrent une chaĂźne canary pour au moins dĂ©tecter une contamination par l'entraĂźnement des modĂšles — cela ne permet pas de l'exclure totalement.

Live-Leaderboard ↗

BrowseComp

Teste si un agent IA parvient Ă  retrouver sur le web ouvert des faits difficiles Ă  trouver mais clairement vĂ©rifiables : des questions courtes avec une seule rĂ©ponse correcte et brĂšve, dĂ©libĂ©rĂ©ment construites pour qu'une simple recherche ne suffise pas — vĂ©rifiĂ© par le fait que les modĂšles les plus puissants disponibles au moment de sa crĂ©ation ne parvenaient pas Ă  les rĂ©soudre.

Publié par OpenAI, jeu de données ouvert dans le dépÎt simple-evals.

⚠ OpenAI souligne elle-mĂȘme que l'accent mis sur des rĂ©ponses courtes et sans ambiguĂŻtĂ© laisse incertain le degrĂ© de transfert du rĂ©sultat vers de vraies requĂȘtes de recherche ouvertes — le benchmark ne couvre pas les tĂąches longues, ambiguĂ«s ou en texte libre. MĂȘme les testeurs humains ayant traitĂ© les questions pour la vĂ©rification n'ont rĂ©ussi Ă  en rĂ©soudre qu'une petite partie.

Live-Leaderboard ↗