promptgarten 🌱

Benchmarks

Benchmark(基准测试)是研究者用来衡量 AI 在某类具体任务上表现的标准化测试——比如解决编程问题,或者执行终端命令。这里故意不列具体分数:它们几乎每周都在变,同一个 benchmark 常常同时流传着好几个互相矛盾的“官方”结果。我们更愿意告诉你每个 benchmark 到底在测什么,并附上它当前的排行榜链接。

Guide: how to read benchmarks · Stand / as of: 2026-07-28

SWE-bench (+Verified/Pro)

测试 AI agent 能不能解决真实的 GitHub issue——写出一个能通过仓库隐藏测试套件的补丁。

最初由普林斯顿和斯坦福推出;Verified 版本由 OpenAI 参与整理,Pro 版本由 Scale AI 运营。

⚠️ 独立审计发现,有些解法其实在 issue 讨论串里已经被提前透露,测试也太弱;而且 SWE-bench Pro 目前流传着好几个互相矛盾的“官方”分数,取决于用的是哪个 scaffold、哪个数据切分。

Live-Leaderboard ↗

Terminal-Bench

检验 agent 能不能解决终端里真实的多步骤任务——每一条命令的输出都会改变下一步该做什么。

Stanford 与 Laude 合作(与 Anthropic 关系密切),是开源框架“Harbor”的一部分。

Live-Leaderboard ↗

Aider Polyglot

测试模型能不能在没有帮助的情况下正确遵循指令、编辑代码——覆盖多种编程语言的练习题。

由 Aider 的作者 Paul Gauthier 个人运营——不是某个实验室或联盟。

⚠️ 排行榜不会每出一个新模型就更新——榜首可能挂着过时的模型好几个月,只是因为更新的模型还没被测试过。

Live-Leaderboard ↗

LiveCodeBench

测试代码生成、自我纠错、预测测试输出以及代码执行——用持续更新的编程竞赛题,防止旧题目泄漏进训练数据。

由 UC Berkeley、MIT 和 Cornell 的研究者共同开发(负责人 Naman Jain)。

Live-Leaderboard ↗

LMArena Code Arena / WebDev Arena

衡量的是人类偏好,不是正确性:真实用户盲选投票,看两个模型的输出(代码或网页应用)哪个更好。

Arena.ai(即 LMArena / LMSYS 项目)。

⚠️ 一项针对厂商提交内容的大规模分析显示:如果只挑最好的那个版本提交,能明显把自己的分数刷高。

Live-Leaderboard ↗

HumanEval

在人工编写的 Python 题目上测试功能正确性——真的用单元测试去跑生成出来的代码。

由 OpenAI 的研究者创建(Chen、Tworek、Jun 等人)。

⚠️ 已经饱和:几乎所有顶尖模型都挤在榜首,分数很接近,这个 benchmark 已经很难再区分它们了。现在它只能当个最低限度的检查,不适合用来给顶尖模型排名。

Live-Leaderboard ↗

Artificial Analysis Coding Agent Index

一个综合分数,衡量编程 agent 端到端的表现——把好几个基础 benchmark,再加上成本、token 和时间效率,合并成一个指数。

由 Artificial Analysis 运营,一家独立的基准测试机构。

⚠️ 把模型和 agent harness 绑在一起评估——同一个模型换个 scaffold,表现可能差很多。

Live-Leaderboard ↗

ARC-AGI-2

通过视觉网格变换谜题来测试抽象、灵活的推理能力,同时也看模型解题的效率(花了多大成本)。严格来说不算编程类 benchmark。

由非营利组织 ARC Prize Inc. 运营(为了防止数据污染,测试数据保持私有或半私有状态)。

Live-Leaderboard ↗

MMLU / MMLU-Pro

用来自很多学科领域的选择题,测试通用知识和逻辑推理能力。不是编程类 benchmark。

最初由 Hendrycks 及其同事创建(与 UC Berkeley 关系密切的研究者)。

⚠️ 已经饱和:顶尖模型的分数挤在一起,难以区分。MMLU-Pro 就是为了解决这个问题而做的,但据说也已经开始出现饱和迹象。

Live-Leaderboard ↗

METR "Time Horizon"

衡量的是在固定可靠度门槛下,agent 能独立支撑多长时间的任务(以人类专家的工作时长计算)——这是一条随时间变化的趋势线,不是单一分数。

由 METR 运营,一家专注于 AI 评估的独立非营利机构。

⚠️ METR 自己也提醒,对于非常长的任务,用现有的任务集合测出来的结果并不可靠——应该把它当作一条趋势线来看,而不是一个精确的界限。

Live-Leaderboard ↗

Frontier-Bench

在一个范围广、刻意设计得很难、并持续扩充的任务集合上测试 AI agent——任务取自真实的 agent 工作场景(包括编程任务),在沙箱环境中运行。持续加入新任务是为了防止 benchmark 被训练数据污染或变得饱和。

Terminal-Bench 的后续项目,由开源框架"Harbor"背后的同一个团队运营(Laude Institute,与斯坦福关系密切)。

⚠️ 这是一个非常年轻、持续演变的数据集——因为不断有新任务加入,不同时间点测出的结果不能直接比较。此外,排行榜把模型和 agent harness(比如 Claude Code、Codex、mini-SWE-agent)绑在一起评估——同一个模型换个 scaffold,表现可能差很多。

Live-Leaderboard ↗

GDPval-AA

在覆盖众多职业和行业的贴近真实的知识工作任务上测试 AI 模型(比如法律文书、技术图纸或财务文件)——基于 OpenAI 的 GDPval 数据集构建。模型在一个 agentic 循环中获得 shell 和网页访问权限;由一个 LLM 评判模型对两份匿名模型输出进行正面对比,由此得出一个锚定在人类专家水平上的 Elo 分数。

由 Artificial Analysis 运营,基于 OpenAI 与行业专家共同开发的 GDPval 任务集构建。

⚠️ 这里的评估方法和 OpenAI 自己的 GDPval 研究不一样:那边是由人类行业专家来评判,这里则是由 LLM 比较匿名的两两输出——所以两者的结果不能直接和 OpenAI 自己公布的 GDPval 数据比较。而且这里的任务都是一次性完成、没有多轮修改的机会,按 OpenAI 自己的说法,这只能不完整地反映真实的知识工作。

Live-Leaderboard ↗

GPQA / GPQA Diamond

生物、化学、物理领域博士生水平的选择题,由该领域专家撰写并审核——难度大到即使是能力不错的非专业人士,就算能无限制上网查资料,大多数也答不对(因此被称为"Google-proof",即搜索也没用)。"GPQA Diamond"是一个更小、筛选更严格的子集,要求两位专家评审都能独立找到正确答案,同时大多数非专业人士都答错——排行榜上通常引用的就是这个更难的版本,但往往没有明确说明这一点。

由 David Rein 和 Samuel Bowman 领导的研究团队创建,大多数成员来自纽约大学。

⚠️ 厂商经常只说"GPQA",却不说明指的是完整题集还是更小、更难的 Diamond 子集——这样一来数字就没法比较。因为整个数据集连同答案都是公开的,作者在其中嵌入了一个 canary 字符串,至少可以用来检测模型训练是否受到了污染——但这并不能完全排除污染的可能。

Live-Leaderboard ↗

BrowseComp

测试 AI agent 能否在开放网络上找到那些难以查到、但可以明确核实的事实:题目简短,只有一个正确的简短答案,且刻意设计得让简单搜索不够用——其难度已经通过验证:在题目创建时可用的最强模型都解不出来。

由 OpenAI 发布,数据集在 simple-evals 仓库中公开。

⚠️ OpenAI 自己也指出,这种只关注简短、明确答案的做法,并不能说明结果能在多大程度上迁移到真实、开放式的调研任务上——这个 benchmark 没有覆盖长文本、含糊或自由文本类型的任务。就连参与验证、亲自解答这些题目的人类测试者,也只能解出其中一小部分。

Live-Leaderboard ↗