常用 LLM Benchmark 全景解析与开发者实践手册 —— 从 MMLU 到 Chatbot Arena,一文读懂评测体系
大模型测试集(Benchmark)是衡量语言模型能力的标尺,也是模型迭代的方向指南。
大语言模型(LLM)的飞速发展催生了大量评测工具和测试集。一个测试集本质上是一组标准化的题目加上评分规则,用来量化模型在特定能力维度上的表现。就如同学生需要考试来衡量学习成果,大模型也需要测试集来评估其知识广度、推理能力、代码水平和安全性等方面的表现。
测试集的重要性体现在三个方面:第一,它提供了横向可比性——不同团队开发的模型可以在同一套题目上公平比较;第二,它提供了纵向追踪能力——通过观察同一测试集上的分数变化,可以追踪模型迭代带来的进步;第三,它为开发者选型提供了量化参考——根据自身应用场景选择在相关测试集上表现优异的模型[1]。
然而,2026 年的 LLM 评测面临一个前所未有的挑战:基准饱和。斯坦福 AI Index 2026 报告指出,MMLU、HumanEval、GSM8K 等经典测试集上的前沿模型分数已经高度聚集在 88%–99% 的狭窄区间,2%–3% 的分数差异已落入测量噪声范围[2]。这意味着传统测试集正在丧失区分前沿模型的能力,新一代测试集(如 MMLU-Pro、GPQA Diamond、HLE)正在接过接力棒。
以下按能力维度分组,逐一解析当前主流的大模型测试集。
由加州大学伯克利分校 Dan Hendrycks 团队发布,覆盖 57 个学科(涵盖 STEM、人文、社科、法律、医学等),从高中水平到专业级职业资格考试,共计 15,908 道四选一选择题。采用 5-shot 少样本设置,指标为平均准确率[3]。
随机猜测得分为 25%,GPT-4 达到 86.4%,人类专家约 90%。截至 2026 年,前沿模型已普遍超过 90%,MMLU 已无法有效区分顶级模型。
MMLU 的升级版,将选项从 4 个扩展到 10 个,大幅降低猜中概率(随机 10%),并增加了推理导向的题目。覆盖 14 个领域,共 12,000 道题,要求链式思维(CoT)推理[4]。
截至 2026 年 7 月,前沿模型在 MMLU-Pro 上的得分聚集在 89%–91% 区间,Claude Fable 5 以 91.5% 领先,仍是区分前沿模型的有效测试集之一。
由清华、上交等团队联合发布的首个综合性中文评测基准,覆盖 52 个学科,包含中学、高中、大学和专业四个难度级别,共 13,948 道四选一选择题。其中 C-Eval Hard 子集选取 8 个高难度数理化科目,专门考验复杂推理[5]。
2025 年 7 月已公开完整测试集。当前 Qwen3.6 Plus 以 93.3% 领跑 C-Eval 榜单。C-Eval 已被集成进 lm-evaluation-harness 生态。
另一重要的中文评测基准,覆盖 67 个学科(包括中国历史、中国文学、公务员考试等中国特色主题),共 11,582 道题。与 C-Eval 互补,CMMLU 更侧重中国文化与社会知识[6]。
默认 0-shot 评测,也支持 5-shot。使用中文 CoT 提示模板,结果可按学科或大类聚合统计。
由 OpenAI 发布,包含 164 个 Python 编程问题。每题给出函数签名和 docstring,要求模型生成符合规范的 Python 代码,通过单元测试判定正确性。核心指标为 pass@1(一次生成通过率)[7]。
Codex 初代仅 28.8%,GPT-4 达到 67%。截至 2026 年,前沿模型已超过 93%,HumanEval 基本饱和,仅适合作为代码能力的基础检查。
由 Google 发布,包含 974 个基础 Python 编程任务,涵盖基础算法、数学运算和标准库使用。同样使用执行测试评估,指标为 pass@1[8]。
与 HumanEval 互补——HumanEval 侧重函数级实现,MBPP 覆盖更广泛的基础编程场景。两者均已饱和,前沿模型得分普遍在 90% 以上。
当前最重要的真实世界编码评测基准。从真实 GitHub Python 仓库中提取 500 个已验证的 issue,要求模型端到端解决——理解问题、定位代码、编写补丁、通过测试。这远比函数级代码生成更接近真实软件工程[9]。
2023 年发布时最强模型仅 3% 解决率。截至 2026 年中,拥堵分数已达 93.9%,OpenAI 宣布弃用此基准。但 METR 审查发现约 50% 的"通过"PR 实际不会被真实项目维护者合并,暴露了验证器噪声问题[10]。
由 OpenAI 发布,包含 8,500 道小学数学应用题,需要多步骤逻辑推演和基础算术运算。采用自由文本生成,提取数字答案进行评分。支持直接生成和链式思维(CoT)两种模式[11]。
GPT-3(175B)仅 17%,GPT-4 达到 92%。截至 2026 年,前沿模型已普遍超过 95%,Kimi K2 Instruct 以 97.3% 领跑。GSM8K 已基本饱和。
由 UC Berkeley 发布,包含 12,500 道竞赛数学题,来源于 AMC 10、AMC 12 和 AIME 等竞赛。难度远高于 GSM8K,涉及代数、几何、数论、概率等多个分支[12]。
实际评测中常使用 MATH-500 子集(500 道精选题)。前沿模型在 MATH-500 上已达到 95%–98%,接近饱和。更前沿的对比已转向 AIME 2025/2026。
当前前沿数学推理的标准基准。题目来自美国数学邀请赛(AIME),需要多步骤符号推理和逻辑推演。每年更新,有效降低数据污染风险[13]。
截至 2026 年,前沿模型在 AIME 2025 上得分从 79% 到接近满分不等。GPT-5.3 Codex 约 94%,DeepSeek-R1 在 MATH-500 上达到 97.3%。AIME 已成为区分顶级推理模型的关键指标。
从 BIG-Bench(200+ 任务的众包测试集)中精选出 23 个最具挑战性的推理任务,共 6,511 道题。涵盖逻辑推理、数学应用题、社会理解和算法推理等。这些任务在发布时模型均未能超越人类[14]。
评测格式包括多选和自由生成。链式思维提示显著提升 BBH 表现。截至 2026 年,前沿模型在低 90% 区间,接近饱和但仍有一定区分度。
常识推理基准,要求模型为给定场景选择最合理的后续发展。包含约 10,000 道四选一题,通过对抗性过滤确保难度——每个错误选项都是看似合理但实际不正确的[15]。
截至 2026 年,前沿模型在 HellaSwag 上的准确率已接近 95%,基本饱和。它仍是 Open LLM Leaderboard v1 的核心组件之一。
由 Allen Institute for AI 发布的小学科学推理测试集。分为 ARC-Easy(5,197 题)和 ARC-Challenge(2,590 题),后者是经过过滤确保无法通过简单检索或统计模式匹配解决的难题[16]。
均为四选一选择题,评测准确率。截至 2026 年已饱和,前沿模型在 ARC-Challenge 上普遍超过 95%。
大规模常识推理和共指消解测试集,包含 44,000 道二选一题。每题给出一个带有歧义代词的句子,要求模型根据常识判断代词所指。通过对抗过滤确保高难度[17]。
截至 2026 年已饱和,前沿模型普遍在 90% 以上。
由领域 PhD 专家编写的研究生级科学问答测试集,覆盖生物、化学、物理。设计为"Google-proof"——即使有网络搜索权限,非 PhD 人类也仅约 34% 正确率。GPQA Diamond 子集(198 道最难题)是当前前沿推理能力的黄金标准[18]。
截至 2026 年 7 月,Gemini 3.1 Pro 以 94.1% 领跑 GPQA Diamond,Claude Opus 4.6 为 91.3%。虽已接近饱和,但仍是区分顶级推理模型的有效指标。
专门测试模型是否会输出"模仿性虚假陈述"(imitative falsehoods)——即模型因训练语料中频繁出现的错误信息而生成虚假内容。包含 817 道题,覆盖 38 个类别(健康、法律、金融、政治等)[19]。
支持两种评测模式:开放式生成(评估真实且信息丰富的比例)和多选题。原始研究中发现一个令人惊讶的逆向缩放现象——更大的模型往往更不真实。GPT-3-175B 仅 58% 真实率,而人类达 94%。
当前最具影响力的人类偏好对齐评估平台。采用匿名双模型对战模式——用户提问后同时收到两个匿名模型的回答,根据回答质量投票选择更优者。累计已收集 超过 200 万张投票,通过 Bradley-Terry 模型计算 Elo 等级分排名[20]。
截至 2026 年 3 月,Anthropic(1,503 Elo)、xAI(1,495)、Google(1,494)、OpenAI(1,481)占据 Arena 文本榜单第一梯队,四家差距已缩小到 25 Elo 分以内[2]。Arena 还提供 Arena-Hard(困难提示子榜)、编程子榜等细分排名。
创新功能 Prompt-to-Leaderboard(P2L)可根据用户输入的具体提示生成定制化排行榜,解决了全局排名无法反映特定任务表现的痛点。
由 Scale AI 发起的"人类终极考试",由全球各领域专家贡献 3,000+ 道极难题,覆盖所有学科。约 14% 的题目为多模态(文本 + 图像)。设计目标是在数年内保持对 AI 的挑战性[13]。
截至 2026 年,顶级模型在 HLE 上仅得分 25%–57%,远未饱和。前沿模型在一年内提升了 30 个百分点,但仍有巨大空间。
从 LeetCode、AtCoder 和 Codeforces 持续抽取模型训练截止日期之后发布的新题,从结构上防止数据污染。评估代码生成、自修复和测试输出预测[13]。
前沿模型在 LiveCodeBench 上得分在 70%–85% 区间,仍有区分度。与 SWE-bench 互补,前者测竞赛编程,后者测真实工程。
抽象推理测试集,要求模型从少量示例中归纳视觉-逻辑变换规律并应用到新场景。包含 400+ 道抽象推理题,测试模型在非语言领域的泛化推理能力[13]。
截至 2026 年,即使是最强模型也需要大量推理时计算才能达到约 85%,普通使用下仅约 60% 左右。ARC-AGI-2 被视为迈向 AGI 的关键测试之一。
以下表格汇总所有测试集的关键维度,便于快速对比和选型参考。
| 测试集 | 测试能力 | 数据规模 | 评测方式 | 难度等级 | 饱和状态 |
|---|---|---|---|---|---|
| MMLU | 多学科知识广度 | 15,908 题 | 四选一(5-shot) | 中等 | 已饱和 |
| MMLU-Pro | 知识 + 推理 | 12,000 题 | 十选一(CoT) | 较高 | 活跃 |
| C-Eval | 中文知识 + 推理 | 13,948 题 | 四选一(0/5-shot) | 中等 | 活跃 |
| CMMLU | 中文知识 + 文化 | 11,582 题 | 四选一(0/5-shot) | 中等 | 活跃 |
| HumanEval | 函数级代码生成 | 164 题 | 代码生成 + 测试 | 基础 | 已饱和 |
| MBPP | 基础编程 | 974 题 | 代码生成 + 测试 | 基础 | 已饱和 |
| SWE-bench | 真实软件工程 | 500 题 | 端到端 issue 修复 | 高 | 接近饱和 |
| GSM8K | 多步骤数学推理 | 8,500 题 | 生成式(提取答案) | 基础 | 已饱和 |
| MATH | 竞赛数学推理 | 12,500 题 | 生成式(匹配答案) | 高 | 接近饱和 |
| AIME | 高级数学推理 | 30 题/年 | 生成式(0-9 答案) | 极高 | 活跃 |
| BBH | 跨任务复杂推理 | 6,511 题 | 多选 + 自由生成 | 高 | 接近饱和 |
| HellaSwag | 常识推理 | 约 10,000 题 | 四选一 | 基础 | 已饱和 |
| ARC | 科学推理 | Easy 5,197 + Challenge 2,590 | 四选一 | 中等 | 已饱和 |
| WinoGrande | 常识 + 共指消解 | 44,000 题 | 二选一 | 基础 | 已饱和 |
| GPQA Diamond | PhD 级科学推理 | 198 题 | 四选一 | 极高 | 活跃 |
| TruthfulQA | 真实性 / 抗误导 | 817 题 | 生成式 + 多选 | 中等-高 | 活跃 |
| Chatbot Arena | 综合对话质量 | 200 万+ 投票 | 人类偏好 + Elo | 动态 | 活跃 |
| HLE | 前沿知识极限 | 3,000+ 题 | 生成式 / 多选 | 极高 | 活跃 |
| LiveCodeBench | 竞赛编程(抗污染) | 持续更新 | 代码生成 + 测试 | 高 | 活跃 |
| ARC-AGI-2 | 抽象推理 / 泛化 | 400+ 题 | 视觉推理生成 | 极高 | 活跃 |
从测试集选择到运行评测再到结果解读,一份面向开发者的实践手册。
选择测试集的第一原则是与应用场景匹配。以下决策框架可以帮助你快速定位:
参考 Chatbot Arena Elo 排名 + MMLU-Pro 知识广度。Arena 反映真实用户感受,MMLU-Pro 验证知识深度。
C-Eval + CMMLU 是必选项。如果面向中国用户,这两个测试集的权重应高于英文测试集。
HumanEval/MBPP 做基础检查,SWE-bench 评估真实工程能力,LiveCodeBench 确保抗污染。注意 SWE-bench 正在饱和。
GSM8K 做基线,AIME 和 MATH-500 测高阶推理。GPQA Diamond 评估科学推理深度。
TruthfulQA 评估抗误导能力。还可关注 AgentBench、SafetyBench 等安全专项测试。
经典测试集(MMLU、HellaSwag、ARC、GSM8K)仍有区分度。中小模型在这些测试集上的表现差异远大于前沿模型。
当前主流的 LLM 评测框架有两个:lm-evaluation-harness(EleutherAI 开发)和 OpenCompass(上海 AI Lab 开发)。前者是学术评测的事实标准,Hugging Face Open LLM Leaderboard 即基于它构建;后者由 Meta AI 官方推荐,支持 70+ 数据集和 20+ 模型[21]。
安装并运行一个基础评测只需几行命令:
# 安装 lm-evaluation-harness
pip install lm-eval
# 在 MMLU 上评测 HuggingFace 模型(5-shot)
lm_eval --model hf \
--model_args pretrained=meta-llama/Llama-3-8B-hf \
--tasks mmlu \
--num_fewshot 5 \
--batch_size auto
# 同时评测多个基准测试
lm_eval --model hf \
--model_args pretrained=Qwen/Qwen2.5-7B-Instruct \
--tasks mmlu,hellaswag,arc_challenge,truthfulqa,winogrande \
--num_fewshot 5 \
--output_path ./results/
# 评测 API 模型(如 OpenAI)
lm_eval --model local-completions \
--tasks gsm8k \
--model_args model=gpt-4o,base_url=https://api.openai.com/v1/completions,num_concurrent=1,token_in_query=False \
--apply_chat_template
# 安装 OpenCompass
git clone https://github.com/open-compass/opencompass.git
cd opencompass
pip install -e .
# 使用配置文件运行评测(以 C-Eval 为例)
python run.py --models hf_llama3_8b_instruct \
--datasets ceval \
--summary
# 自定义评测配置
python run.py --models hf_internlm2_chat7b \
--datasets mmlu,gsm8k,humaneval \
--summary-format txt \
--debug
对于通过 API 提供服务的模型(如 GPT-4o、Claude、Gemini),评测时需要额外注意:
--apply_chat_template 确保提示格式与模型训练一致选择题测试集(MMLU、ARC、HellaSwag)使用准确率(Accuracy),即答对题目比例。代码生成测试集使用 pass@k 指标——k 次生成中至少一次通过测试的概率。数学测试集通常提取最终数字答案进行精确匹配。Chatbot Arena 使用 Elo 等级分,通过胜率推算相对强弱。
在只有 164 道题的 HumanEval 上,1 分的差异在统计上几乎没有意义。建议关注置信区间而非单点分数。一个经验法则:在大多数测试集上,3% 以内的分数差异应视为统计噪声[1]。
解读分数时需要参考基准线:随机猜测的水平(如 MMLU 为 25%,四选一)、已发表模型的成绩、以及人类水平。例如 GPQA Diamond 上非 PhD 人类仅约 34%,意味着 60% 的分数已远超普通人类。
没有任何单一测试集能全面衡量模型能力。一个模型可能在 MMLU 上得分 90 却在 TruthfulQA 上表现糟糕。建议至少覆盖知识(MMLU-Pro)、推理(BBH/GPQA)、代码(HumanEval/SWE-bench)、数学(GSM8K/AIME)和人类偏好(Arena)五个维度。
在测试集通胀的时代,如何理性选型和评测。
大模型测试集生态正在经历一场深刻的范式转换。经典测试集(MMLU、HumanEval、GSM8K)在 2020-2023 年间定义了 LLM 评测的标准,但它们正在集体饱和——前沿模型的分数聚集在 88%–99% 的狭窄区间,已无法有效区分顶级模型。与此同时,新一代测试集(MMLU-Pro、GPQA Diamond、HLE、AIME、SWE-bench、ARC-AGI-2)正在接过接力棒,为模型进步提供持续的衡量标尺[2]。
对开发者而言,核心建议是按场景选型、多维度评估、动态追踪:
在 AI 能力飞速迭代的今天,评测体系本身也在进化。保持对测试集饱和状态和新兴基准的关注,是每个 LLM 开发者的必修课。希望本文能为你在大模型评测的迷宫中提供一份可信赖的导航图。