AI惊叹号

大模型测试集对比指南

常用 LLM Benchmark 全景解析与开发者实践手册 —— 从 MMLU 到 Chatbot Arena,一文读懂评测体系

2026 年 8 月更新 覆盖 17+ 主流测试集 含开发者实战指南

01引言

大模型测试集(Benchmark)是衡量语言模型能力的标尺,也是模型迭代的方向指南。

大语言模型(LLM)的飞速发展催生了大量评测工具和测试集。一个测试集本质上是一组标准化的题目加上评分规则,用来量化模型在特定能力维度上的表现。就如同学生需要考试来衡量学习成果,大模型也需要测试集来评估其知识广度、推理能力、代码水平和安全性等方面的表现。

测试集的重要性体现在三个方面:第一,它提供了横向可比性——不同团队开发的模型可以在同一套题目上公平比较;第二,它提供了纵向追踪能力——通过观察同一测试集上的分数变化,可以追踪模型迭代带来的进步;第三,它为开发者选型提供了量化参考——根据自身应用场景选择在相关测试集上表现优异的模型[1]

然而,2026 年的 LLM 评测面临一个前所未有的挑战:基准饱和。斯坦福 AI Index 2026 报告指出,MMLU、HumanEval、GSM8K 等经典测试集上的前沿模型分数已经高度聚集在 88%–99% 的狭窄区间,2%–3% 的分数差异已落入测量噪声范围[2]。这意味着传统测试集正在丧失区分前沿模型的能力,新一代测试集(如 MMLU-Pro、GPQA Diamond、HLE)正在接过接力棒。

核心认知
没有"最好的"测试集,只有"最适合你场景"的测试集。一个模型可以在 MMLU 上拿 95 分却在真实对话中表现平庸,也可以在 Chatbot Arena 上排名靠前却在数学推理中频频出错。选择与你的应用场景匹配的测试集,比追求高分本身更重要。

02常用测试集详解

以下按能力维度分组,逐一解析当前主流的大模型测试集。

知识理解与语言能力

MMLU 2020

Massive Multitask Language Understanding
已饱和

由加州大学伯克利分校 Dan Hendrycks 团队发布,覆盖 57 个学科(涵盖 STEM、人文、社科、法律、医学等),从高中水平到专业级职业资格考试,共计 15,908 道四选一选择题。采用 5-shot 少样本设置,指标为平均准确率[3]

随机猜测得分为 25%,GPT-4 达到 86.4%,人类专家约 90%。截至 2026 年,前沿模型已普遍超过 90%,MMLU 已无法有效区分顶级模型。

数据规模15,908 题
评测方式四选一选择题(5-shot)
测试能力多学科知识广度
难度等级中等
适用场景:评估模型跨学科知识储备,适合作为基础能力地板线检查。如需区分前沿模型,建议使用 MMLU-Pro。

MMLU-Pro 2024

MMLU Professional
活跃

MMLU 的升级版,将选项从 4 个扩展到 10 个,大幅降低猜中概率(随机 10%),并增加了推理导向的题目。覆盖 14 个领域,共 12,000 道题,要求链式思维(CoT)推理[4]

截至 2026 年 7 月,前沿模型在 MMLU-Pro 上的得分聚集在 89%–91% 区间,Claude Fable 5 以 91.5% 领先,仍是区分前沿模型的有效测试集之一。

数据规模12,000 题
评测方式十选一选择题(CoT)
测试能力知识 + 推理
难度等级较高
适用场景:前沿模型知识能力对比,比 MMLU 更能拉开差距。推荐用于学术研究和模型选型。

C-Eval 2023

Chinese Evaluation Suite
活跃

由清华、上交等团队联合发布的首个综合性中文评测基准,覆盖 52 个学科,包含中学、高中、大学和专业四个难度级别,共 13,948 道四选一选择题。其中 C-Eval Hard 子集选取 8 个高难度数理化科目,专门考验复杂推理[5]

2025 年 7 月已公开完整测试集。当前 Qwen3.6 Plus 以 93.3% 领跑 C-Eval 榜单。C-Eval 已被集成进 lm-evaluation-harness 生态。

数据规模13,948 题
评测方式四选一选择题(0/5-shot)
测试能力中文知识 + 推理
难度等级中等
适用场景:中文应用场景下的模型选型,特别是面向中国用户的产品。评估中文语境理解能力的首选。

CMMLU 2023

Chinese Massive Multitask Language Understanding
活跃

另一重要的中文评测基准,覆盖 67 个学科(包括中国历史、中国文学、公务员考试等中国特色主题),共 11,582 道题。与 C-Eval 互补,CMMLU 更侧重中国文化与社会知识[6]

默认 0-shot 评测,也支持 5-shot。使用中文 CoT 提示模板,结果可按学科或大类聚合统计。

数据规模11,582 题
评测方式四选一选择题(0/5-shot)
测试能力中文知识 + 文化
难度等级中等
适用场景:评估模型对中国文化、历史和社会知识的理解,适合面向中文用户的对话和知识问答产品。
代码生成与软件工程

HumanEval 2021

Hand-Written Evaluation Set
已饱和

由 OpenAI 发布,包含 164 个 Python 编程问题。每题给出函数签名和 docstring,要求模型生成符合规范的 Python 代码,通过单元测试判定正确性。核心指标为 pass@1(一次生成通过率)[7]

Codex 初代仅 28.8%,GPT-4 达到 67%。截至 2026 年,前沿模型已超过 93%,HumanEval 基本饱和,仅适合作为代码能力的基础检查。

数据规模164 题
评测方式代码生成 + 单元测试
测试能力函数级代码生成
难度等级基础
适用场景:快速评估基础代码生成能力。前沿模型对比建议使用 LiveCodeBench 或 SWE-bench。

MBPP 2021

Mostly Basic Programming Problems
已饱和

由 Google 发布,包含 974 个基础 Python 编程任务,涵盖基础算法、数学运算和标准库使用。同样使用执行测试评估,指标为 pass@1[8]

与 HumanEval 互补——HumanEval 侧重函数级实现,MBPP 覆盖更广泛的基础编程场景。两者均已饱和,前沿模型得分普遍在 90% 以上。

数据规模974 题
评测方式代码生成 + 单元测试
测试能力基础编程能力
难度等级基础
适用场景:入门级编程能力评估,适合评估小型开源模型的基础编码水平。

SWE-bench 2024

Software Engineering Benchmark
接近饱和

当前最重要的真实世界编码评测基准。从真实 GitHub Python 仓库中提取 500 个已验证的 issue,要求模型端到端解决——理解问题、定位代码、编写补丁、通过测试。这远比函数级代码生成更接近真实软件工程[9]

2023 年发布时最强模型仅 3% 解决率。截至 2026 年中,拥堵分数已达 93.9%,OpenAI 宣布弃用此基准。但 METR 审查发现约 50% 的"通过"PR 实际不会被真实项目维护者合并,暴露了验证器噪声问题[10]

数据规模500 题(Verified)
评测方式端到端 issue 修复
测试能力真实软件工程
难度等级
适用场景:评估 AI 编程助手在真实工程中的表现。注意其饱和趋势,建议结合 LiveCodeBench 使用。
数学推理

GSM8K 2021

Grade School Math 8K
已饱和

由 OpenAI 发布,包含 8,500 道小学数学应用题,需要多步骤逻辑推演和基础算术运算。采用自由文本生成,提取数字答案进行评分。支持直接生成和链式思维(CoT)两种模式[11]

GPT-3(175B)仅 17%,GPT-4 达到 92%。截至 2026 年,前沿模型已普遍超过 95%,Kimi K2 Instruct 以 97.3% 领跑。GSM8K 已基本饱和。

数据规模8,500 题
评测方式生成式(提取数字答案)
测试能力多步骤数学推理
难度等级基础
适用场景:基础数学推理能力评估。前沿模型对比建议使用 AIME 或 MATH-500。

MATH 2021

Competition Mathematics
接近饱和

由 UC Berkeley 发布,包含 12,500 道竞赛数学题,来源于 AMC 10、AMC 12 和 AIME 等竞赛。难度远高于 GSM8K,涉及代数、几何、数论、概率等多个分支[12]

实际评测中常使用 MATH-500 子集(500 道精选题)。前沿模型在 MATH-500 上已达到 95%–98%,接近饱和。更前沿的对比已转向 AIME 2025/2026。

数据规模12,500 题(评测用 500 子集)
评测方式生成式(匹配最终答案)
测试能力竞赛数学推理
难度等级
适用场景:中高水平数学能力对比。评估模型的符号推理和数学证明能力。

AIME 2025

American Invitational Mathematics Examination
活跃

当前前沿数学推理的标准基准。题目来自美国数学邀请赛(AIME),需要多步骤符号推理和逻辑推演。每年更新,有效降低数据污染风险[13]

截至 2026 年,前沿模型在 AIME 2025 上得分从 79% 到接近满分不等。GPT-5.3 Codex 约 94%,DeepSeek-R1 在 MATH-500 上达到 97.3%。AIME 已成为区分顶级推理模型的关键指标。

数据规模30 题/年
评测方式生成式(0-9 整数答案)
测试能力高级数学推理
难度等级极高
适用场景:前沿推理模型对比,特别是评估 o1/R1 类思维链模型的深度推理能力。
复杂推理与常识

BBH 2022

BIG-Bench Hard
接近饱和

从 BIG-Bench(200+ 任务的众包测试集)中精选出 23 个最具挑战性的推理任务,共 6,511 道题。涵盖逻辑推理、数学应用题、社会理解和算法推理等。这些任务在发布时模型均未能超越人类[14]

评测格式包括多选和自由生成。链式思维提示显著提升 BBH 表现。截至 2026 年,前沿模型在低 90% 区间,接近饱和但仍有一定区分度。

数据规模6,511 题(23 个任务)
评测方式多选 + 自由生成
测试能力跨任务复杂推理
难度等级
适用场景:评估模型的跨任务泛化和复杂推理能力,适合研究型评估。

HellaSwag 2019

Harder Last Letter with Story Continuation
已饱和

常识推理基准,要求模型为给定场景选择最合理的后续发展。包含约 10,000 道四选一题,通过对抗性过滤确保难度——每个错误选项都是看似合理但实际不正确的[15]

截至 2026 年,前沿模型在 HellaSwag 上的准确率已接近 95%,基本饱和。它仍是 Open LLM Leaderboard v1 的核心组件之一。

数据规模约 10,000 题
评测方式四选一选择题
测试能力常识推理
难度等级基础
适用场景:基础常识推理能力检查。适合评估开源中小模型的常识理解水平。

ARC 2018

AI2 Reasoning Challenge
已饱和

由 Allen Institute for AI 发布的小学科学推理测试集。分为 ARC-Easy(5,197 题)和 ARC-Challenge(2,590 题),后者是经过过滤确保无法通过简单检索或统计模式匹配解决的难题[16]

均为四选一选择题,评测准确率。截至 2026 年已饱和,前沿模型在 ARC-Challenge 上普遍超过 95%。

数据规模Easy 5,197 + Challenge 2,590
评测方式四选一选择题
测试能力科学推理
难度等级基础-中等
适用场景:小学科学知识推理的基础评估。常与 HellaSwag、WinoGrande 一起作为综合推理能力底座。

WinoGrande 2020

Winograd Schema Challenge Large
已饱和

大规模常识推理和共指消解测试集,包含 44,000 道二选一题。每题给出一个带有歧义代词的句子,要求模型根据常识判断代词所指。通过对抗过滤确保高难度[17]

截至 2026 年已饱和,前沿模型普遍在 90% 以上。

数据规模44,000 题
评测方式二选一选择题
测试能力常识 + 共指消解
难度等级基础
适用场景:评估常识和上下文消解能力,适合作为综合评测套件的一部分。
专家级推理与真实性

GPQA 2023

Graduate-Level Google-Proof Q&A
活跃

由领域 PhD 专家编写的研究生级科学问答测试集,覆盖生物、化学、物理。设计为"Google-proof"——即使有网络搜索权限,非 PhD 人类也仅约 34% 正确率。GPQA Diamond 子集(198 道最难题)是当前前沿推理能力的黄金标准[18]

截至 2026 年 7 月,Gemini 3.1 Pro 以 94.1% 领跑 GPQA Diamond,Claude Opus 4.6 为 91.3%。虽已接近饱和,但仍是区分顶级推理模型的有效指标。

数据规模198 题(Diamond 子集)
评测方式四选一选择题
测试能力PhD 级科学推理
难度等级极高
适用场景:前沿模型深度推理能力对比。评估模型在专业科学领域的理解深度。

TruthfulQA 2021

Truthful Question Answering
活跃

专门测试模型是否会输出"模仿性虚假陈述"(imitative falsehoods)——即模型因训练语料中频繁出现的错误信息而生成虚假内容。包含 817 道题,覆盖 38 个类别(健康、法律、金融、政治等)[19]

支持两种评测模式:开放式生成(评估真实且信息丰富的比例)和多选题。原始研究中发现一个令人惊讶的逆向缩放现象——更大的模型往往更不真实。GPT-3-175B 仅 58% 真实率,而人类达 94%。

数据规模817 题(38 类别)
评测方式生成式 + 多选
测试能力真实性 / 抗误导
难度等级中等-高
适用场景:评估模型安全性和可靠性,特别是面向用户的产品中避免传播错误信息的能力。
人类偏好对齐评估

LMSYS Chatbot Arena 2023

Large Model Systems Organization Arena
活跃

当前最具影响力的人类偏好对齐评估平台。采用匿名双模型对战模式——用户提问后同时收到两个匿名模型的回答,根据回答质量投票选择更优者。累计已收集 超过 200 万张投票,通过 Bradley-Terry 模型计算 Elo 等级分排名[20]

截至 2026 年 3 月,Anthropic(1,503 Elo)、xAI(1,495)、Google(1,494)、OpenAI(1,481)占据 Arena 文本榜单第一梯队,四家差距已缩小到 25 Elo 分以内[2]。Arena 还提供 Arena-Hard(困难提示子榜)、编程子榜等细分排名。

创新功能 Prompt-to-Leaderboard(P2L)可根据用户输入的具体提示生成定制化排行榜,解决了全局排名无法反映特定任务表现的痛点。

数据规模200 万+ 投票
评测方式人类偏好 + Elo 评分
测试能力综合对话质量
难度等级动态
适用场景:评估模型在真实用户交互中的表现。选型时强烈建议参考 Arena 排名,它比静态测试集更能反映实际使用体验。
新兴前沿测试集(2025-2026)
为什么需要新测试集?
当经典测试集集体饱和后,新一代测试集正在接过接力棒。这些测试集的设计目标是在数年内保持挑战性,为模型进步提供持续的衡量标尺。

HLE 2025

Humanity's Last Exam
活跃

由 Scale AI 发起的"人类终极考试",由全球各领域专家贡献 3,000+ 道极难题,覆盖所有学科。约 14% 的题目为多模态(文本 + 图像)。设计目标是在数年内保持对 AI 的挑战性[13]

截至 2026 年,顶级模型在 HLE 上仅得分 25%–57%,远未饱和。前沿模型在一年内提升了 30 个百分点,但仍有巨大空间。

数据规模3,000+ 题
评测方式生成式 / 多选
测试能力前沿知识极限
难度等级极高

LiveCodeBench 2024

Live Competitive Programming
活跃

从 LeetCode、AtCoder 和 Codeforces 持续抽取模型训练截止日期之后发布的新题,从结构上防止数据污染。评估代码生成、自修复和测试输出预测[13]

前沿模型在 LiveCodeBench 上得分在 70%–85% 区间,仍有区分度。与 SWE-bench 互补,前者测竞赛编程,后者测真实工程。

数据规模持续更新
评测方式代码生成 + 测试
测试能力竞赛编程(抗污染)
难度等级

ARC-AGI-2 2025

Abstraction and Reasoning Corpus for AGI v2
活跃

抽象推理测试集,要求模型从少量示例中归纳视觉-逻辑变换规律并应用到新场景。包含 400+ 道抽象推理题,测试模型在非语言领域的泛化推理能力[13]

截至 2026 年,即使是最强模型也需要大量推理时计算才能达到约 85%,普通使用下仅约 60% 左右。ARC-AGI-2 被视为迈向 AGI 的关键测试之一。

数据规模400+ 题
评测方式视觉推理生成
测试能力抽象推理 / 泛化
难度等级极高
图 1:主要测试集前沿模型得分与饱和状态
展示了各测试集上前沿模型的代表性最高得分(截至 2026 年 7 月),颜色编码反映饱和程度。

03对比总表

以下表格汇总所有测试集的关键维度,便于快速对比和选型参考。

测试集 测试能力 数据规模 评测方式 难度等级 饱和状态
MMLU 多学科知识广度 15,908 题 四选一(5-shot) 中等 已饱和
MMLU-Pro 知识 + 推理 12,000 题 十选一(CoT) 较高 活跃
C-Eval 中文知识 + 推理 13,948 题 四选一(0/5-shot) 中等 活跃
CMMLU 中文知识 + 文化 11,582 题 四选一(0/5-shot) 中等 活跃
HumanEval 函数级代码生成 164 题 代码生成 + 测试 基础 已饱和
MBPP 基础编程 974 题 代码生成 + 测试 基础 已饱和
SWE-bench 真实软件工程 500 题 端到端 issue 修复 接近饱和
GSM8K 多步骤数学推理 8,500 题 生成式(提取答案) 基础 已饱和
MATH 竞赛数学推理 12,500 题 生成式(匹配答案) 接近饱和
AIME 高级数学推理 30 题/年 生成式(0-9 答案) 极高 活跃
BBH 跨任务复杂推理 6,511 题 多选 + 自由生成 接近饱和
HellaSwag 常识推理 约 10,000 题 四选一 基础 已饱和
ARC 科学推理 Easy 5,197 + Challenge 2,590 四选一 中等 已饱和
WinoGrande 常识 + 共指消解 44,000 题 二选一 基础 已饱和
GPQA Diamond PhD 级科学推理 198 题 四选一 极高 活跃
TruthfulQA 真实性 / 抗误导 817 题 生成式 + 多选 中等-高 活跃
Chatbot Arena 综合对话质量 200 万+ 投票 人类偏好 + Elo 动态 活跃
HLE 前沿知识极限 3,000+ 题 生成式 / 多选 极高 活跃
LiveCodeBench 竞赛编程(抗污染) 持续更新 代码生成 + 测试 活跃
ARC-AGI-2 抽象推理 / 泛化 400+ 题 视觉推理生成 极高 活跃
饱和状态说明
已饱和:前沿模型得分聚集在 90%+,区分度极低。仍适合作为基础能力地板线检查。
接近饱和:前沿模型得分在 70%–90% 区间,区分度正在收窄但仍有参考价值。
活跃:前沿模型得分低于 90% 或评测方式动态变化,仍是有效的区分指标。

04开发者使用指南

从测试集选择到运行评测再到结果解读,一份面向开发者的实践手册。

如何选择合适的测试集

选择测试集的第一原则是与应用场景匹配。以下决策框架可以帮助你快速定位:

通用对话 / 问答

参考 Chatbot Arena Elo 排名 + MMLU-Pro 知识广度。Arena 反映真实用户感受,MMLU-Pro 验证知识深度。

中文应用

C-Eval + CMMLU 是必选项。如果面向中国用户,这两个测试集的权重应高于英文测试集。

代码 / 编程助手

HumanEval/MBPP 做基础检查,SWE-bench 评估真实工程能力,LiveCodeBench 确保抗污染。注意 SWE-bench 正在饱和。

数学 / 推理

GSM8K 做基线,AIME 和 MATH-500 测高阶推理。GPQA Diamond 评估科学推理深度。

安全 / 可靠性

TruthfulQA 评估抗误导能力。还可关注 AgentBench、SafetyBench 等安全专项测试。

中小型模型选型

经典测试集(MMLU、HellaSwag、ARC、GSM8K)仍有区分度。中小模型在这些测试集上的表现差异远大于前沿模型。

如何运行测试 工具与流程

当前主流的 LLM 评测框架有两个:lm-evaluation-harness(EleutherAI 开发)和 OpenCompass(上海 AI Lab 开发)。前者是学术评测的事实标准,Hugging Face Open LLM Leaderboard 即基于它构建;后者由 Meta AI 官方推荐,支持 70+ 数据集和 20+ 模型[21]

lm-evaluation-harness vs OpenCompass
lm-evaluation-harness:学术标准,支持 60+ 基准测试,模型接口最简洁(generate_until / loglikelihood),适合需要可直接对比论文数据的场景。
OpenCompass(司南):一站式平台,支持分布式推理和实时排行榜,中文测试集支持更全面,适合中文模型和团队级评测。

使用 lm-evaluation-harness 运行评测

安装并运行一个基础评测只需几行命令:

# 安装 lm-evaluation-harness
pip install lm-eval

# 在 MMLU 上评测 HuggingFace 模型(5-shot)
lm_eval --model hf \
  --model_args pretrained=meta-llama/Llama-3-8B-hf \
  --tasks mmlu \
  --num_fewshot 5 \
  --batch_size auto

# 同时评测多个基准测试
lm_eval --model hf \
  --model_args pretrained=Qwen/Qwen2.5-7B-Instruct \
  --tasks mmlu,hellaswag,arc_challenge,truthfulqa,winogrande \
  --num_fewshot 5 \
  --output_path ./results/

# 评测 API 模型(如 OpenAI)
lm_eval --model local-completions \
  --tasks gsm8k \
  --model_args model=gpt-4o,base_url=https://api.openai.com/v1/completions,num_concurrent=1,token_in_query=False \
  --apply_chat_template

使用 OpenCompass 运行评测

# 安装 OpenCompass
git clone https://github.com/open-compass/opencompass.git
cd opencompass
pip install -e .

# 使用配置文件运行评测(以 C-Eval 为例)
python run.py --models hf_llama3_8b_instruct \
  --datasets ceval \
  --summary

# 自定义评测配置
python run.py --models hf_internlm2_chat7b \
  --datasets mmlu,gsm8k,humaneval \
  --summary-format txt \
  --debug

评测 API 模型的注意事项

对于通过 API 提供服务的模型(如 GPT-4o、Claude、Gemini),评测时需要额外注意:

如何解读结果 关键指标

理解评分指标

选择题测试集(MMLU、ARC、HellaSwag)使用准确率(Accuracy),即答对题目比例。代码生成测试集使用 pass@k 指标——k 次生成中至少一次通过测试的概率。数学测试集通常提取最终数字答案进行精确匹配。Chatbot Arena 使用 Elo 等级分,通过胜率推算相对强弱。

关注统计显著性

在只有 164 道题的 HumanEval 上,1 分的差异在统计上几乎没有意义。建议关注置信区间而非单点分数。一个经验法则:在大多数测试集上,3% 以内的分数差异应视为统计噪声[1]

对比基准线

解读分数时需要参考基准线:随机猜测的水平(如 MMLU 为 25%,四选一)、已发表模型的成绩、以及人类水平。例如 GPQA Diamond 上非 PhD 人类仅约 34%,意味着 60% 的分数已远超普通人类。

综合多维度评估

没有任何单一测试集能全面衡量模型能力。一个模型可能在 MMLU 上得分 90 却在 TruthfulQA 上表现糟糕。建议至少覆盖知识(MMLU-Pro)、推理(BBH/GPQA)、代码(HumanEval/SWE-bench)、数学(GSM8K/AIME)和人类偏好(Arena)五个维度。

注意事项 数据污染与过拟合

数据污染(Data Contamination)
测试集题目可能已进入模型训练语料。OpenAI 发现 SWE-bench 的题目和答案已进入训练数据——每个前沿模型都能逐字复现金标准补丁。这意味着分数测量的不再是能力而是记忆容量[10]。应对策略:优先使用动态更新测试集(如 AIME、LiveCodeBench),或在评测前对测试集进行污染检测。
过拟合与刷榜
模型可能在特定测试集上过度优化(teaching to the test)。一个典型表现是:模型在 MMLU 上得分 90,但在真实的开放式问答中表现平庸。研究显示企业 AI 代理在实验室基准与实际部署之间的性能差距高达 37%[1]。应对策略:结合静态测试集和动态人类评估(Chatbot Arena),避免仅依赖单一分数做决策。
评测框架差异
不同的评测框架即使使用相同的测试集和模型,也可能因为提示模板、答案提取逻辑和标准化方式的细微差异而产生不同分数。确保与你对比的基线使用同一框架版本和相同配置。建议将 YAML 配置文件与模型检查点一同版本管理,确保结果可复现[22]
最佳实践
1. 建立自有评测集:基于你的真实业务场景构建小规模私有测试集,这是最直接的选型依据。
2. 定期重跑:模型 API 更新后定期重跑相同测试集,追踪能力变化。
3. 关注趋势而非单点:一个测试集上的单次分数意义有限,关注多个测试集上的综合趋势。
4. 参考人类评估:静态测试集之外,始终关注 Chatbot Arena Elo 排名作为真实使用体验的补充。

05总结与建议

在测试集通胀的时代,如何理性选型和评测。

大模型测试集生态正在经历一场深刻的范式转换。经典测试集(MMLU、HumanEval、GSM8K)在 2020-2023 年间定义了 LLM 评测的标准,但它们正在集体饱和——前沿模型的分数聚集在 88%–99% 的狭窄区间,已无法有效区分顶级模型。与此同时,新一代测试集(MMLU-Pro、GPQA Diamond、HLE、AIME、SWE-bench、ARC-AGI-2)正在接过接力棒,为模型进步提供持续的衡量标尺[2]

对开发者而言,核心建议是按场景选型、多维度评估、动态追踪

终极建议
测试集分数是选型的起点而非终点。在你的真实业务数据上跑一个小规模 A/B 测试,永远比任何排行榜分数更有说服力。测试集告诉你模型"能做什么",但只有你的用户能告诉你模型"做得好不好"。

在 AI 能力飞速迭代的今天,评测体系本身也在进化。保持对测试集饱和状态和新兴基准的关注,是每个 LLM 开发者的必修课。希望本文能为你在大模型评测的迷宫中提供一份可信赖的导航图。