在第 1 章中,我们讨论过大模型的能力边界——生成、理解、推理、工具调用与多模态。但“能力强”是一种主观感受,落到研发与采购环节,你需要一把可量化、可复现的尺子。通用能力评测基准(Benchmark)就是这把尺子。
然而,尺子本身也有刻度偏差。本节不仅介绍主流基准“测什么”,更重要的是告诉你分数背后的真实含义、常见陷阱,以及如何在选型时正确看待这些数字。这是避免被技术报告上的“刷榜分数”忽悠的必修课。
一、MMLU(Massive Multitask Language Understanding):知识广度的“高考全科卷”
测什么:覆盖 57 个学科(数学、物理、化学、生物、计算机、法律、医学、哲学、历史等)的多选题,共约 1.6 万题,难度从初中到大学专业水平不等。
怎么测:通常采用零样本(Zero-shot)或 5-shot(给 5 个示例)设置,要求模型从 A/B/C/D 四个选项中选出正确答案。它考察的是模型对世界知识的记忆、理解与初步推理能力。
分数解读(行业粗粒度参考):
| 分数区间 | 能力定位 | 代表水平 |
|---------|---------|---------|
| 40%–50% | 入门基座 | 随机猜测约 25%,此区间表示具备基础常识 |
| 60%–70% | 中等水平 | 约等于受过良好教育的高中毕业生知识广度 |
| 70%–80% | 优秀水平 | 接近大学本科生跨学科知识水平(如 Llama 3 70B、GPT-3.5 区间) |
| 85%+ | 顶尖水平 | 专业级知识广度(GPT-4、Claude 3.5 Sonnet、Qwen2-72B 等) |
实用认知与陷阱:
- 选择题的局限:MMLU 只测“认知识别”,不测“知识生成”。模型可能选对答案,但无法写出一篇连贯的学科论文。
- 数据污染(Data Contamination):由于训练语料极广,部分测试题可能已混入预训练数据。开源模型分数突然暴涨时,需警惕是否过拟合了测试集。
- 对中文模型不公平:MMLU 原文为英文,虽然业界常做翻译版,但语言转换会引入噪音。评估中文模型时,必须结合 CEval 一起看。
二、GSM8K(Grade School Math 8K):数学推理的“验金石”
测什么:约 8,500 道小学数学应用题,需要通过多步算术推理才能得出答案。例如:“小明有 5 个苹果,给了小红 2 个,又买了 3 个,现在有几个?”(实际题目更复杂,通常需 2–8 步推理)。
怎么测:标准做法是要求模型输出思维链(Chain-of-Thought, CoT),即“先列算式/推理过程,再给出最终数字”。评分只看最终答案是否正确。
分数解读:
| 分数区间 | 能力定位 |
|---------|---------|
| < 50% | 基础水平,多步推理不稳定,常出现中间步骤计算错误 |
| 60%–75% | 良好,具备基本数学逻辑,但复杂题易中途跑偏 |
| 80%–90% | 优秀,能稳定执行多步算术与逻辑(如 GPT-4、Kimi 等) |
| 90%+ | 顶尖,接近人类小学生上限,但仍有顽固错题 |
实用认知与陷阱:
- 小学题 ≠ 简单:对 LLM 而言,GSM8K 的难点不在数学知识深度,而在语言理解→问题建模→多步符号推理→结果收敛的完整链路。很多大模型在 MMLU 数学子集上分数很高,却在 GSM8K 上翻车,正是因为后者考察“动态推理链”而非“静态知识”。
- CoT 依赖性:如果 prompt 里不加“逐步思考”,顶尖模型的分数也可能暴跌 20–30 个百分点。这印证了 1.3 节所述的“推理能力需要显式引导”。
- 只是小学水平:GSM8K 高分不代表模型能搞定高中竞赛或大学微积分。更高阶的数学能力需要看 MATH 基准(高中竞赛难度,目前顶尖模型仅 60% 左右)。
三、HumanEval:代码生成的“动手考试”
测什么:由 OpenAI 于 2021 年发布的 164 道手写 Python 编程题,每题包含函数签名、文档字符串(Docstring)和若干隐藏测试用例。模型需要根据注释要求补全函数体。
怎么测:使用 pass@k 指标。即给模型 k 次生成机会,只要有一次能通过所有隐藏测试用例,就视为该题通过。业界通常报告 pass@1(一次生成即通过)和 pass@10。
分数解读:
| pass@1 分数 | 能力定位 |
|------------|---------|
| < 30% | 基础水平,能写简单脚本,但边界条件处理差 |
| 50%–70% | 良好,可胜任常见算法题和工具函数编写 |
| 70%+ | 优秀,接近或达到初级软件工程师的函数级编码能力 |
| 85%+ | 顶尖(如 GPT-4o、Claude 3.5 Sonnet),能处理复杂逻辑与数据结构 |
实用认知与陷阱:
- 样本量太小:164 道题对于评估“通用编程能力”来说极其有限,且全是 Python 函数级短代码。它测不出模型在大型项目架构、跨文件调试、业务需求理解上的真实水平。
- 与实际开发的鸿沟:HumanEval 高分模型在真实业务中仍可能写出“无法维护的胶水代码”或调用不存在的 API。评估工程价值时,需结合实际代码库做 MBPP(Mostly Basic Python Programming)或自建代码评测集。
- 数据泄露重灾区:由于题目公开早,大量代码模型在预训练时可能已“见过”这些题。看到某开源模型 HumanEval 突然接近 GPT-4,先问一句“是否做过针对性微调”。
四、CEval:中文世界的“MMLU”
测什么:由上海交通大学等机构构建的 中文高级知识推理基准,覆盖 52 个学科(初高中到大学专业),约 1.4 万道选择题,包括语文、数学、物理、历史、法学、医学、电气工程等中国特色学科体系。
怎么测:与 MMLU 类似,通常采用 5-shot 或零样本设置。它是目前评估中文基座模型母语知识储备与文化语境理解最权威的公开基准之一。
分数解读:
| 分数区间 | 能力定位 |
|---------|---------|
| 50%–60% | 中文通识水平,具备基础中文知识 |
| 60%–70% | 良好,能应对一般性中文问答与考试 |
| 70%+ | 优秀,跨学科中文知识扎实(如 Qwen2-72B、文心一言 4.0 等) |
| 85%+ | 顶尖,接近或超过人类考生平均水平 |
实用认知与陷阱:
- 中文 ≠ 翻译:CEval 的优势在于题目原生中文,避免了 MMLU 翻译版中的文化概念漂移(如美国历史 vs. 中国历史、普通法 vs. 大陆法)。
- 依然是选择题:和 MMLU 一样,它测的是“知识广度”,而非中文写作、古诗词创作或复杂长文本理解。一个 CEval 高分的模型,写出的公文可能依然充满“AI 味”。
- 国内刷榜焦点:由于国内模型发布会几乎必报 CEval,部分厂商会针对该基准做定向指令微调,导致分数虚高。建议结合 CMMLU(更大规模中文多任务基准)和实际业务测试交叉验证。
五、其他关键基准速览
| 基准 | 测什么 | 实用看点 |
|------|--------|----------|
| HellaSwag | 常识推理与句子补全 | 考察模型对世界物理因果的常识(如“倒水的下一步是什么”)。分数低说明模型“不懂生活常识”。 |
| ARC(AI2 Reasoning Challenge) | 科学考试题 | 分 Easy 和 Challenge 两档,Challenge 需要多步科学推理。是 MMLU 之外很好的科学能力补充。 |
| BBH(Big-Bench Hard) | 复杂多步任务 | 从 Google 的 Big-Bench 中筛选出的 23 项人类觉得难的任务。7B 小模型通常只能得 30–40 分,是检验涌现能力的重要指标。 |
| MATH | 高中竞赛级数学 | 5 个难度等级。目前顶尖模型(GPT-4o)约 70–80%,开源模型多在 40–60%。是 GSM8K 之上的“高阶数学分水岭”。 |
| MBPP | 基础 Python 编程 | 比 HumanEval 更接近真实编程教学场景,可辅助评估代码模型的通用性。 |
六、如何正确看待基准分数:四个实用原则
原则 1:看“全科平均分”,而非“单科状元”
某个模型可能在 HumanEval 上特别高,但 MMLU 很低——这往往意味着它是一个代码特化模型,而非通用助手。选型时应先看能力雷达图是否均衡,再看是否有你业务需要的单项长板。
原则 2:区分“基座模型分数”与“对话模型分数”
技术报告里的分数通常来自基座模型(Base)或经过 SFT/RLHF 的对话模型(Chat/Instruct)。同一基座,经过对齐后,GSM8K 和 HumanEval 分数往往还会再涨 5–15 个百分点。如果你要采购 API,应该看 Chat 版的分数;如果你要在下游做微调,基座版的分数更有参考价值。
原则 3:警惕“评测即训练”(Benchmark Hacking)
当模型在某个基准上的分数突然远超同体量竞品,要追问三个问题:
- 预训练数据是否混入了测试题?(数据污染)
- 是否做了针对该基准的强化微调?(过拟合)
- 评测脚本是否使用了更大的 k 值或更宽松的 prompt?(评测口径不一致)
原则 4:基准高分 ≠ 产品好用
这是最关键的一条。MMLU 90 分的模型,在客服场景中可能因为幻觉(2.4 节)而乱给退换货政策;GSM8K 80 分的模型,在面对带有行业黑话的实际业务报表时可能完全失效。基准是必要条件,不是充分条件。
七、开发者选型速查表
| 你的场景 | 优先关注基准 | 次要参考 | 务必补充 |
|---------|------------|---------|---------|
| 通用对话/问答助手 | MMLU、CEval | BBH、HellaSwag | 自建开放式问答人工评估 |
| 教育辅导(数学) | GSM8K、MATH | — | 真实学生错题本的解题步骤评估 |
| 代码助手/Copilot | HumanEval、MBPP | — | 真实代码库跨文件补全测试 |
| 中文知识密集型应用 | CEval、CMMLU | MMLU(翻译版) | 行业垂直知识库问答测试 |
| 科学研究/复杂推理 | MATH、BBH、ARC | MMLU-STEM | 领域专家人工评审 |
八、小结
MMLU、GSM8K、HumanEval、CEval 等基准构成了大模型通用能力的“公共考场”。它们的价值在于横向可比性——让你能在同样的尺度下,快速筛选出基线达标的模型。
但记住:模型不是学生,业务也不是考试。这些基准只能告诉你“它会不会”,无法告诉你“它在你家数据上稳不稳”。在 11.2 节中,我们将进入垂直领域评测,探讨如何跳出公共基准,为代码、医疗、法律、数学等真实业务构建专属的评估体系。