← 返回资讯

大模型评测基准科普:MMLU、GPQA、HumanEval、MATH、MMMU 是什么

2026-06-17

每当一家厂商发布新模型,报告里总是充满了”MMLU 92.3”、“HumanEval pass@1 87.4”这样的数字。这些基准到底测的是什么?分数高意味着什么?本文做一次系统科普,帮你读懂这些数字背后的真实含义,以及它们各自的局限。

注:本文介绍各基准的设计原理与典型题目类型,不引用具体模型得分——各模型最新成绩以其官方报告和对应榜单为准。

一、主流评测基准速览

基准名称全称 / 来源测什么评分方式题目语言
MMLUMassive Multitask Language Understanding57 门学科的大学水平知识四选一选择题,准确率英文
GPQAGraduate-Level Google-Proof Q&A博士级别专业推理四选一,专家验证英文
HumanEvalCodex HumanEvalPython 函数代码生成pass@k(单元测试通过率)代码/英文
MATHMATH Dataset (Hendrycks)竞赛数学题最终答案精确匹配英文(数学符号)
MMMUMassive Multidisciplinary Multimodal Understanding多模态(图文)学科理解选择题,准确率英文
C-EvalChinese Evaluation Suite中文学科知识(52 门)四选一选择题,准确率中文
GSM8KGrade School Math 8K小学数学应用题推理答案精确匹配英文
HellaSwag常识推理/故事续写四选一英文

二、逐一深度解读

MMLU — 知识广度的尺子

MMLU 覆盖数学、科学、法律、医学、历史、社会科学等 57 门学科,每门学科有大学本科到研究生水平的选择题。它是目前使用最广、最常被引用的综合能力基准之一。

优势:覆盖面广,横向可比性强,题库来自真实考试题目。

局限

  • 全为选择题,无法测试生成质量、格式遵循、开放性推理
  • 大量题目在互联网上已公开,数据污染风险较高
  • 高分不等于”写作好”或”代码强”

适用场景:衡量通用知识广度,筛选基础能力达标线。

GPQA — 专业深度的压力测试

GPQA(Graduate-Level Google-Proof Q&A)的题目由博士生和研究人员出题,设计上要求仅靠搜索引擎无法简单找到答案——需要真正的推理和专业理解。题目集中在生物学、化学、物理等领域。

优势:能有效区分”背题”和”真懂”,抗污染性较强。

局限:题目数量相对较少,覆盖学科有限,不代表工程或人文领域能力。

适用场景:评估模型在专业科学领域的深度推理能力。

HumanEval — 代码能力的黄金标准(之一)

HumanEval 包含 164 道 Python 编程题,每道题给出函数签名和文档字符串,要求模型补全函数体,再用隐藏单元测试验证正确性。

评分指标 pass@k:模型生成 k 个候选答案,只要有 1 个通过所有单元测试即算正确。

  • pass@1 = 只允许1次尝试的通过率(最严苛)
  • pass@10 = 10次中有1次通过(更宽松)

局限

  • 题目较旧(2021年),大量变体已在训练数据中出现
  • 只覆盖 Python,不代表多语言编程能力
  • 题目偏算法题,不测试工程实践(代码风格、测试编写、复杂依赖管理等)

适用场景:基础代码生成能力的快速对比,搭配 LiveCodeBench 使用效果更好。

自己动手测一遍,比看报告更靠谱:HumanEval 的题目和评测脚本都是公开的,你完全可以拿自己接入的模型跑一遍,别只信厂商公告的那个数字。步骤大致是这样:拉取 HumanEval 的 164 道题 JSONL 文件,把每道题的 prompt 字段直接丢给模型 API,取回补全的函数体,拼接成完整代码后放进一个隔离的沙箱环境(千万别在你本机主进程里直接 exec,题目里偶尔会有死循环或者异常输入,容易把解释器卡死),再逐一跑对应的隐藏测试用例。跑 10~20 道题、观察真实通过率,你就能感觉出这个模型在你实际调用参数(温度、top_p、最大 token 数)下的真实水平——很多人拿厂商 pass@1 的数字直接套用到自己业务上,结果发现自己用的是默认温度 0.7,而厂商跑分时用的是贪心解码(temperature=0),两者差出十几个点都不奇怪。

评测时容易踩的一个大坑:few-shot 与解码参数

同一个基准,不同论文报出来的分数经常对不上,很多人第一反应是”模型作弊了”或者”厂商注水”,其实更常见的原因是测试设置不一致。至少有三个变量会让同一个模型在同一个基准上跑出完全不同的分数:

  1. few-shot 数量:零样本(zero-shot,不给示例直接问)通常比 5-shot(先给 5 道示例题)分数低,MMLU 官方论文用的是 5-shot,如果你看到某厂商报了一个异常高的零样本分数,先确认一下他们的评测设置写没写清楚。
  2. 解码方式:贪心解码(每步都选概率最高的 token)通常比带温度采样更稳定,分数也往往更高;但贪心解码在真实对话场景里显得死板,很多产品默认不会这么配。
  3. 提示词模板:有没有加”请只输出选项字母,不要解释”这类约束,对选择题类基准(MMLU、GPQA)的解析成功率影响很大——模型输出格式对不上评分脚本的正则,会被判为答错,这不是模型能力问题,是评测脚本的锅。

所以看到两份报告分数差异较大时,别急着下”模型变强/变弱”的结论,先翻一下方法论章节里的 few-shot 设置和解码参数,很多时候答案就在那里。

MATH — 数学推理的硬核考场

MATH 数据集来自数学竞赛题(AMC、AIME 等级别),分为代数、几何、数论、概率、微积分等子类,共 5 个难度等级。

评分方式:最终数值或表达式的精确匹配,有严格的格式要求。

局限

  • 对推理链过程不做直接评估,只看最终答案
  • 高难度题目(Level 5)对当前模型仍是巨大挑战,分数可能接近随机
  • 题目来源已广泛进入训练数据

适用场景:筛选数学密集型任务(金融建模、科学计算辅助)的候选模型。

MMMU — 多模态能力的综合测验

MMMU(Massive Multidisciplinary Multimodal Understanding)是专门针对大型多模态模型的基准,包含图表、图片、公式等视觉元素,要求模型同时理解图文信息作答。

优势:是目前覆盖最广的多模态学术基准之一,11 个学科,超过 11,000 道题。

局限:静态图片为主,不覆盖视频理解;主要是选择题,不测生成质量。

适用场景:评估需要图文混合输入场景(如图表分析、文档理解)的模型。

C-Eval — 中文场景不可绕过的基准

C-Eval 覆盖 52 门中文学科(含人文、理工、职业资格等),是目前国内认可度较高的中文能力基准。使用中文场景模型,必须参考 C-Eval 分项数据,而不仅仅是总分。

局限:也是选择题为主,且随着公开度提高,污染风险增加。

三、局限的共性:基准不能测什么

几乎所有现有基准都存在以下共同局限:

  1. 不测生成质量:流畅度、品牌调性、创意——这些只有人类评测能衡量
  2. 不测多轮对话的状态维持:单题正确不等于长对话不跑偏
  3. 不测幻觉率:模型在选择题上得高分,可能同时在开放生成中大量编造
  4. 不测延迟与稳定性:生产环境的可用性完全在基准范围之外

四、数据污染:为什么高分不一定可信

数据污染(contamination)是这几年评测圈最头疼的问题,说白了就是——基准的题目和答案,很可能已经混进了模型的训练语料里。这不是阴谋论,是有具体机制的:MATH、HumanEval 这类基准发布多年,题目和参考答案早就被各种技术博客、教程、代码仓库转载引用了无数遍,模型在预训练阶段抓取互联网语料时,大概率”背”过这些题目本身,而不是真的学会了对应的推理能力。

怎么判断一个高分有没有水分,几个可以自己上手核实的信号:

  • 对比”新旧”版本的差异:如果一个基准既有旧题库又有滚动更新的新题(比如 LiveCodeBench 会持续加入比赛后新出的代码题),对比模型在旧题和新题上的分数差。如果新题分数明显低一截,基本可以判断旧题分数里有污染水分。
  • 看题目改写后的鲁棒性:把原题的表述稍微改写(换个变量名、调整题面措辞、把选项顺序打乱),如果模型分数大幅下降,说明它更多是”记住了原文”而非”理解了逻辑”。
  • 警惕”分数突然跳变”:某个模型在某个基准上突然比同代模型高出一大截,而在其他相近能力的基准上表现平平,值得多问一句——是不是训练数据里恰好包含了这个基准的评测集。

对你实际选型影响是:别只盯着单一基准的最高分做决策,多看几个同类基准交叉验证(比如代码能力同时看 HumanEval 和 LiveCodeBench),再结合你自己业务场景的实测,才是靠谱的做法。

常见问题

MMLU 和 C-Eval 可以互相替代吗? 不能。MMLU 全英文,侧重国际学科知识;C-Eval 是中文,包含大量中国特色学科(如法律法规、职业资格)。中文业务场景必须单独看 C-Eval。

pass@1 和 pass@10 哪个更重要? 取决于你的使用方式。如果你只让模型生成一次(生产环境常见),pass@1 更贴近实际;如果你有自动重试或多输出选优(如辅助编程工具),pass@10 更有参考价值。

厂商只发布部分基准数据,这正常吗? 非常正常,也是读报告时需要警惕的点。厂商通常只发布自家模型表现最好的基准。如果某项对你重要的基准缺失,最好查询第三方榜单或自行测试。

基准分数高,接进业务后效果却不理想,问题出在哪? 这是最常见的落差之一,通常有三个原因。第一,基准测的是”通用能力”,你的业务大概率是垂直场景(比如客服话术、合同审查),两者的能力分布并不重合,通用分数高不代表垂直场景表现好。第二,基准评测时用的提示词往往经过精心设计,而你实际业务里的提示词可能很随意,模型对提示词的敏感度比想象中高,同样的模型换一种问法,效果能差出一大截。第三,生产环境还要考虑延迟、并发下的稳定性、长上下文的记忆保持,这些基准完全不覆盖。实际的做法是:把基准分数当作”入围门槛”而不是”最终裁决”,先用分数筛出两三个候选模型,再拿你自己的真实业务数据(哪怕只有几十条典型 case)跑一轮小规模评测,看谁在你的场景里表现更稳,这一步不能省。

中文场景该重点参考哪些基准? 优先看 C-Eval 和对应的分项数据(不要只看总分,人文、理工、职业资格类的分项差异往往很大),同时结合你业务语言风格做小样本人工评测。纯英文基准(MMLU、GPQA)可以作为模型整体推理能力的参考,但不能替代中文实际表现的判断。


延伸阅读:怎么追踪大模型动态与看懂评测(选型全攻略) · 主流大模型跑分榜单怎么看 · 返回 AI 资讯中心 · 了解 国产大模型专题