CMMLU 免费

-

CMMLU 是一个综合性的中文大模型评估基准,覆盖人文、社科、理工与中国特有知识等多个领域的多项选择题,用于衡量大语言模型在中文语境下的知识储备与推理能力,数据集与评测代码在 GitHub 开源。

CMMLU 产品界面

CMMLU

CMMLU 的核心参数与统计

CMMLU(Chinese Massive Multitask Language Understanding)是一套面向中文大语言模型的多领域知识评估基准,由学术研究团队在 2023 年公开。它不面向终端用户提供聊天或生成功能,而是为研究者与模型开发团队提供一套覆盖 67 个学科的标准化中文知识题库,用于衡量模型在中文语境下的事实知识储备与推理准确率。

参数项 数值
基准全称 CMMLU(Chinese Massive Multitask Language Understanding)
题目总数 ~11,500 道多项选择题
学科覆盖 67 个学科,分属人文、社科、理工、中国特有知识四大类
选项结构 四选一(A/B/C/D)
题型 知识型选择题(事实记忆 + 推理判断)
输出指标 各学科准确率(Accuracy)与总体平均准确率
许可协议 开源(GitHub 公开仓库)
首发论文 arXiv 2023
评测方式 本地推理 + 脚本评分,支持 few-shot 与 zero-shot 两种设定
依赖有境 PyTorch / Transformers + 评测脚本

参数意义解读:67 个学科的划分粒度远细于 MMLU(57 学科)和 C-Eval(52 学科),这意味着 CMMLU 在学科维度上提供了更细粒度的能力诊断能力。约 11,500 道题目的总量虽然不及某些动辄数万题的规模,但每学科约 170 题的平均密度足以支撑统计显著的学科级准确率比较。四选一格式降低了随机猜测基线(25%),使 30%-40% 的准确率区间仍具有区分价值,适合定位模型在困难学科上的短板。

与同类基准的规模对比

基准 学科数 题目数 语言 中国特有知识
MMLU 57 ~14,000 英文
C-Eval 52 ~13,900 中文 部分
CMMLU 67 ~11,500 中文 重点覆盖
AGIEval 20+ ~8,000 中/英 部分

类型判定:CMMLU 属于"基础大模型/API 基础设施"类别下的模型评估基础设施,核心交付物为一套标准化数据集 + 评测协议 + 基线成绩,不涉及持续运行的 API 服务,但为模型研发链条中不可或缺的质量门禁有节。

CMMLU 的用户与市场认可

  • 学术引用与影响力:CMMLU 论文在 arXiv 公开后,被多个中文大模型团队在技术报告与论文中引用作为能力佐证,包括 Qwen、Yi、Baichuan、InternLM 等系列模型的发布均报告了 CMMLU 分数。截至 2026 年中,其 GitHub 仓库获得数千 stars,社区 fork 与 issue 讨论活跃。

  • 产业采用模式:国内大模型厂商普遍将 CMMLU 与 C-Eval 并列作为中文知识能力的标准评测组合。在模型能力对比表中,CMMLU 的总体准确率与各学科准确率是最常被引用的中文基准指标之一。部分团队将 CMMLU 纳入每日回归测试流水线,用于检测训练过程中的能力退化。

  • 与 C-Eval 的定位差异:C-Eval 侧重通用学科的中国高考/考研难度题目,CMMLU 则更注重中国特有知识(如中国历史、地理、法律、文学)的覆盖。二者在总体学科分布上约有 60% 的重叠,但在中国特有知识类别上 CMMLU 的深度明显更高。许多团队同时报告两个基准的分数,以获取更完整的中文能力画像。

  • 边界说明:选择题基准存在数据污染的固有风险——模型在预训练阶段可能已见过题目原文,导致分数虚高。目前 CMMLU 团队暂未设立独立的 hold-out 隐私集或动态出题机制,因此引用其分数时需结合同批模型的 MMLU/C-Eval 趋势交叉验证。此外,高分仅反映事实知识储备量,不代表模型的推理深度、对话质量或指令遵循能力。

CMMLU 的成本优势

C 端 / 个人研究者

  • 直接费用为零:数据集与评测脚本完全开源,GitHub 仓库可直接克隆使用,无需支付任何授权费或订阅费。
  • 运行成本:评测需要在自有硬件或云实例上加载模型并执行推理。以 7B 参数规模的模型为例,在单张 A100 上完成全部 67 学科的推理约需 30-60 分钟,对应的云计算成本约为 $1-3(按按需定价估算)。70B+ 规模模型所需算力呈线性增长,预计单次全量评测成本在 $10-30 区间。

API 开发者 / 模型服务商

  • 自建替代成本对比:若从头构建一套覆盖 67 学科、各学科约 170 题的中文评测集,需要雇佣学科专家出题、审题、试测、校准,预估人力成本在数十万元级别。CMMLU 以零许可费直接提供经过验证的题库与基线,将此部分成本降至零。
  • 集成本:评测脚本基于 Hugging Face transformers 与 datasets 库,与主流模型框架天然兼容,无需额外适配。将 CMMLU 评测集成到模型训练流水线的工程成本通常控制在 1-2 人天以内。

企业 / 机构

  • 私有化部署:数据集可完全离线使用,不依赖任何外部 API,满足数据安全与合规要求。评测结果不出本地,适合金融、医疗、政务等对数据出境有严格限制的行业。
  • 隐性成本——评测协议一致性:不同团队在 prompt 模板few-shot 样例选取、答案抽取逻辑上的微小差异可能导致分数偏差 3-5 个百分点。为获得可横向对比的结果,需严格执行官方推荐的评测参数(zero-shot 或 5-shot,统一 prompt 格式)。未统一协议时,报告分数可能不具备可比性。

CMMLU 的主要功能

  • 多学科标准化题库:覆盖 67 个学科,按人文(中国文学、历史、哲学等)、社科(法律、经济、教育等)、理工(数学、物理、计算机等)、中国特有知识(中国政治、中国地理、中国民俗等)四大类别组织。每学科约 170 题,四选一格式,随机基线 25%。使用价值:提供标准化的中文知识能力测量标尺,使不同模型在同一尺度上可比。

  • 灵活评测框架:支持 zero-shot 和 few-shot(默认 5-shot)两种评测设定,可通过调整 prompt 模板、示例数量与顺序来适配不同模型的最优表现区间。使用价值:团队可根据模型类型(基座 vs. 指令微调)选择最合适的评测设定,避免单一样式带来的偏差。

  • 开源基线成绩:仓库公开了多个主流模型在各学科上的准确率基线,包括 GPT-4、Claude、Qwen、Baichuan、InternLM、Yi 等系列。使用价值:新模型团队可直接对照基线判断能力水位,无需从零建立参考系。

  • 学科级能力诊断:评测脚本输出各学科独立准确率,并可自动生成雷达图或柱状图进行横向对比。使用价值:精准定位模型在哪些学科上强(如中国历史、文学)和弱(如高等数学、物理),为数据配比与训练策略调整提供量化依据。

  • 社区可扩展性:数据集与代码完全公开,研究团队可自行增删学科、修改题目、添加新模型基线,或从评测脚本中提取接口嵌入自定义测试流水线。使用价值:面向特定行业(如法律、医学)的团队可在 CMMLU 基础上构建垂直领域评测集,复用现成的评测工具链。

专家视点:CMMLU 的"学科级诊断"与"基线对比"构成闭有——基线提供参照系,学科得分定位能力短板,二者结合使模型团队不再仅靠总体分数衡量模型的好坏,而是能精确到"哪个学科差了 X 个百分点"。这一闭有对训练数据配比优化、课程学习策略设计、以及领域增强微调的数据选取都有直接的指导意义。

CMMLU 的模型与版本演进

主线发布

  • 论文首发版(2023-06):随 arXiv 论文公开数据集 v1.0 与评测协议,确立 67 学科划分与 5-shot 评测规范。论文同时报告了 GPT-4、ChatGPT 以及多个早期中文模型的基线成绩。这是 CMMLU 的初始里程碑,所有后续更新均以此版本为基础。

  • 数据集更新版(~2024):基于社区反馈修正了部分学科中的题目错误与答案标注问题,并补充了少量新学科题目。官方未单列版本号,更新记录以 GitHub commit 日志为准。变化点:修正错误约数十处,学科总数维持 67 不变。

  • 持续维护期(2024 至今):仓库以 issue 管理社区反馈的问题报告与建议,定期合并修正 PR。基线成绩表随新模型发布持续更新,但数据集本体的结构性变更趋于稳定。变化点:基线模型数量持续增加,数据集核心结构未再大改。

版本脉络要点

CMMLU 的版本演进特征是"数据集一次性发布 + 基线持续更新"的学术基准模式,与商业产品的语义化版本管理不同。数据集本身在首发后仅有勘误级修正,未经历结构性扩容或版本号跳变。引用时以论文首发日期与 GitHub commit hash 为准。

版本里程碑 日期 核心变化
论文首发 ~2023-06 公开 67 学科数据集 v1.0、评测脚本、基线成绩
勘误更新 ~2024 修正部分题目错误,补充学科,无版本号跳变
持续维护 2024 至今 基线模型持续扩充,数据集结构保持稳定

CMMLU 的技术优势

机制:CMMLU 采用"静态数据集 + 本地评测脚本"的离线评测架构。数据集以 JSON 格式存储每道题的题干、四个选项与正确答案索引;评测脚本依次读取题目、构造 prompt、调用模型推理、比对答案、分学科统计准确率。

效果

  • 完全离线可复现:所有评测逻辑在本地执行,不依赖任何外部服务,任何团队使用相同版本的数据集与脚本都能得到一致结果。这消除了在线评测中 API 版本差异、服务更新、随机采样等不可控因素对分数的干扰。

  • 细粒度学科诊断:67 学科的划分粒度在中文评测基准中居于前列。对比 MMLU 的 57 学科和 C-Eval 的 52 学科,CMMLU 在"中国特有知识"类别上增加了大量细分学科(如中国政治制度、中国民俗、中国古代史等),使模型对中国本土知识的掌握程度可被单独度量。

  • 与 MMLU 的互补设计:CMMLU 的学科设置与 MMLU 并非简单的中英翻译关系。MMLU 覆盖的学科以西方知识体系为框架,而 CMMLU 增加了大量中国独有的知识与评估维度。对同一模型同时运行 MMLU 和 CMMLU,可以分离出"通用知识能力"与"中文语境知识能力"两个维度的差异。例如,一个在 MMLU 上表现优异的模型可能在 CMMLU 的中国特有知识类别上得分偏低,这提示模型在中文预训练数据中对中国文化的覆盖不足。

适用场景:CMMLU 更适合作为模型研发阶段的能力诊断工具,而非发布前的最终宣传指标。在训练过程中定期运行 CMMLU 评测,可以及时发现模型在某些学科上的能力退化(如过度对齐导致的事实知识遗忘)。对于发布报告,建议将 CMMLU 与 C-Eval、MMLU、AGIEval 等组成评测套件,避免单一基准的分数被过度解读。

CMMLU 的使用方式

入口对照

入口 用途 成本
GitHub 仓库(haonan-li/CMMLU) 数据集下载、评测脚本、基线成绩、文档 免费
arXiv 论文 方法说明、学科定义、早期基线 免费
Hugging Face Datasets 通过 datasets 库直接加载 CMMLU 免费

典型使用步骤

  1. 获取数据集git clone https://github.com/haonan-li/CMMLU.git,或通过 datasets.load_dataset("haonan-li/cmmlu") 直接加载。
  2. 准备模型:确保待评测模型可通过 Hugging Face transformers 的 AutoModelForCausalLM 加载,或实现兼容的推理接口。
  3. 运行评测:执行评测脚本,指定模型路径、评测设定(zero-shot 或 5-shot)、输出目录等参数。示例命令:python eval.py --model Qwen/Qwen2-7B --shot 5 --output ./results
  4. 查看结果:脚本输出各学科准确率与总体平均准确率,同时生成学科间对比可视化图表。

适配提示

  • prompt 格式必须统一:不同 prompt 模板(如是否添加角色描述、是否使用中文指令前缀)可能导致分数波动 2-5 个百分点。报告分数时必须注明使用的 prompt 版本,否则结果不可横向比较。
  • few-shot 样例的随机性:5-shot 评测中,示例的选取顺序会影响模型表现。建议固定随机种子并多次运行取均值,以降低单次抽样的方差。
  • 解码参数控制:评测应使用 greedy decoding(temperature=0),避免采样策略引入的随机性干扰准确率统计。
  • 模型分词器兼容性:部分模型的 tokenizer 对中文字符的分词方式不同,可能影响 prompt 的实际 token 长度与模型对题目的理解。建议在正式评测前先在小样本上验证 prompt 能被正确编码。

CMMLU 的产品定价

  • 计费模式:完全免费开源。无授权费、无订阅费、无按使用量计费。
  • 附带成本:评测所需算力由使用者自行承担。按模型规模不同,单次全量评测的算力成本在 $1-30 之间(以主流云 GPU 按需定价为参照)。
  • 企业私有化:数据集可完全离线运行,无需向外传输数据,无额外 SaaS 费用。
  • 无隐藏条款:GitHub 开源许可不限制商业使用,但引用 CMMLU 分数时需注明数据版本与评测设定以保持结果可复现。

CMMLU 的应用场景

  • 模型研发阶段的能力诊断:在预训练或微调过程中定期运行 CMMLU 评测,监控模型在不同学科上的能力变化趋势。实际收益:可早期发现某些学科的能力退化(例如模型在过度对齐后出现中国历史知识遗忘),及时调整训练数据配比或训练策略。验收关注点:设定学科级准确率阈值(如各学科不低于基线水平的 90%),作为 checkpoint 是否可进入下一阶段的准入条件。

  • 模型发布时的能力声明:在技术报告或发布公告中报告 CMMLU 分数作为中文知识能力的量化证明。实际收益:提供行业内可比的能力标尺,降低用户在选型时的信息不对称。验收关注点:报告分数时需同时注明评测设定(zero-shot/5-shot、prompt 版本、解码参数),并补充同条件下的 C-Eval 与 MMLU 分数以供交叉验证。

  • 学术研究与基准对比:NLP 研究者使用 CMMLU 作为中文语言理解的评估工具,在论文中报告模型在该基准上的表现,或基于 CMMLU 开展评测方法研究(如 prompt 敏感性分析、数据污染检测等)。实际收益:为中文 NLP 研究提供标准化的评测平台,降低新模型与新方法的评估成本。

  • 垂直领域模型选型评估:在挑选中文行业大模型(法律、医疗、金融等)时,将 CMMLU 中对应学科(如法律学、医学、经济学)的得分作为选型参考维度之一。实际收益:从知识覆盖角度快速筛选出在目标领域有明显优势的模型,缩小试测范围。验收关注点:仅参考相关学科分数,不应以总体平均分替代领域专项评估。

CMMLU 的适用人群

  • 大模型算法工程师与研究员:需要用标准化的中文知识评测来验证模型训练效果、检测能力退化、对比不同训练策略的影响。CMMLU 提供的学科级诊断能直接指导数据配比调整与课程学习设计。前置条件:具备模型推理有境与基本的 Python 脚本执行能力。

  • NLP 学术研究者:从事中文语言理解、评测方法论、数据污染检测等方向的研究,需要一套公开可复现的基准作为实验平台。CMMLU 的开源特性与细粒度学科划分为实验设计提供了灵活性。前置条件:熟悉 Hugging Face 生态与标准评测流程。

  • 模型选型与采购决策者:在企业采购大模型或选择开源模型基座时,将 CMMLU 分数作为中文知识能力的量化参考指标之一。前置条件:需理解选择题基准的局限,不将其作为唯一决策依据。

  • ❌ 不适配人群

    • 希望直接获得对话、写作、翻译等可用功能的终端用户——CMMLU 是评测工具而非应用产品。
    • 需要评估模型推理深度、创造力、多轮对话质量的场景——选择题格式无法衡量这些维度。
    • 仅参考单一总体分数做模型选择的决策者——选择题基准受数据污染影响,且总体分可能掩盖在关键学科上的严重短板,需结合其他评测与实测综合判断。

总结与展望

核心竞争力:CMMLU 以 67 学科的细粒度划分、对中国特有知识的重点覆盖、以及完全离线可复现的开源架构,成为中文大模型评测版图中不可或缺的组成部分。它与 C-Eval 形成互补——前者侧重通用学科的难度梯度,后者侧重中国本土知识深度——二者并用可以更完整地刻画模型的中文知识能力结构。

当前局限

  • 数据污染风险:静态公开数据集容易被模型在预训练阶段"提前看到",导致分数虚高。目前 CMMLU 尚无动态出题或定期刷新的机制,长期依赖固定版本将面临越来越多的污染问题。
  • 题型单一:仅有四选一选择题,无法评估模型的生成式推理、多步推理、开放性问答等能力。高分仅反映事实知识记忆量,不保证实际应用中的表现。
  • 学科覆盖仍有缺口:虽然 67 学科已属高密度,但在新兴交叉学科(如 AI 伦理、计算社会科学)和部分垂直行业(如制药、金融工程)上覆盖不足。
  • 评测协议标准化不足:不同团队在 prompt 模板few-shot 设置、答案抽取上的差异仍导致分数不可直接比较,社区需要一个更严格的标准评测协议。

后续观察点

  • CMMLU 是否会推出"隐私集"动态评测版本以对抗数据污染。
  • 能否与真实任务评测(如 Baichuan-TextEval、SuperCLUE)建立关联转换,帮助用户理解选择题分数在应用场景中的实际含义。
  • 社区是否会基于 CMMLU 框架构建垂直行业扩展集(如 CMMLU-Med、CMMLU-Law)。
  • 主流模型在 CMMLU 上的分数趋同后,基准是否需要增加难度或引入对抗性样本以保持区分度。

采购与采用风险评估:对于计划将 CMMLU 纳入评测体系的团队,建议采取以下步骤——短期(1-2 周)将其集成到现有评测流水线中,与 MMLU、C-Eval 同步运行,建立基线对照;中期(1-3 个月)关注 CMMLU 的学科级诊断输出,用于指导预训练数据配比调整;长期(6 个月以上)密切跟踪 CMMLU 的数据污染趋势,如观察到社区报告的分数通胀超过合理范围,应考虑补充其他异质性的评测指标。对于商业化模型的能力声明,建议始终在 CMMLU 之外同时披露同条件下的 MMLU 与 C-Eval 分数,并明确注明评测设定(shot 数prompt 版本、解码参数),以避免因评测不一致导致的选型误导。

相关工具:Hugging FaceReplicate

版本信息

  • CMMLU 评估基准(GitHub 开源) :开源的中文综合知识评估基准,覆盖人文、社科、理工及中国特有知识等多个领域的多项选择题,提供数据集、评测脚本与基线成绩。官方以仓库与论文为准,未单列连续小版本号,日期为近似值。
  • CMMLU 论文与数据集首发 :随论文公开数据集与评测协议,确立学科划分与基线评测方式。后续以仓库更新与结果补充为主,官方未公开精确日期,日期为近似值。

用户评价

  • 加载评价中...