C-Eval 免费

-

C-Eval 是一个面向大语言模型的中文综合评估套件,包含 13948 道多项选择题,覆盖 52 个学科与四个难度层次,并提供公开排行榜,是衡量中文基础模型能力的常用学术基准之一。

C-Eval 产品界面

C-Eval

C-Eval 的核心参数与统计

C-Eval 不是一个面向终端用户的应用,而是一套面向研究者与模型团队的中文大模型评估基准。它的核心价值是“用统一、可比较的题库衡量模型的中文知识与推理能力”,解决的痛点是中文场景下缺乏标准化、跨学科的横向评测尺度。

项目 公开信息
基准类型 中文大模型多学科评估套件
题量 13948 道多项选择题
学科覆盖 52 个学科
难度层次 四个难度层次(基础、专业、研究生、综合)
题目来源 中国大学考试、研究生入学考试、职业资格考试、公开竞赛
形式 公开题库 + 在线排行榜
开放性 数据集与代码 GitHub 开源(MIT 许可)
计费模式 免费(学术基准)
评估协议 5-shot 与 0-shot 两种设置
排行榜规模 持续收录数十个主流模型的成绩

参数含义:13948 道题覆盖从基础学科(数学、物理、化学)到专业领域(医学、法学、计算机)再到高级推理(逻辑、伦理)的全谱系。52 个学科的分层设计使模型不仅能得到一个总分,还能按学科拆解出能力轮廓。四个难度层次(基础、专业、研究生、综合)进一步区分模型在简单常识与高阶推理上的差距——同一模型在基础层可能接近满分,在研究生层却大幅下降,这种落差比总分更能反映模型能力的真实纵深。

评测协议:C-Eval 默认提供 5-shot(5 个示例)与 0-shot(无示例)两种评估设置。5-shot 结果通常反映模型在少量上下文学习(in-context learning)下的表现,0-shot 更接近模型"裸知识"的掌握程度。两者之间的差值可辅助判断模型对示例格式的依赖程度。

Benchmark 对比:与同类中文评测基准相比,C-Eval 在学科广度与难度分层上具有明显区分度。

基准 题目数 学科/领域 难度分层 组织形式 语言
C-Eval 13948 52 个学科 四层(基础/专业/研究生/综合) 多项选择 中文
MMLU ~15900 57 个学科 无明确分层 多项选择 英文
CMMLU ~10000 67 个学科 无明确分层 多项选择 中文
AGIEval ~6800 20+ 考试类型 按考试来源分 多项选择+填空 中英
GAOKAO ~4500 9 科高考题 按年级分 多项选择+填空 中文

宣传核验:官网明确将其定位为"一个适用于大语言模型的多层次多学科中文评估套件(2023)",13948 题52 学科、四层难度、开源协议等关键参数均可在官网与 GitHub 仓库直接核验。

C-Eval 的用户与市场认可

  • 研究与产业采用:C-Eval 已成为中文大模型事实上的"入学考试"。几乎所有国产大模型(包括 DeepSeek、通义千问、文心一言ChatGLM、Baichuan、Yi 系列等)在发布技术报告或对外宣传时都会列出 C-Eval 分数,作为中文能力的关键参照指标。据公开技术报告统计,在 C-Eval 五项分类准确率中总分超过 90% 的模型已超过 15 个(截至 2026 年中期),反映该基准在模型迭代中被持续关注。
  • 可核验数据:题量 13948、学科 52 个、四个难度层次均为官网公开口径。排行榜在官网持续更新,各模型提交的分数条目均带提交时间与设置说明(如 5-shot / 0-shot)。
  • 学术引用量:C-Eval 原始论文在 Google Scholar 上被引超过 2000 次(截至 2026 年中),成为中文 NLP 评测领域引用率最高的基准论文之一。
  • 社区生态:GitHub 仓库(hkust-nlp/ceval)公开显示 400+ stars、100+ forks,Issue 与 PR 讨论活跃,反映学术社区对该标准的关注与持续改进意愿。
  • 边界说明:排行榜成绩由各模型团队自行提交或第三方评测得到,存在评测设置差异(Prompt 措辞变化、批处理大小、输出解码策略等)。作为单一选择题基准,C-Eval 不覆盖生成质量、指令遵循、多轮对话等维度,不能完全代表模型在真实任务中的综合表现。此外,由于题库是静态公开题库,存在被预训练数据"记忆"的风险(数据污染),即模型可能在训练阶段见过部分题目,从而获得虚高分数。

C-Eval 的成本优势

C-Eval 本身不收取任何使用费用,但评测的完整成本需要从"个人研究者""学术/模型团队""企业工业化评估"三个层面分别拆解。

C 端/个人研究者

  • 工具成本:零成本。数据集与评测代码完全开源,GitHub 直接下载即可使用。
  • 算力成本:自备 GPU。13948 题的单次完整评测在单卡 A100-80G 上约需 1-4 小时(取决于模型规模与解码效率)。对于参数量 7B 以下的小模型,单张消费级 GPU(如 RTX 4090)即可完成评测。
  • 隐性成本:需要正确配置评测有境(Python、PyTorch 以及 transformers 依赖)、理解评测协议(5-shot 模板格式、答案抽取规则)。新手在此有节可能消耗 1-3 天。

API 开发者与模型团队

  • 工具成本:零成本。
  • 集成本:将 C-Eval 评测脚本集成到模型训练流水线(如每次 checkpoint 保存后自动执行),需要工程投入。官方提供 Python 评测脚本,但批量模型版本对比、结果可视化、异常检测等进阶需求需自行开发。
  • 对比成本:若需要与竞品模型在同一设置下公平对比,需自备竞品模型的推理有境或 API 访问,这部分成本落在模型调用侧,非 C-Eval 本身。

企业与大规模评测需求

  • 工具成本:零成本。无商业授权费,MIT 开源许可允许商业使用与二次分发。
  • 规模化评测成本:企业若需要对数十个模型变体进行多次评测(如不同微调策略的对照实验),机器成本线性增长。官方脚本支持并行评测,但大规模方案需要团队自行搭建分布式评测框架。
  • 合规成本:无。C-Eval 题库来自公开学术资料与考试题目,数据集许可为 MIT,无额外合规风险。但企业如使用自有评估集或扩展题目,需自行确权。

对比维度:相较自建评测集,C-Eval 提供现成的标准化题库与统一榜单,节省构建(通常需要 2-5 人月)与对齐成本。相比使用英文 MMLU 进行评测,C-Eval 面向中文场景,覆盖中国学科体系,能更准确反映模型在中文知识与推理上的真实水平。

C-Eval 的主要功能

  • 标准化题库:13948 道覆盖 52 个学科的多项选择题,每题 4 个选项,统一格式,支持自动评分。学科被分为四类:人文社科(如历史、哲学、经济学)、STEM(如数学、物理、计算机科学)、医学(如临床医学、药学、基础医学)和其他(如逻辑学、伦理学、法学),覆盖中国高等教育与职业资格考试的核心知识体系。
  • 多难度分层:四个难度层次——基础(对应本科基础知识)、专业(对应专业领域深度知识)、研究生(对应研究生阶段高级概念)、综合(跨学科综合应用)。这种分层不仅能衡量模型的"广度",还能区分"深度"——一个在基础层得 90%、在研究生层只得 50% 的模型,与两个层均得 80% 的模型,可能对应完全不同的研发路径(前者需要增强高阶推理,后者需要修补知识盲区)。
  • 公开排行榜:官网持续收录各模型的 5-shot 与 0-shot 成绩,并按总平均分排序。排行榜附带每项成绩的学科细分、提交日期与评测设置,便于横向参照。排行榜不设提交流程限制,但要求提交者注明评测配置以维持基本的可比性。
  • 开源代码与数据:GitHub 仓库提供完整的数据集(JSON 格式)、评测脚本(Python,基于 lm_eval 框架)、Prompt 模板与答案抽取逻辑。支持自定义模型接入,只需实现标准的文本生成接口(输入→输出→评分)。社区已有多篇解读文章和第三方改进版本(如多语言扩展、适应性评测难度调整等)。
  • 学科级诊断报告:C-Eval 的学科分类粒度支持生成模型能力的"雷达图"。例如,一个模型可能在"计算机科学"与"数学"上得分很高,但在"法医学"或"伦理学"上显著偏低。这种粒度诊断比单一总分更能指导针对性的训练数据补充。

C-Eval 的模型与版本演进

C-Eval 作为一个学术基准,其"版本迭代"主要体现在数据集维护、排行榜更新与评测协议优化三个层面,而非传统意义上的软件版本号递增。

1. 初始发布(2023-05)

  • 随论文《C-Eval: A Multi-Level Multi-Discipline Chinese Evaluation Suite for Large Language Models》首次公开。
  • 确立 13948 道题52 个学科、四个难度层次的核心架构。
  • 公开初始排行榜,收录 GPT-4、ChatGPT、Claude 等首批模型成绩。
  • 论文发表时,GPT-4 在 5-shot 设置下总分约 68%,而当时中文开源模型最高分约 45%-50%,反映中外模型在中文知识上的显著差距。

2. 数据集完善与协议微调(2023-06 至 2024-06)

  • 社区反馈驱动下,逐步修复部分题目答案错误与学科归类偏差(GitHub Issue 可追溯)。
  • 明确推荐 5-shot 为默认评测协议,规范 Prompt 模板以提升结果可比性。
  • 增加对不同模型系列(MoE 架构、强化学习微调模型等)的兼容性测试。
  • 排行榜收录模型数量从最初的十几个扩展到数十个,覆盖主流开源与闭源模型。

3. 持续影响力扩展(2024-06 至今)

  • C-Eval 分数成为中文大模型技术报告的"标配"指标。
  • 后续衍生工作(如 C-Eval Hard、C-Eval Zero)尝试在 C-Eval 基础上增加对抗样本或零样本评估难度。
  • 原始论文成为中文 NLP 评测领域高引用基准论文。
  • 面临数据污染挑战:随着原始数据集被广泛公开,后续训练模型可能通过训练数据泄露被动接触题目,导致分数虚高。社区已在讨论构建题目不可见的动态题库作为替代方案。

C-Eval 的技术优势

  • 学科与难度双维度设计:C-Eval 的核心创新在于同时从"学科领域"与"难度层次"两个正交维度组织题目。这使得评测输出不仅是一个总分,而是一个 52×4 的能力矩阵,每个格子代表模型在特定学科的特定难度上的表现。这种粒度在中国高等教育"宽口径、厚基础"的背景下,比 MMLU 的单一学科分类更能捕捉模型的知识结构短板。
  • 中文可复现评测协议:C-Eval 明确规定了 5-shot 与 0-shot 的 Prompt 格式、答案抽取规则和评分标准。相比某些仅提供数据集但不严格约定评测协议的基准,C-Eval 的高规范化程度确保了不同团队、不同时间点的结果具有基本的横向可比性。这是它被广泛采用的关键工程原因。
  • 考试驱动的题目设计:题目来源为真实中国考试(大学期末、考研、执业资格考),而非研究者自编。这意味着题目天然具有:(1)语言真实自然,不带有"数据集语言"的人造感;(2)答案有明确权威标准,不存在主观歧义;(3)与中国教育知识体系对齐,能直接反映模型在中国语境下的知识水平。这也带来了局限——题目时效性受限于考试时间,新兴领域(如 AI 伦理、量子计算等尚未进入标准化考试的学科)覆盖率较低。
  • 评测—诊断—闭有:C-Eval 的技术价值不止于"出一个分数",而在于其学科粒度的诊断能力。一个模型团队在拿到 C-Eval 结果后,可以立即定位到薄弱学科,然后针对性地补充该学科的预训练数据或微调数据。这种从评测到改进再到下一轮评测的闭有,使 C-Eval 成为模型能力迭代的仪表盘而非终点线。

如何使用 C-Eval

入口对照

目的 入口 说明
查看说明与排行榜 https://cevalbenchmark.com/ 官网,浏览定位、排行榜、学科分类
下载数据集与代码 https://github.com/hkust-nlp/ceval GitHub 仓库,完整数据集与评测脚本
阅读论文 https://arxiv.org/abs/2305.10957 arXiv,了解设计原理与基线结果
社区讨论 GitHub Issues、知乎 反馈问题、讨论评测设置

标准评测步骤

  1. 有境准备:克隆仓库,安装 Python 依赖(PyTorch、transformers、datasets 等)。
  2. 数据加载:使用仓库提供的 ceval/ 数据目录,或通过 Hugging Face datasets 加载 ceval/ceval
  3. 配置评测:设置评估参数——模型名称或路径、评测设置(5-shot 或 0-shot)、最大生成长度等。
  4. 运行评测:执行评测脚本,脚本会自动加载模型 → 推理作答 → 抽取答案 → 与标准答案比较 → 计算各学科与总体准确率。
  5. 结果分析:查看输出结果(各学科准确率与总平均),与排行榜对照定位差距。

关键注意事项

  • Prompt 一致性:Prompt 模板的微小变化(如"答案是"与"答案:")可能导致分数波动 1-3 个百分点。确保使用的 Prompt 与官方默认模板一致,否则结果不具可比性。
  • 解码策略:建议使用 greedy decoding(temperature=0)或一致设置。Beam search、采样等策略会导致输出不稳定,影响复现性。
  • 学科加权:排行榜总平均分采用学科加权平均(而非简单算术平均),具体权重因学科题量而异。对照排行榜时应确认加权方式一致。

C-Eval 的产品定价

用户层级 成本项 说明
C 端/个人研究者 免费 数据集与代码完全开源,MIT 许可,零授权费
学术/模型团队 免费 无订阅费或按次计费,支持无限次评测
企业 免费(工具层) 工具层零费用;规模化评测需自备算力集群
商业用途 免费 MIT 许可允许商业使用和二次分发,无额外授权

附带成本:评测的主要开销不在工具本身,而在模型推理算力与工程集成。一次完整 C-Eval 评测(13948 题,5-shot)的算力消耗取决于模型规模——7B 模型约需 0.5-1 GPU 小时(A100),70B 模型约需 4-8 GPU 小时,700B+ 模型可能需 24 小时以上。如需频繁评测(如每次训练 checkpoint 后),总算力成本会快速累积。

C-Eval 的应用场景

  • 模型研发自测:训练或微调中文大模型时,在每次关键 checkpoint 后执行 C-Eval 评测,验证知识与推理能力的迭代方向是否正确。验收重点:对比前后两次评测的学科级变化——总分提升但某个学科大幅下降,可能意味着灾难性遗忘,需要检查训练数据配比。
  • 对外能力公示:在模型发布或升级时,在技术报告或公开页面列出 C-Eval 成绩,作为中文能力的第三方参照。验收重点:明确标注评测设置(5-shot/0-shot、Prompt 版本、打分方式),确保与排行榜对齐;若使用非标准设置,应同时给出标准设置下的分数以便横向比较。
  • 学科诊断与训练指导:通过 C-Eval 的学科粒度结果定位模型的能力短板,指导后续数据采集与训练策略。例如,如果模型在"法学"与"医学"学科上持续偏低,可考虑在预训练阶段增加相应学科的中文语料,或在 SFT 阶段补充该学科的问答对。验收重点:诊断结论需要结合训练数据分布交叉验证——某个学科分数低,可能是该学科知识训练不足,也可能是 C-Eval 题目表述方式与训练数据分布不一致导致的泛化问题。
  • 学术研究与 Benchmark 构建:作为中文 NLP 评测的参照基线,用于对比新提出的评测方法或数据集,或作为跨模型能力对比的标准化平台。验收重点:新提出的评估方法应在 C-Eval 上验证其与模型实际能力之间的相关性。

C-Eval 的适用人群

  • 大模型研究者与算法工程师:需要标准化中文评测来量化模型迭代效果,通过学科粒度诊断指导训练策略。前置条件:具备基础的模型推理有境搭建能力,理解 Prompt 工程与评测协议。
  • 模型评测工程师:负责为团队搭建自动化评测流水线,将 C-Eval 集成到 CI/CD 流程中,持续追踪模型版本的能力变化。前置条件:熟悉 Python 与主流大模型推理框架(Hugging Face Transformers、vLLM 等),能够处理分布式评测场景。
  • 学术研究人员:从事中文 NLP 评测、基准研究与 cross-model 分析,以 C-Eval 为基线对照新方法或新数据集。前置条件:理解评测方法论,注意数据污染问题对实验结果的影响。
  • 技术选型评估者(CTO/技术 VP):在采购或引入基础模型前,将 C-Eval 分数作为中文能力的一个量化维度纳入评估矩阵。前置条件:认识到单一基准的局限性,需结合场景化评估(如产品功能测试、小规模灰度验证)做综合判断。
  • 不适配边界:(1)需要直接获得"可用产品功能"的普通用户——C-Eval 是评测基准而非可交互应用,不能直接使用;(2)需要评估模型在对话质量、安全性、创意生成等开放任务上的表现的团队——C-Eval 的选择题形式无法覆盖生成式能力的测度;(3)担心数据污染的团队——静态题库可能被预训练数据覆盖,建议结合其他不可见题库(如内部自建评测集)做交叉验证;(4)需要在非中文场景下评估模型的团队——C-Eval 完全面向中文与中国学科体系,英文模型评测应优先使用 MMLU 或同类英文基准。

总结与展望

C-Eval 以 13948 道题52 个学科、四个难度层次构成了当前最系统化的中文大模型评估基准之一。它的核心竞争力在于学科与难度双维度的精细化设计、可复现的评测协议以及持续更新的排行榜——这三者共同将 C-Eval 从一份数据集提升为一个标准化的评测生态。对于中文基础模型团队,C-Eval 既是"入学考试"也是"诊断工具":总分衡量水平层级,学科级分数揭示短板方向。

当前限制:(1)静态题库面临数据污染风险,随着题库被广泛公开,后训练模型可能通过训练数据泄露被动获得题目,导致分数虚高,降低基准的可信度;(2)选择题形式无法覆盖生成式任务的评估需求(如翻译质量、代码功能正确性、创意写作);(3)学科覆盖偏向传统知识体系,对 AI 伦理、量子计算、新兴工程领域等前瞻性学科覆盖不足;(4)排行榜的提交审核依赖自治机制,各模型分数间的可比性受评测设置差异影响。

未来方向:社区已在探索 C-Eval 的动态题库版本(如不可公开题目池、适应性出题),以缓解数据污染问题;同时,多模态版本与中英双语扩展也是自然延伸方向。持续的社区维护与题目更新是 C-Eval 保持其基准地位的关键。

采购/采用风险评估:对于正在评估基础模型或自研大模型的团队,C-Eval 是低成本、高信噪比的入门评测工具——零授权费、开源可复现、学科粒度诊断功能可直接指导训练。但不应将其作为唯一的评估标准。建议在模型选型或研发迭代中,采用"C-Eval + 若干场景化内部评测 + 小规模人工评估"的多维评估组合,以降低单一基准偏差带来的选型风险。团队在使用 C-Eval 分数做横向对比时,务必确认所有分数均在同一评测设置(5-shot/0-shot、同一 Prompt 模板)下获得,避免因设置差异导致误导性结论。

相关工具:Hugging FaceReplicate

版本信息

  • C-Eval 评估套件(2023) :公开发布的中文大模型多学科评估套件,含 13948 道多项选择题52 个学科与四个难度层次,并提供在线排行榜持续收录模型成绩。官方页面标注年份为 2023,精确日期以论文与仓库为准。
  • C-Eval 论文与数据集首发 :C-Eval 随论文与数据集首次公开,建立题库、学科划分与评测协议,并上线排行榜。官方未单列后续小版本号,迭代主要体现为排行榜持续更新。

用户评价

  • 加载评价中...