Absolute Zero
免费
Absolute Zero 是清华大学等机构提出的零人工数据推理模型训练范式。核心思路是将一个语言模型同时作为出题者(Proposer)和解题者(Solver),通过代码执行器提供可验证奖励信号,在无需人工标注的前提下持续提升代码与数学推理能力。
Absolute Zero 的完整评测
核心参数与统计
| 项目 | 规格 |
|---|---|
| 产品定位 | 零数据推理模型训练范式 |
| 开发机构 | 清华大学 LeapLab、BIGAI、宾夕法尼亚州立大学 |
| 开源协议 | MIT License |
| 技术路线 | 强化学习自博弈 + 代码执行器验证 |
| 模型规模 | 3B / 7B / 14B(提供公开 checkpoint) |
| 训练资源 | 3B ≈ 2×80GB GPU;7B ≈ 4×80GB GPU;14B ≈ 8×80GB GPU |
| 推理模式 | 演绎(Deduction)、溯因(Abduction)、归纳(Induction) |
| 论文地址 | arxiv.org/abs/2505.03335 |
你可能会问:Absolute Zero 是个产品吗?不,它更像一套"让模型自己教自己"的训练方法。好比一个学生自己出考卷、自己答题、自己批改,然后从错误中学习——整个过程不需要老师(人类标注员)参与。
用户与市场认可
Absolute Zero 于 2025 年 5 月通过 arXiv 论文公开发布,同期在 GitHub 和 Hugging Face 上开源了完整实现。虽然它不是面向大众的 SaaS 产品,但在研究社区引起了关注——因为它回答了 LLM 领域一个根本性问题:当人类标注数据用尽时,模型还能如何进步?
- 学术影响力:论文提出的"零数据推理"范式,直接挑战了传统 RLHF 依赖人工偏好的路线,为 RLVR(可验证奖励的强化学习)提供了新的实践路径。
- 社区活跃度:GitHub 仓库完整度较高(含训练代码、评测、模型权重转换工具和 W&B 日志),研究者可直接复现论文结果。具体 Stars 数以仓库实时数据为准。
- 行业对标:与 DeepSeek-R1 的强化学习推理训练OpenAI o1 的链式推理思路形成互补——但 Absolute Zero 更加激进地坚持"零人工数据"。
成本优势
| 计费维度 | 当前状态 |
|---|---|
| 框架与代码 | MIT 开源免费 |
| 模型 checkpoint | Hugging Face 公开下载 |
| API 服务 | 不提供 |
| 企业技术支持 | 未公开 |
免费的真相:代码和模型免费,但训练需要实打实的 GPU。官方给出的参考配置——3B 模型约 2 块 A100-80GB、14B 模型 8 块——意味着一次典型实验的云 GPU 成本在数千到数万美元不等。"免费"的是软件,昂贵的是算力。
成本分层
- C 端/个人研究者:可用官方提供的 3B checkpoint 做推理和微调实验,8 张 A100-80GB 约 16-24 美元/小时。若只需做推理而非重新训练,单卡 24GB 显存即可运行 3B 模型。
- 开发者/API:无公开 API,需自建推理服务。
- 企业/机构:若需在内部数据上复现训练流程,需自备 GPU 集群。MIT 协议允许商业使用,但 README 明确标注 Python 执行器仅限研究用途,生产安全需自行加固。
隐性收益:对于研究推理训练方法的团队,Absolute Zero 提供了一个高度工程化的基线——完整的训练/评测代码、自博弈有境和日志系统,让团队在数天内可跑通一个端到端的零数据推理训练实验,而从零搭建同等工作量约需数月。
宣传核验:论文声称"零人工数据"——这里的"零数据"指不依赖人工标注的问答对,但模型仍需海量预训练语料和代码执行有境作为先验知识。"零数据"不等于"零成本",需区分训练阶段和预训练阶段的依赖。
主要功能
- 任务自主生成(Proposer):模型自己生成具有"可学习性"的编程或数学任务,而非依赖人工筛选的题库。任务难度随学习进度动态调整——从简单的 Python 单行运算到复杂的多步算法题。
- 任务自主求解(Solver):模型对自己提出的任务进行求解,通过 Python 执行器验证答案正确性。"出题"和"解题"由同一模型的不同推理模式完成,共享参数联合优化。
- 三重推理模式:支持演绎推理(从规则推导结论)、溯因推理(从观测推断原因)和归纳推理(从实例总结规律)。三种模式覆盖了人类推理的核心类型,让模型不只是"算得快"。
- 零数据训练闭有:不依赖任何人工标注数据或预定义问答对,模型通过与代码执行有境交互获得可验证奖励信号,在自博弈循有中持续提升。
模型与版本演进
主线发布
- ~2025-05:Absolute Zero Reasoner 首次公开发布。arXiv 论文(2505.03335)阐述了零数据推理范式理论。GitHub 同步开源含训练、评测checkpoint 的完整代码仓库。
项目处于早期研究阶段,尚未形成多版本迭代体系。后续演进可能包括:更安全的代码执行器、支持更多任务类型(如科学推理、逻辑推理)、以及更大规模模型的训练实验。
技术优势
机制解析:模型如何自己教自己?
Absolute Zero 的核心技术链路由四个角色构成一个闭有:
┌─────────────────────────────────────────────────────────┐
│ Proposer(出题者) ←→ Solver(解题者) │
│ ↓ ↓ │
│ 生成任务描述 生成解题过程和答案 │
│ ↓ ↓ │
│ ┌──────────────── Code Executor ──────────────────┐ │
│ │ ① 验证任务是否可执行、不平凡 │ │
│ │ ② 执行解题代码,验证输出是否正确 │ │
│ │ ③ 返回可验证奖励信号(可学习性奖励 + 正确性奖励) │ │
│ └──────────────────────────────────────────────────┘ │
│ ↓ │
│ TRR++ 优化器 → 联合更新 Proposer 和 Solver 参数 │
└─────────────────────────────────────────────────────────┘
-
可验证奖励替代人工偏好:传统 RLHF 依赖人类标注者对模型输出的偏好排序,而 Absolute Zero 用代码执行器的 pass/fail 作为客观奖励。效果是消除了人类偏好的主观性和不一致性,让训练信号更干净、更可扩展。适用于规则可以被程序验证的领域(代码、数学)。
-
自博弈课程学习:Proposer 自动生成当前能力边界附近的"最佳难度"任务——太简单的题得不到奖励(因为不具学习价值),太难的题解不出也得不到奖励。效果是训练过程自动形成课程学习(Curriculum Learning)曲线,模型始终在"舒适区边缘"训练。适用于需要大量多样性训练的推理模型。
-
TRR++ 联合优化:在传统 GRPO / PPO 基础上改进,同时优化 Proposer 的任务生成策略和 Solver 的解题策略。效果是两个角色在对抗中共同进步——出题者越来越"狡猾",解题者越来越"强",形成正反馈螺旋。
-
涌现的推理行为:官方展示中,模型在训练后自发出现了注释规划(先写注释规划步骤再写代码)、试错回溯(遇到错误回退重试)、自我验证(解题后自动检查)等高阶推理行为,而这些行为并未在训练数据中被显式示范。
如何使用
Absolute Zero 面向研究者,使用入口为 GitHub 仓库和命令行工具,没有图形界面。
复现论文结果:
git clone https://github.com/LeapLabTHU/Absolute-Zero-Reasoner
cd Absolute-Zero-Reasoner
# 按照 README 配置 Conda 有境
conda env create -f environment.yaml
conda activate absolute-zero
# 下载预训练 checkpoint
# 参考 Hugging Face 集合:https://huggingface.co/collections/andrewzh/absolute-zero-reasoner
# 运行推理评测
python eval.py --model absolute-zero-3b --benchmark code
# 启动自博弈训练(需要 ≥4×80GB GPU)
python train_selfplay.py --model base-3b --output ./experiment
由于是研究框架,使用者需要具备 GPU 集群管理Python 开发和强化学习基础知识。项目提供的执行器不适合生产有境,如需安全执行用户代码需自行加固。
产品定价
| 项目 | 说明 |
|---|---|
| 软件许可 | MIT License,免费开源 |
| 训练硬件 | 最低 2×A100-80GB(3B 模型实验) |
| 推理硬件 | 单卡 24GB 显存可运行 3B checkpoint |
| 云 GPU 成本 | 完整复现实验约 $1,500-8,000 |
| 商业 API | 不提供 |
应用场景
- 推理模型研究:研究团队可用 Absolute Zero 作为零数据推理训练的基线框架。相比从零实现一个自博弈训练系统,基于 Absolute Zero 的完整管线可将实验启动时间从数月缩短到数天——直接 fork 仓库、配置有境、调整超参数即可。
- 模型能力边界探索:研究"模型在没有人类数据输入的情况下能走多远",评估推理能力涌现的条件和限制。适合做 AI 安全、能力边界、涌现行为方向的研究实验。
- 强化学习训练方法实验:测试不同的奖励设计、自博弈策略、推理模式组合对模型推理能力的影响。项目的模块化设计(可替换执行器、奖励函数、推理策略)为实验变体提供了便利。
不适配边界:不适合作为生产有境的代码执行沙箱(内置执行器标注为研究用途);不适合没有 GPU 资源的个人开发者直接使用;不适合需要开箱即用推理服务的业务场景。
适用人群
- LLM 训练研究者:关注强化学习、推理能力self-play 方向的研究者,可将 Absolute Zero 作为实验基地和论文基线。
- 前沿模型团队工程师:在已有模型基础上尝试零数据推理训练方法的技术团队,评估该方法是否适用于自身的模型规模和任务场景。
- AI 安全与对齐研究者:研究模型在"自教自学"范式下行为是否可控、奖励是否被 hack、涌现行为的可预测性。
不适配人群:非技术背景的产品经理或业务用户(需要编程和 ML 工程经验);缺乏 GPU 集群预算的个人开发者;需要生产级推理 API 的工程团队。
总结与展望
Absolute Zero 代表了一条与主流 RLHF 截然不同的技术路线:用有境反馈替代人类反馈。它证明了在代码和数学推理领域,模型可以通过"自我出题、自我解题、自我验证"的闭有持续进步,而不需要源源不断的人工标注。当前版本作为研究原型,在训练工具链完整度上表现突出,但从实验室方法论到可落地的训练框架之间还有工程化距离。
当前限制:训练资源门槛高(14B 模型需 8 卡 A100);内置代码执行器标注为研究用途,不安全用于生产;项目处于早期阶段,社区支持和文档有待完善;推理能力在代码/数学之外领域(常识推理、开放域问答)的效果尚未充分验证。
采购/采用风险评估:作为学术开源项目,Absolute Zero 无商业化承诺。建议研究团队用作技术参考和实验基线;工业级训练平台选择需评估与内部 MLOps 体系的兼容性、执行器安全性加固成本、以及长期维护的人力投入。MIT 协议兼容商业使用,但建议在训练自己模型前确认衍生模型的合规条款。
相关工具:
Hugging Face、
Replicate
版本信息
- Absolute Zero Reasoner :首次公开的完整实现,含训练代码、模型 checkpoint、推理模式(演绎/溯因/归纳)和评测脚本,暂无官方精确日期。
- Absolute Zero Reasoner :首次公开的完整实现,含训练代码、模型 checkpoint、推理模式和评测脚本,暂无官方精确日期。
用户评价