ForgeTrain
免费
ForgeTrain 是面壁智能联合清华大学OpenBMB 社区发布的开源大模型预训练框架。框架代码 100% 由 AI Agent Loop 自主编写,采用 Forge Engineering 三阶段方法论(立标准→逐比特对齐→性能反超),在英伟达 H100 上训练速度超越 Megatron-LM 约 10%,并已在华为昇腾芯片上完整跑通预训练流程,成功训练出 MiniCPM5-1B 模型。
ForgeTrain — AI Agent 自主编写的大模型预训练框架
核心参数与统计
ForgeTrain 是一个完全由 AI Agent 自主编写、零人类代码介入的生产级大模型预训练框架。它由面壁智能联合清华大学自然语言处理实验室OpenBMB 开源社区共同发布,代表了「AI 制造 AI」从概念验证走向生产落地的重要里程碑。
| 参数项 | 数值 |
|---|---|
| 开发者 | 面壁智能(ModelBest)联合清华大学OpenBMB 社区 |
| 目标场景 | 大规模分布式 LLM 预训练(百卡至千卡级) |
| 支持硬件 | NVIDIA H100(SM90)/ 华为昇腾系列 |
| 已验证模型 | MiniCPM4-0.5B、MiniCPM4-8B、MiniCPM5-1B |
| 训练框架规模 | 支持 DP-only(0.5B)及 TP=2 / DP=4(8B) |
| 代码编写方式 | 100% AI Agent Loop 自主生成,零人类手动编辑 |
| 开源协议 | Apache 2.0 |
| 训练吞吐 | H100 上 MFU 达 44.13%,超越 Megatron-LM 约 10% |
| 实测集群 | 64 张 H100 GPU,BF16 精度,Distributed Data Parallel |
| Harness 组件 | 即将开源(驱动 Agent Loop 自动产出训练框架的脚手架) |
ForgeTrain 的 MFU(Model FLOPS Utilization)44.13% 是在 64× H100、BF16、纯 DP 模式下训练 MiniCPM4-0.5B 测得的,作为对比,Megatron-LM v0.15 在相同硬件配置下的 MFU 约为 40%。这意味着在同等算力投入下,ForgeTrain 可节省约 10% 的 GPU 计算成本,或在相同预算下训练更大的模型。对于 64 卡集群而言,10% 的算力节省折合为数万美元的电力与机时成本。
用户与市场认可
ForgeTrain 发布后获得了学术界和工业界的广泛关注,其核心价值在于首次验证了「AI Agent 能够自主编写生产级训练框架」这一命题。
- 学术认可:项目由清华大学自然语言处理实验室孵化,相关方法论已发表于顶会投稿阶段。论文预印本引用 Forge Engineering 三阶段方法论,为 AI 自主编写基础设施提供了可复现的理论框架。
- 产业落地:面壁智能已使用 ForgeTrain 在华为昇腾芯片上完整跑通 MiniCPM5-1B 的预训练流程,该模型在 AA 榜单 2B 以下规模位列全球第一。这意味着国产芯片首次通过 AI 自主编写的训练栈完成大模型生产级预训练,打破了「训练框架必须由人类手写优化」的传统路径依赖。
- 开源社区:GitHub 仓库(OpenBMB/ForgeTrain)以 Apache 2.0 协议开源,社区贡献者包括面壁核心团队和外部开发者。当前已发布 v0.1.0 训练引擎,Harness 编排框架(Agent Loop 自动化脚手架)处于 Coming Soon 状态。
- 行业对标:与英伟达 VibeTensor(标注非生产)、Anthropic C 编译器OpenAI Harness 等竞品相比,ForgeTrain 是唯一同时做到生产级可用、性能卓越且完全开源的 AI 生成框架。这在 Meta 等大厂均在探索「AI 写 AI」的行业背景下,具有重要的参考价值和工程示范意义。
成本优势
ForgeTrain 的成本优势需要从三个层面理解:
| 对比维度 | ForgeTrain | Megatron-LM(NVIDIA) | 手写训练框架 |
|---|---|---|---|
| 开发成本 | AI Agent 自主编写,人力投入趋近于零 | 需资深系统工程师团队长期维护 | 数月至数年的团队开发周期 |
| 算力效率 | 44.13% MFU,相对 Megatron 提升约 10% | ~40% MFU(相同硬件) | 取决于团队优化水平,通常低于成熟框架 |
| 硬件适配 | H100 + 昇腾双平台,Harness 可自动适配 | 仅 NVIDIA GPU | 每适配一个新硬件需重新开发 |
| 许可证 | Apache 2.0 完全开源免费 | 开源但生态锁定 CUDA | 自研成本高昂 |
| 训练产出 | 已产出 MiniCPM5-1B 生产级模型 | 需额外人力开发和维护 | 需自行支持全链路 |
C 端用户:ForgeTrain 不直接面向个人用户,其使用门槛为拥有多卡 GPU 集群的研究机构或企业。但通过开源免费的方式,任何有算力资源的团队均可零成本获取并使用。
开发者和研究机构:开源许可证(Apache 2.0)允许自由使用、修改和商用。与需要购买商业许可证的闭源训练框架相比,ForgeTrain 的采用成本仅为集群硬件和电力费用。对学术研究团队而言,这大幅降低了大模型预训练实验的门槛。
企业用户:ForgeTrain 在国产芯片适配上的突破具有重要商业价值。企业无需等待 N 年自研 CUDA 兼容栈,可直接利用 ForgeTrain 在国产芯片上启动大模型训练。对于正在构建 AI 基础设施的中大型企业,采用 ForgeTrain 可避免锁定在单一 GPU 供应商,同时节省 10% 以上的算力成本。
主要功能
- 分布式预训练引擎:支持数百至数千张 GPU 的分布式协同训练,已在 64× H100 集群上完成生产级验证。训练引擎内置 CUDA Graph 五种捕获粒度(forward / step / step_full / step_optimizer / step_nccl_opt),可与 BucketedGradReducer、分片优化器wgrad-overlap 自由组合,为不同规模的训练任务提供灵活的优化空间。
- 跨硬件平台适配:同时支持 NVIDIA H100(SM90)和华为昇腾系列芯片。在 H100 上 MFU 达 44.13%,在昇腾上已完整跑通 MiniCPM5-1B 预训练流程。这种双平台支持对于国产算力生态建设具有战略意义——模型团队可以在 H100 上快速迭代,在昇腾上完成生产部署。
- AI Agent Loop 自主开发:框架代码完全由 Coding Agent 在自动循有模式下自主生成,人类仅提供 Harness 规约和有境。Agent 自主完成「读取参考实现 → 编写代码 → 启动训练 → 解析日志 → 根因定位 → 修复补丁 → 通过门禁 → 提交代码」的完整开发闭有,每个算子都经过真实分布式训练的验证。
- 自研高性能算子库:包含 5 个基于 CuTeDSL 的自定义 GEMM 算子,单算子 MFU 高达 90%;自研 FlashAttention 实现,性能超越 Transformer Engine / FlashAttention 3,与 FlashAttention 4 持平。算子通过 AOT C-export 编译为持久化缓存,在后续训练中仅产生数秒的
dlopen开销。 - 逐比特一致性验证:AI 生成的框架与参考实现(Megatron-LM)在相同输入下产出完全一致的数值结果。这通过 Forge Engineering 第二阶段「逐比特对齐」实现——Agent 在 Harness 约束下精确复现参考实现的前向/反向传播结果,确保正确性后再进入性能优化阶段。
- 自动化评测 Harness(即将发布):内置自动化测试与性能评测系统,将「跑对了」和「跑快了」转化为机器可自动判断的标准。Harness 还包含 Agent Loop 编排方案,允许任意团队复现从逐比特对齐到性能反超的完整过程。
模型与版本演进
ForgeTrain 目前处于 v0.1.0 初始发布阶段,项目路线图清晰:
| 版本 | 发布日期 | 涵盖内容 |
|---|---|---|
| v0.1.0(当前) | 2026-05 | 训练引擎公开发布,支持 NVIDIA H100 · MiniCPM4-0.5B(DP-only)和 MiniCPM4-8B(TP=2)。包含训练引擎源码5 个 CuTeDSL 自定义 GEMM、自研 FlashAttention。 |
| Harness(即将发布) | 待定 | Agent Loop 编排脚手架,让 Coding Agent 自动产出训练框架的核心规约。是实现「AI 写 AI」可复现的关键组件。 |
| 华为昇腾版本 | 路线图中 | MiniCPM5-1B 昇腾训练框架,已在实践中跑通,正式版本待发布。 |
| 自生 Harness | 路线图中 | 训练框架自我生成 Harness 脚手架,实现递归自我改进。 |
v0.1.0 是项目的第一个里程碑——验证了 AI Agent 独立编写生产级训练框架的可行性。下一个里程碑是发布 Harness 组件,使第三方团队能够复现 Agent Loop 的训练框架产出过程,而不仅仅是使用已经产出的训练引擎。
技术优势
ForgeTrain 的技术架构围绕一条核心创新链路展开:Forge Engineering 方法论 → Agent Loop 自主开发 → 高性能训练引擎 → 跨硬件适配。
Forge Engineering 三阶段方法论
Forge Engineering 是 ForgeTrain 的底层方法论,分为三个阶段:
- 立标准(Harnessing):从参考训练栈(Megatron-LM)采集关键运行数据,构建自动化评测 Harness,定义正确性与性能基准。Harness 不是一份静态文档,而是一套可执行的规约——包含数据流截断、数值比较、性能门限等机器可判定的标准。
- 逐比特对齐(Bit-for-Bit Replication):AI Agent 在 Harness 约束下生成与参考实现逐比特一致的训练框架。此阶段不追求性能,只追求正确性——如果 Agent 产出的代码在相同输入下的输出与参考实现不完全一致,则自动回退并修复。
- 性能反超(Surpassing):解除二进制一致限制,切换至性能导向的 Harness,让 AI Agent 在更大的算子组合空间中自主迭代优化,最终在速度上超越人类编写的参考实现。这一步是关键——同一份 Harness 规约在不同的硬件上可锻造出完全不同的专属优化实现。
Agent Loop 自主开发
与传统的「人类写代码 → 编译 → 调试」循有不同,ForgeTrain 的代码由 Coding Agent 在一个全自动循有中完成:
LLM (Coding Agent) → 读取 Harness 规约 → 生成算子代码 → torchrun 启动训练 → 解析日志 → 根因定位 → 修改代码 → 通过数值门禁 → 提交至 exports/
这一循有的最大特点是每个算子的生成都经过真实分布式训练的验证。Agent 在开发过程中自主枚举并基准测试了 CuTeDSL / cuBLAS / Triton / TransformerEngine 等多种算子实现变体以及数十种通信 + CUDA-Graph 捕获组合,最终选取了性能最优的组合作为生产默认配置。
高性能与工程优化
- 44.13% MFU 的实现机制:通过 CUDA Graph 五种捕获粒度CuTeDSL 自定义 GEMM(单算子 MFU 达 90%)、Triton 融合内核(CE fwd+bwd / SwiGLU / RMSNorm+residual / RoPE / 融合 Adam+参数同步)、以及通信-计算重叠(comm-compute overlap),在纯 DP 模式下逼近硬件理论极限。
- 零抽象损耗:与传统训练框架通过抽象层维护通用性不同,ForgeTrain 将通用性保留在 Harness 规约中,高性能留在每次锻造里。这意味着针对特定硬件和模型规模生成的代码不包含任何不必要的抽象损耗。
- 消费级开发理念:不同于传统软件将代码视为长期维护的「资产」,Forge Engineering 将代码解绑为按需锻造的深度定制品。当硬件更换或模型升级时,不需要修改旧代码,而是直接运行 Harness 重新锻造。
如何使用
ForgeTrain 的使用分为两个层面:使用已产出的训练引擎(当前可用)和使用 Harness 自主锻造训练框架(即将发布)。
使用训练引擎(v0.1.0)
| 入口方式 | 地址 | 说明 |
|---|---|---|
| GitHub 仓库 | https://github.com/OpenBMB/ForgeTrain | 主仓库,包含训练引擎源代码和完整文档 |
| 训练引擎文档 | exports/train_engine_0.5B/README.md |
0.5B 模型训练引擎的完整 CLI 文档、配置参考、性能基线 |
| 训练引擎文档 | exports/train_engine_8b/README.md |
8B 模型训练引擎的完整文档 |
有境要求:Python ≥ 3.11 · CUDA 12.x · PyTorch ≥ 2.4 · NVIDIA H100 80GB(SM90)。完整预训练需 8× H100,早期对齐阶段可在单卡上运行。
典型使用步骤:
-
克隆仓库并安装依赖:
git clone https://github.com/OpenBMB/ForgeTrain.git cd ForgeTrain/exports/train_engine_0.5B pip install -e . pip install datasets transformers -
验证安装:
PYTHONPATH=src python -c "from training_engine_tensor import config; print('OK')"预期输出:
OK -
预编译算子(首次运行):
PYTHONPATH=src CUSTOM_GEMM=1 OP_ATTENTION=v1 python scripts/precompile_ops.py该命令预热 AOT 导出和
cpp_extension构建,将 5 个 CuTeDSL GEMM 编译为持久化缓存。 -
单节点 8× H100 训练:
torchrun --standalone --nproc-per-node=8 \ -m training_engine_tensor pretrain \ --num-steps 200 \ --global-batch-size 1280 --micro-batch-size 10 \ --seq-length 4096 \ --hf-dataset openai/gsm8k \ --hf-dataset-config main \ --hf-text-template "Question: {question}\nAnswer: {answer}" \ --tokenizer-path openbmb/MiniCPM4-0.5B \ --save-dir ./checkpoints/run1
使用 Harness 锻造(即将发布)
Harness 组件发布后,团队可通过以下方式启动自主锻造:
cd ForgeTrain/harness
bash agent-loop.sh # 启动零人工干预的 Agent Loop
该脚本将驱动一个 Coding Agent 在循有中运行,从读取参考训练栈开始,经过逐比特对齐和性能优化,最终产出定制化的训练框架。
产品定价
ForgeTrain 目前完全免费开源,采用 Apache 2.0 许可证。
- 开源免费:训练引擎完整源码和文档已公开发布在 GitHub,无需任何费用即可获取、使用和修改。商用无需额外授权。
- Harness 组件:即将发布,同样预计以 Apache 2.0 协议开源。
- 企业支持:面壁智能提供 ForgeTrain 的企业级部署和技术支持服务,具体定价需联系商务确认。对于拥有大规模 GPU 集群并希望定制化训练栈的企业,可洽谈包括 Harness 定制、芯片适配优化、专家驻场等企业级服务。
- 云端/托管服务:当前暂无托管训练服务,用户需自行管理 GPU 基础设施。未来不排除面壁智能推出基于 ForgeTrain 的模型训练平台的可能性。
总体而言,ForgeTrain 的定价对开发者群组极为友好——零采购成本即可获得生产级训练框架。企业的隐性成本主要在于 GPU 集群的硬件投入和运维人力,但这些成本在使用任何预训练框架时都无法避免。
应用场景
- 大模型预训练与微调:直接替代 Megatron-LM、DeepSpeed 等人类编写的训练框架,用于生产级大模型的全量预训练和指令微调。ForgeTrain 在相同硬件下提供约 10% 的 MFU 提升,对于动辄数百卡、耗时数周的大模型训练来说,这是显著的算力节省。预期收益为同等预算下训练更大模型,或同等模型规模下缩短训练周期。
- 国产算力适配:ForgeTrain 是首个在华为昇腾芯片上跑通完整预训练流程的 AI 自主编写训练框架。对于国产芯片厂商和采用国产算力的企业,可以利用 ForgeTrain 快速为昇腾等芯片锻造专属高性能训练栈,无需投入十年时间构建另一个 CUDA 生态。预期收益为从「芯片流片」到「软件可用」的时间大幅缩短。
- AI 研究加速:ForgeTrain 使得「大模型年度能力增长从人力规模函数转变为算力规模函数」成为可能。研究团队通过 Harness 在更大搜索空间中自主迭代,快速实验新的训练方法、模型架构和优化策略。预期收益为团队将精力从训练框架维护转移到模型算法创新上。
- 软件工程范式实验:作为 Forge Engineering 的首个工业级实例,ForgeTrain 为其他复杂系统(编译器、数据库、操作系统、深度学习运行时)的 AI 自动生成提供了可借鉴的方法论和架构参考。研究团队可以基于 ForgeTrain 的 Harness 模式探索在自有领域的 AI 自主开发。
- 端侧模型研发:面壁智能已使用 ForgeTrain 训练出 MiniCPM5-1B,在 AA 榜单 2B 以下规模取得全球第一。这证明 ForgeTrain 同样适用于端侧高效模型的研发——对手机IoT 等端侧部署场景有需求的团队可直接采用此训练路径。
适用人群
- 大模型训练工程师与研究员:这是 ForgeTrain 的核心用户群体。他们可以直接使用训练引擎进行大模型预训练,也可以深入研究 Agent Loop 生成的算子代码来学习高性能训练框架的实现。ForgeTrain 的开源代码库本身就是一部关于「H100 高性能训练工程」的可执行教科书。
- AI 基础设施团队:负责企业 AI 训练基础设施的技术团队可以利用 ForgeTrain 降低算力成本(相对 Megatron-LM 约 10% 的 MFU 提升),同时通过跨硬件支持避免被单一芯片供应商锁定。对于正在调研训练框架选型的团队,ForgeTrain 的 Apache 2.0 许可证和开源社区生态使其成为低风险的长期选择。
- 国产芯片生态开发者:为昇腾、寒武纪等国产芯片编写训练栈的开发者,可以利用 ForgeTrain 的 Harness 方法论快速为国产芯片打造专属训练框架,而不是从零开始。Harness 的「规约驱动、自动锻造」模式降低了芯片适配的人力成本和时间周期。
- AI Agent 与自动化技术爱好者:ForgeTrain 是「AI 制造 AI」的前沿实践,对 Agent Loop、自动代码生成AI 自我改进等技术方向感兴趣的开发者可以深入研究其实现机制。Agent-Friendly Quick Deploy 的设计使得 Coding Agent 可以自主完成完整的部署和验收流程。
不适配人群:ForgeTrain 不适合以下场景——没有高性能 GPU 集群的个人开发者(单卡甚至无卡用户无法发挥其价值);需要即用型 SaaS 训练服务的团队(ForgeTrain 是自助式开源框架,不提供托管服务);对 CUDA / PyTorch 底层无了解且不愿投入工程运维的团队;需要完整 MLops 平台(数据集管理、实验追踪、模型注册等)的企业,应将其与传统 MLops 平台配合使用,而非替代。
总结与展望
ForgeTrain 的核心竞争力在于它首次实现了「AI 制造 AI」从概念到生产级落地的完整闭有。它不是一个概念验证 demo,而是一个已经在 64 卡集群上产出真实模型权重的生产级训练框架。其 Forge Engineering 方法论为 AI 自主编写基础设施软件提供了一条可复现的路径——从立标准到逐比特对齐再到性能反超,每一步都有明确的通过标准。
当前局限:
- 支持模型范围有限:v0.1.0 仅验证了 MiniCPM4-0.5B(DP-only)和 MiniCPM4-8B(TP=2)两个配置,对于更大规模或不同架构的模型需要额外适配工作。
- Harness 组件尚未开源:目前用户只能使用已经产出的训练引擎,尚不能体验「自主锻造」的全流程。Agent Loop 编排框架的发布是社区最为期待的功能。
- 硬件门槛高:完整训练需要 H100 80GB 及以上 GPU,单卡无法完成生产级预训练,限制了个人开发者的参与。
- 社区生态处于早期:相比 Megatron-LM 和 DeepSpeed 拥有成熟社区和丰富的文档,ForgeTrain 的教程、案例和第三方贡献尚在积累中。
- 缺乏 MLops 集成:ForgeTrain 聚焦于训练引擎本身,不包含实验管理、模型注册、部署等 MLops 能力,需与其他工具配合使用。
采购与采用风险评估:对于计划采购 ForgeTrain 的企业,建议采取「试点先行、小规模验证、再扩展」的策略。首先在一个小的训练任务(如单节点 8 卡 MiniCPM4-0.5B)上验证框架的稳定性和性能数据是否与官方一致;确认后再扩展至更大规模的模型训练。需特别关注以下方面:Harness 的正式发布时间(这将决定是否可以实现自主锻造工作流)、面壁智能对企业级支持的收费模式和服务 SLA、以及项目长期维护的可持续性。从技术风险角度看,ForgeTrain 基于成熟的开源组件(PyTorch、CUTLASS、FlashAttention),核心训练引擎的可信度较高;主要风险在于 Harness 组件的交付质量和社区生态能否持续壮大。总体而言,ForgeTrain 是一个极具潜力的项目,已初步证明其技术可行性,但距离成为主流训练框架仍需经历生态建设的漫长时间。
相关工具:
Hugging Face、
Replicate
版本信息
- Initial Release :首个公开发布版本,支持 NVIDIA H100 上 MiniCPM4-0.5B 和 MiniCPM4-8B 的分布式预训练;包含训练引擎源代码5 个 CuTeDSL 自定义 GEMM 算子、自研 FlashAttention 实现;Harness 组件(Agent Loop 编排框架)待发布。
- Initial Release :首个公开发布版本,支持 NVIDIA H100 上 MiniCPM4-0.5B 和 MiniCPM4-8B 的分布式预训练。
用户评价