百川M2
免费
百川M2是百川智能推出的新一代大语言模型,在中文理解、知识问答和推理能力上持续迭代。由搜狗前CEO王小川创立,从开源Baichuan系列演进到商业版M2。
百川M2
百川M2的核心参数与统计
Baichuan-M2 是百川智能推出的医疗增强推理模型(Medically-enhanced Reasoning Model),专为真实世界的医疗推理任务设计。它基于 Qwen2.5-32B 基座,通过创新的大型验证器系统(Large Verifier System)进行医疗领域后训练对齐,在保持通用能力的同时实现了医疗效果的突破性提升。这不是一个通用聊天机器人,而是一个面向医疗场景的垂直推理模型。
| 参数 | 官方可核验信息 |
|---|---|
| 产品定位 | 医疗增强推理模型 |
| 模型架构 | 基于 Qwen2.5-32B 的 Dense 架构 |
| 参数量 | 320 亿(32B) |
| 上下文长度 | 32K tokens |
| 开源许可 | Apache 2.0(可商用) |
| 核心评测 | HealthBench 60.1(全球开源医疗模型第一) |
| 部署门槛 | 单张 RTX 4090(4bit 量化) |
| MTP 加速 | 单用户场景 token 吞吐提升 58.5% |
| 国产算力 | 已适配华为昇腾 910B(8bit 量化) |
| 官方入口 | baichuan-ai.com |
| 开源仓库 | github.com/baichuan-inc/Baichuan-M2-32B |
| 论文 | arXiv:2509.02208 |
HealthBench 对比:Baichuan-M2 在 OpenAI 发布的 HealthBench 医疗评测集上以 60.1 分超越所有开源模型及众多前沿闭源模型(包括 o3、Grok 3、Gemini 2.5 Pro、GPT-4.1),是当前最接近 GPT-5 医疗能力的开源大模型。在 HealthBench Hard 子集上,Baichuan-M2 和 GPT-5 是目前全球仅有的两个得分超过 32 分的模型。
| 模型 | HealthBench | HealthBench Hard | HealthBench Consensus |
|---|---|---|---|
| Baichuan-M2 (32B) | 60.1 | 34.7 | 91.5 |
| gpt-oss-120b | 57.6 | 30.0 | 90.0 |
| Qwen3-235B-A22B | 55.2 | 25.9 | 90.6 |
| DeepSeek-R1-0528 | 53.6 | 22.6 | 91.5 |
| GLM-4.5 | 47.8 | 18.7 | 85.3 |
| Kimi-K2 | 43.0 | 10.7 | 90.9 |
硬件效率的实际含义:32B 参数量配合 4bit 量化可在单张 RTX 4090(24GB 显存)上完成推理,这意味着个体开发者或小型诊所也能负担私有化部署——无需多卡集群。量化后的精度在医疗和通用基准上几乎无损。对于需要大规模并发的高频场景,MTP(Multi-Token Prediction)版本在单用户场景下将 token 吞吐提升 58.5%,直接降低了单位查询的计算成本。
用户与市场认可
Baichuan-M2 不是一个大众消费级聊天产品,而是一个面向医疗行业的技术基础设施。其认可度体现在开源社区和行业基准两个层面。
开源社区反馈:GitHub 获得 211 星和 15 个 Fork,Hugging Face 上提供了完整权重和 4bit GPTQ 量化版,支持 vLLM、SGLang 等主流推理引擎。百川同时开放了技术博客和论文(arXiv:2509.02208),详细披露了大型验证器系统、患者模拟器和多阶段强化学习的实现细节——这在医疗 AI 开源项目中属于较高的透明度水平。
行业基准验证:HealthBench 由 OpenAI 发布于 2025 年,包含 5,000 段真实多轮医疗对话,由 262 名人类医生编写了 48,562 条评判标准。Baichuan-M2 在该基准上全面超越 gpt-oss-120b、DeepSeek-R1-0528 等顶尖开源模型,甚至在急诊分诊(74.6,排名第一)、医疗上下文理解、医患沟通(68.6,排名第一)等核心医疗场景中领先。在中国临床诊疗场景的评估中,Baichuan-M2 对中国医疗体系的适应性和中文临床指南的遵循度均优于同等规模的通用模型。
百川智能公司背景:百川智能由前搜狗 CEO 王小川于 2023 年 3 月创立,获得阿里、腾讯等多轮融资。公司核心团队来自搜狗、百度、华为、微软、字节跳动等头部科技企业。从 Baichuan-7B/13B(2023)到 Baichuan2-7B/13B,再到 M 系列医疗模型(M1→M2→M3→M4),百川走出了一条"通用开源建立影响力 → 医疗垂直领域深化能力"的差异化路线。
百川M2的成本优势
Baichuan-M2 的成本优势来自两个维度:开源许可消除了软件授权费用,而轻量化架构降低了硬件部署门槛。
C端/个人:通过百小医免费使用:面向家庭的 AI 健康助手「百小医」,提供症状问询、就医准备、报告解读、用药提醒等核心功能。基础功能免费,无需注册。免费的真相:免费版提供基础问诊建议,但不对医学准确性做保证;深度健康管理需付费扩展。
开发者/开源模型:零许可费,仅承担基础设施:Baichuan-M2 以 Apache 2.0 协议开源,允许商业使用、修改和再分发。这意味着开发者只需支付 GPU 算力成本。以单卡 RTX 4090 为基准,云 GPU 租赁价格约 5-10 元/小时,一条典型医疗咨询推理约消耗 2-5 秒,单次推理成本不到 0.01 元。相比调用 GPT-5 等闭源 API(约 30 美元/百万 token 输入级别),自部署 M2 在医疗场景下的边际成本低至 1-2 个数量级。但需要注意:开源模式下的隐形成本包括运维人力、模型更新维护、以及推理引擎调优——这些对于非技术背景的医疗机构可能是进入门槛。
企业/私有化:一次部署,持续使用:对于数据高度敏感的医疗机构,私有化部署是必须选项。Baichuan-M2 可在单卡 A100-80G(完整精度)或单卡 RTX 4090(4bit 量化)上运行,8 卡 A100 集群可支持中等并发量的生产级推理服务。华为昇腾 910B 的适配版本(8bit 量化)进一步降低了国产化部署的政治与供应链风险。需核验的隐性成本:模型版本更新可能需要重新微调或对齐;长上下文场景(32K 满占)的推理延迟和显存消耗需要提前做压力测试;在关键诊断场景中仍需保留人工审核有节,这部分人力成本不能被模型替换。
百川 M3 Plus API 免费计划:百川智能推出了「海纳百川」计划,面向医务工作者服务机构免费提供 Baichuan-M3 Plus API,采用"证据锚定"技术,与证据段落 95% 精准匹配,旨在降低医疗 AI 的临床落地门槛。M2 作为开源版本,用户也可自行部署。
百川M2的主要功能
Baichuan-M2 的功能围绕"医疗推理"这一核心场景设计,不是通用聊天能力的简单移植,而是针对临床诊断逻辑、医患沟通和医疗知识检索的深度适配。
-
临床诊断推理(Thinking Mode):M2 最具差异化的能力。内置思维链推理机制,在回答前展开完整临床推理过程——从症状分析、体征解读、辅助检查评估到鉴别诊断。在真实病例测试中,M2 能结构化遵循 SOAP(主观-客观-评估-计划)临床工作流,自动生成包含"诊断依据"和"鉴别诊断列表"的完整分析。使用价值:辅助初级医生和医学生进行临床思维训练,减少诊断遗漏。
-
医患多轮问诊(Patient Simulator Aligned):基于患者模拟器训练,M2 具备鲁棒的医患交互能力。它能够主动追问关键病史信息(病程、加重缓解因素、既往史、用药史、过敏史等),而非被动等待完整病历输入。在模拟问诊中,M2 表现出对人类医生的共情——对焦虑患者先表达理解再提供专业建议,这在医疗 AI 中属于较高层次的能力。使用价值:用于医学教育中的标准化病人模拟、预问诊系统和在线健康咨询。
-
医疗知识检索与问答:覆盖从基础医学到临床专科的权威知识。在肝癌治疗、糖尿病管理等具体病症上,M2 能基于中国临床指南(如卫健委《原发性肝癌诊疗指南》2024 版)给出具体推荐方案。使用价值:临床决策辅助参考、用药安全提示。
-
急诊分诊与风险预警:在 HealthBench 评估中,M2 的"急诊分诊"维度得分 74.6,排名第一。它能从患者描述中识别危险信号(如转移性右下腹痛提示阑尾炎、胸痛放射至左臂提示心梗),并给出明确的就诊优先级建议("立即前往急诊科,不要等待门诊预约")。使用价值:线上预检分诊系统、急救中心辅助决策。
-
医疗文书生成:支持自动生成门诊病历、入院记录、病程记录等标准文书。M2 能将非结构化医患对话转化为结构化电子病历,包含主诉、现病史、初步诊断和处理意见等标准模块。使用价值:减轻医生文书负担,提升病历一致性。
-
通用能力保持(General Capability Retention):通过 Mid-Training 阶段的 2:2:1 数据配比(医疗数据:通用数据:数学推理数据)和领域自约束训练机制,M2 在强化医疗能力的同时保留了较好的通用理解和推理能力。在 AIME 数学基准上达到 83.4(AIME24)和 72.9(AIME25),在 Arena-Hard 对话评测上达到 45.8,说明模型并非"偏科"的医疗专用模型,而是一个在医疗领域深化的通用推理模型。
百川M2的模型与版本演进
百川智能的模型演进走了一条清晰的路线:从通用开源模型起步,逐步向医疗垂直领域深化。M2 处于这条路线从"通用"向"医疗"过渡的关键节点。
Baichuan 系列:通用开源奠基(2023-06 至 2024-09)
- Baichuan-7B / Baichuan-13B(2023-06):首批开源大模型,7B 和 13B 双版本,1.2T/1.4T 多语言语料。Apache 2.0 开源,GitHub 获大量 Star。
- Baichuan2-7B / Baichuan2-13B(~2024-01):第二代,训练数据扩展至 2.6T tokens,上下文 4K。发布完整技术报告和训练中间 Checkpoints。
M 系列:医疗增强深化(2025-02 至今)
- Baichuan-M1-14B(~2025-02):首个医疗增强模型,14B 参数,20T 医疗增强语料,32K 上下文。以 Apache 2.0 开源(arXiv:2502.12671),验证了"基座 + 医疗后训练"路线可行性。
- Baichuan-M2-32B(~2025-09):基于 Qwen2.5-32B,引入大型验证器系统和多阶段 RL。32B 参数,32K 上下文。HealthBench 60.1,超越所有开源模型。
- Baichuan-M3-235B(~2026-02):235B 参数,HealthBench 65.1,首次达到"满血"问诊能力。通过「海纳百川」计划向医务服务机构免费提供 API。
- Baichuan-M4(~2026-07):HealthBench 全球第一,从"问对一次"进化为"长程托付"。
版本图谱总结:Baichuan-7B(2023-06)→ Baichuan2-7B(~2024-01)→ M1-14B(~2025-02)→ M2-32B(~2025-09)→ M3-235B(~2026-02)→ M4(~2026-07)。可以看出从 M1 开始,百川的模型重心已从通用领域转向医疗垂直领域,参数量从 14B 逐步扩展到 235B,评测得分从 M1 到 M4 实现了连续跃升。
百川M2的技术优势
Baichuan-M2 的技术突破不在于模型规模的极致扩张,而在于它首创了一套"虚拟临床有境 + 大型验证器"的训练范式,让模型在模拟临床实践中获得真实的诊断推理能力。
大型验证器系统(Large Verifier System):M2 最核心的技术创新。传统 RLVR(基于可验证奖励的强化学习)在数学、代码等封闭领域有效,但静态题库验证无法复现真实诊疗的动态复杂性。M2 的解法是构建一个大规模、高保真、动态的强化学习有境:
- 患者模拟器:基于脱敏医疗记录、临床指南、病例报告和真实医患对话记录,构建虚拟患者库。训练有境不再是单轮问答,而是充满不确定性的连续交互,让模型在"模拟临床实习"中成长。
- 临床评分生成器:从诊断准确性、会诊逻辑连贯性、治疗方案合理性、沟通共情能力和医学伦理等维度,对模型交互表现进行连续动态量化评估——替代传统的"对/错"二元判断。
- 全异步 Rollout + Reward 管线:verl 框架上开发的完全异步管线,消除了评分等待导致的训练空闲,使大规模医疗 RL 在工程上可行。
多阶段强化学习(Multi-Stage RL):将复杂 RL 任务分解为可控的层次化阶段,每阶段围绕特定能力目标和数据源设计,逐步引导模型技能发展。采用改进版 GRPO(Group Relative Policy Optimization),引入消除 KL 散度Clip-higher、Loss 归一化、动态长度奖励等优化,使模型在医学常识、推理和患者交互能力上递进提升。
Mid-Training 通专兼顾:以 2:2:1 比例混合高质量医疗数据、通用数据和数学推理数据,引入领域自约束训练机制(Field Self-Restraint Training),在注入医疗知识的同时防止通用能力退化。医疗数据采用双任务范式——常规文本续约训练和 ICL 笔记推理训练,使模型学会"像医生一样思考"。
轻量化部署工程:M2 采用了 PTQ(Post-Training Quantization)策略进行 4bit 权重量化和 8bit KV Cache 量化。量化模型可在单张 RTX 4090 上直接部署,精度几乎无损。基于 Eagle-3 训练的 MTP 版本将单用户 token 吞吐提升 58.5%。华为昇腾 910B NPU 的 8bit 量化适配版本也已发布,为国产化部署提供了完整路径。工程落地提示:4bit 量化在大批量并发场景下可能出现延迟波动,建议在生产部署前使用 vLLM 或 SGLang 进行压测,确认 P99 延迟满足业务 SLA。
如何使用
Baichuan-M2 的使用路径分为开源自部署C 端产品体验和商用 API 三个层次。
| 使用方式 | 适合人群 | 入口 | 费用 |
|---|---|---|---|
| 开源模型下载 | 开发者/研究机构 | Hugging Face: baichuan-inc/Baichuan-M2-32B | 免费(Apache 2.0) |
| 量化模型部署 | 个体开发者/小型机构 | Hugging Face: baichuan-inc/Baichuan-M2-32B-GPTQ-Int4 | 免费,仅需 GPU 硬件 |
| 百小医 Web/App | 普通用户 | baichuan-ai.com,或应用商店搜索"百小医" | 基础功能免费 |
| Baichuan-M3 Plus API | 医务服务机构 | 通过「海纳百川」计划申请 | 通过审核后免费调用 |
| 华为昇腾部署 | 国产化需求单位 | modelers.cn/models/Baichuan/Baichuan-M2-32B-W8A8 | 免费,需昇腾硬件 |
快速开始(开源模型):开发者可通过 Hugging Face Transformers 直接加载模型:
from transformers import AutoTokenizer, AutoModelForCausalLM
model = AutoModelForCausalLM.from_pretrained(
"baichuan-inc/Baichuan-M2-32B",
trust_remote_code=True
)
tokenizer = AutoTokenizer.from_pretrained("baichuan-inc/Baichuan-M2-32B")
prompt = "Got a big swelling after a bug bite. Need help reducing it."
messages = [{"role": "user", "content": prompt}]
text = tokenizer.apply_chat_template(
messages,
tokenize=False,
add_generation_prompt=True,
thinking_mode='on' # on/off/auto
)
model_inputs = tokenizer([text], return_tensors="pt").to(model.device)
generated_ids = model.generate(
**model_inputs,
max_new_tokens=4096
)
关键参数说明:thinking_mode 支持三种模式——on(强制开启思维链,适合复杂诊断场景)、off(直出模式,适合简单问答)、auto(模型自主判断);max_new_tokens 控制单次输出长度,复杂病例建议 4K-8K,简单查询可降至 1K-2K。生产有境中建议使用 vLLM 或 SGLang 部署以获得更好的并发性能和显存管理。量化模型的部署流程详见 Hugging Face 模型卡中的 README。
产品定价
Baichuan-M2 的定价由开源许可和产品化服务两层构成,整体遵循"模型免费 + 服务按需付费"的模式。
开源模型层:Apache 2.0 许可,完全免费。包括权重下载、商用授权、修改和再分发权利。零许可费是 M2 相对于闭源医疗 AI 服务的核心定价优势。但需自行承担 GPU 算力成本——单卡 RTX 4090 时租约 5-10 元,单次推理成本可控制在 0.01 元以内。
C 端服务层(百小医):基础问诊功能免费,覆盖常见症状查询、就医准备、报告解读等场景。具体付费功能以应用内页面为准。C 端用户可将百小医作为日常健康管理的辅助工具。
B 端 API 层(M3 Plus):通过「海纳百川」计划,面向医务工作者服务机构的 M3 Plus API 通过审核后永久免费调用。但该 API 仅限临床辅助决策和医学教育场景,不得用于数据生产或未授权的商业用途。使用要求包括:产品需明确展示"Powered by 百川",不得对模型输出进行影响准确性的修改。
企业私有化部署:开源模型无许可费,但需要企业自行评估基础设施投入、运维团队配置和模型版本更新策略。采购前建议完成部署方案的成本测算:综合 GPU 服务器租赁、网络带宽、运维人力和模型更新频率,对比"自部署总成本 vs API 调用年费"后再做决策。
应用场景
Baichuan-M2 的落地场景以医疗领域为核心,覆盖临床辅助、医学教育、健康管理和医疗信息化四个方向。
-
临床辅助决策:辅助医生进行诊断推理、治疗方案选择和风险预警。M2 在急诊分诊、鉴别诊断、用药安全等方面的能力已在 HealthBench 上得到量化验证。落地提示:M2 的输出应作为"第二意见"参考,而非独立决策依据。在诊断一致性要求高的场景(如肿瘤治疗方案制定),必须由主治医生最终确认。建议在系统中明确标注"AI 辅助建议,仅供参考"。
-
医学教育与模拟训练:M2 的患者模拟能力使其天然适合标准化病人(SP)场景。医学生可通过与 M2 的多轮对话练习问诊技巧、病史采集和临床推理。模型能够模拟不同病症、不同性格和不同背景的虚拟患者,并提供评分反馈。落地提示:M2 的医患交互目前以中文/英文为主,多语种混合场景下的表现需进一步验证。教学场景中建议配合教师的实时指导和点评。
-
互联网医疗与预问诊:在线问诊平台可集成 M2 进行预问诊——在患者与医生实时沟通前,先由模型完成症状采集、病史梳理和就诊优先级评估,生成结构化病历摘要,直接减少医生的信息录入时间。落地提示:预问诊的准确性直接影响后续诊疗效率,建议设置明确的"转人工"规则——当模型识别到高危信号(如胸痛、呼吸困难、严重出血)或模型置信度过低时,自动升级至人工处理。
-
健康管理与慢病随访:通过百小医等 C 端产品,用户可获得基于指南的健康建议、用药提醒、复诊提醒和生活方式指导。M2 的"全家记忆"功能支持家庭成员健康信息管理,适用于慢病家庭的持续照护场景。落地提示:健康管理场景对模型的长期记忆和个性化能力有较高要求,当前 M2 的上下文窗口为 32K,长周期跟踪可能需要结合外部数据库或摘要技术。建议该场景配合百川的 M 系列 API 产品使用而非纯自部署方案。
-
医疗科研与文献分析:M2 的推理能力和医学知识覆盖使其在医疗科研场景中有应用潜力,包括临床指南对比分析、文献综述结构化提取、病例回顾性研究辅助。落地提示:科研场景对引用准确性和可溯源性要求极高,模型输出的引用和建议必须人工逐条核实文献来源。
适用人群
-
医生与临床工作者:作为临床决策辅助工具,用于鉴别诊断参考、治疗方案提示、医学知识快速查询。不适配边界:M2 不能替代医生的临床判断和执业资质,不建议在无人工复核的情况下将其输出直接用于患者治疗决策。在急诊ICU 等高风险场景中应严格限制为"参考信息"而非"决策依据"。
-
医学生与医学教育机构:利用 M2 的患者模拟能力进行问诊训练、临床推理练习和 OSCE(客观结构化临床考试)准备。前置条件:教育机构需要具备基本的 AI 部署能力(或通过百川 API 接入),并配套教师对模型输出进行解释和补充。
-
医疗 AI 开发者与算法工程师:基于开源模型进行微调、量化和部署,为医疗机构定制私有化 AI 服务。M2 的 Apache 2.0 许可提供了最大的商业灵活性和修改自由度。落地提示:建议开发者先从百川开放平台试用 M3 Plus API 验证产品概念,再评估自部署 M2 的成本效益。需关注 32K 上下文对长病史处理时的截断策略。
-
患者与普通用户:通过百小医 App 获取日常健康咨询、症状分析和就医建议。不适配边界:AI 健康助手不能替代医生诊断。对于紧急症状(严重胸痛、大出血、意识障碍、严重过敏反应等),应立即拨打急救电话而非依赖 AI 咨询。百小医的免费版本在功能和回答深度上可能有限制。
-
医院信息科与医疗信息化企业:评估 M2 在院内落地可行性,包括算力规划(单卡 RTX 4090 可支持少量并发,生产级需多卡集群)、国产化适配(华为昇腾 910B)、数据安全合规(私有化部署避免数据出域)。不适配边界:当前 M2 未针对院内信息系统(HIS/EMR)的原生集成做专门优化,接口开发和数据映射需要额外工程投入。
总结与展望
Baichuan-M2 是百川智能在医疗 AI 领域的核心里程碑。它证明了"中型参数量 + 创新训练范式"可以在垂直领域达到甚至超越超大模型的临床能力——32B 参数在 HealthBench 上超越 120B 甚至闭源千亿级模型,这是一条与"暴力扩大参数规模"截然不同的技术路线。
核心优势:大型验证器系统为医疗 RL 训练提供了可规模化复用的范式;HealthBench 60.1 和 HealthBench Hard 34.7 的成绩验证了其在医疗推理、急诊分诊和医患沟通上的领先水平;Apache 2.0 开源许可和单卡 4090 的部署门槛大幅降低了医疗 AI 的获取成本;华为昇腾适配为国产化替代提供了完整路径。
当前限制:M2 的上下文窗口为 32K,在超长病历分析和长期健康管理跟踪场景中可能不足;模型主要针对医疗场景优化,在通用对话、创意写作和非医疗领域任务上的表现不如同等规模的通用模型;百川的 M 系列虽然迭代迅速(M1→M2→M3→M4),但每个版本的独立部署和维护对用户构成了版本碎片化风险;M2 的 Tool Calling 和 Agent 能力在本版本中尚未充分优化,限制了自动化工作流的集成范围。
不适配边界:不应作为独立诊断工具用于患者直接治疗决策;不适合非医疗领域的通用对话和内容创作;多语种混合医疗场景下的表现尚未充分验证;对实时更新的医学知识和指南变化存在滞后——静态模型的知识截止于训练数据时间。
采购与采用风险评估:对于技术背景的医疗机构,Baichuan-M2 是目前开源医疗模型中最优选择——以极低的许可和硬件成本获得接近 GPT-5 的医疗推理能力。建议的采用路径是:先在百小医 C 端或 M3 Plus API 上验证医疗效果,再评估自部署 M2 的成本效益。对于非技术医疗单位,"开源模型自部署"的隐性成本(运维、安全合规、版本管理)可能高于预期,建议优先考虑百川的托管 API(M3 Plus 免费计划)作为入口,待使用量和需求明确后再评估私有化部署。任何场景下,AI 输出均不能替代持证医生的专业判断,医疗责任条款应在采购合同中明确划分。
版本信息
- 百川M2 :新一代商业版大语言模型,中文理解和推理能力持续迭代。
- Baichuan 2 :前代版本,开源大语言模型。
DeepSeek
用户评价