MiniMax M3:前沿编码、1M 上下文、原生多模态的"All in One"旗舰
MiniMax 5 月发布旗舰模型 M3,基于全新 MSA 稀疏注意力架构,支持 1M token 上下文与原生多模态;配套 MiniMax Code、Hub 与 Audio,定位可承担长程复杂任务的通用智能底座。
MiniMax 于 2026 年 5 月正式发布新一代旗舰模型 MiniMax M3,官方博客的标题直接点明定位:"Frontier Coding, 1M Context, Native Multimodality — All in One Model"。这是一款把"前沿编码、超长上下文、原生多模态"塞进同一个模型的通用智能底座。
三个关键能力
- 前沿编码与智能体(agentic)能力:面向长程复杂任务的编码与 Agent 工作负载。
- 100 万(1M)token 超长上下文:基于全新的 MSA(Multi-head Sparse Attention) 注意力架构构建——这是 M3 控制长上下文成本的关键技术。
- 原生多模态:文本、音频、图像、视频、音乐的综合理解与生成,而非事后拼接的"伪多模态"。
演进路线与配套产品
M3 不是孤立发布。MiniMax 的模型演进路线清晰可见:M2.5(2026-02,面向真实生产力)→ M2.7(2026-03,自我进化)→ M3(2026-05),并辅以 Agent 强化学习框架 Forge 与 MaxProof(数学证明)等研究储备。
配套产品也同步就位:MiniMax Code(面向 MiniMax 模型的编码 harness,提供桌面客户端)、MiniMax Hub(模型体验平台)与 MiniMax Audio 等 AI 原生产品。这一套"模型 + 工具 + 平台"的组合,目标是把 M3 从"能对话的模型"变成"能干活的基础设施"。
长上下文竞争里的国产坐标
从行业视角看,M3 的 1M 上下文与 Kimi K3、DeepSeek V4 等国产模型形成了"超长上下文"的第一梯队竞争。MSA 稀疏注意力的技术选型,说明 MiniMax 在"上下文要长、成本要可控"这道题上有自己的解法。对开发者而言,M3 的价值在于它同时覆盖编码、多模态与长上下文三个高频场景——一个模型顶多套方案,恰好契合"All in One"的产品哲学。
后续值得跟踪的几个方向:
- MSA 架构的真实成本优势:1M 上下文的推理成本与速度实测。
- Forge 框架的开源:Agent 强化学习框架会否向社区开放。
- M3 与 M2.7 的能力跨度:从"自我进化"到"旗舰全能",中间发生了什么。
- MiniMax Code 的采用:桌面编码 harness 能否在开发者中建立口碑。
用户评价