MiniMax H3 正式发布:全模态统一生成,15 秒 2K 视频与 1/3 定价

MiniMax H3 正式发布,通用全模态生成模型,支持文本/图像/视频/声音统一理解与输出,最高 15 秒 2K 视频生成,定价约为主流模型的 1/3。

MiniMax 于 7 月 31 日正式发布 H3,8 月 2 日收录入库。这是一款定位"通用全模态生成"的模型——文本、图像、视频、声音的统一理解与输出被打进同一个模型,视频侧最高支持 15 秒 2K 分辨率生成,定价则约为主流模型的 1/3

全模态统一:减少拼接的延迟与成本

H3 的架构方向,是把理解与生成收进单一模型,而不是让多个单模态模型在管线里拼接。这种"原生多模态"路线的好处很直接:省掉模态之间转换的延迟与成本,也更贴近当下"多模态 + Agent"的工作负载。对 MiniMax 而言,这也是一次从文本/语音单一模态向全模态统一生成的关键跃迁。

15 秒 2K:触碰短视频的实用门槛

视频生成长度和分辨率直接决定可用性。15 秒、2K 这个组合,已经触及短视频创作、广告素材乃至影视级预演的实际使用门槛,而不只是演示级的"能出片"。这意味着 H3 不只是实验室里的能力展示,而是奔着可量产的内容生产场景去的。

1/3 定价:对谁冲击最大

以主流模型 1/3 的价格提供全模态能力,冲击的是海外闭源多模态模型的性价比空间,也在国内直接对标可灵、Sora 等视频生成头部。对创作者来说,低价全模态意味着 UGC 内容生产门槛被进一步压低——这也是 MiniMax 一贯"以性价比切入"打法的延续。

后续值得跟踪的几个方向:

  1. 真实创作场景可用性:15 秒 2K 在长叙事、角色一致性上的实际表现。
  2. 与可灵等国产视频模型的实测对比:视频质量与速度的直接交锋。
  3. 全模态路线的替代节奏:统一模型对单一模态方案的分流速度。
版权声明:本文内容来自 用户供稿 。本平台对该内容进行了编译和整理,仅用于信息传播和学习交流之用。如有侵权,请联系我们进行处理。

用户评价

  • 加载评价中...