可灵 AI 发布 Kling 3.0:VIDEO 3.0 与 Omni 重塑"光与声的叙事逻辑"
快手可灵 AI 发布 KlingAI 3.0 系列,官方口号"All in One, One for All";VIDEO 3.0 与 Omni 原生支持深度多模态指令解析与跨任务整合,实现视觉身份与声音语调的双重绑定。
快手旗下可灵 AI(Kling)发布全新 KlingAI 3.0 系列,官方口号是"All in One, One for All"。作为国内 AI 视频赛道的头部玩家,可灵这一代的升级方向不是单纯"更长、更清晰",而是把重点放在了深度多模态指令解析与跨任务整合上。
VIDEO 3.0 与 Omni 的叙事升级
Kling 3.0 模型系列基于全面升级的架构构建,其中 VIDEO 3.0 与 VIDEO 3.0 Omni 原生支持深度多模态指令解析与跨任务整合。官方给出的描述颇具画面感:重新定义了"光与声的叙事逻辑"——从精确的长叙事分镜控制,到由 Native Audio 驱动的功能解耦,实现了视觉身份与声音语调的双重绑定。在复杂的多场景切换中,VIDEO 3.0 兼顾高创作自由度与卓越的一致性。
翻译成用户能感知的语言:过去文生视频是"画面跟着文字走",而 Kling 3.0 想让"声音也参与叙事"——视频里的人物身份、情绪与语调统一绑定,多场景切换时不再"跳戏"。
与 Seedance 的正面竞争
把 Kling 3.0 放回行业坐标系里,它的直接对手是字节的
Seedance。36氪 2026 年 7 月的分析文章《可灵成不了 Seedance》已经讨论过两者的差异化——Seedance 依托火山引擎走 B 端 MaaS 变现,可灵则依托快手生态探索 C 端与创作者经济,同时也被报道计划分拆并推进 IPO。
从行业视角看,可灵 3.0 押注"视觉 + 声音双重叙事",是在为 C 端创作者提供更有故事感的创作工具——这与它"创作者经济"的路线自洽。当字节在 B 端 MaaS 上领跑,可灵选择在"叙事体验"和"创作者工具"上做深。两家不必在同一维度竞争,但"光与声"的能力比拼,会直接决定 C 端用户用谁的模型讲故事。
后续值得跟踪的几个方向:
- Native Audio 的实际效果:声音与视觉的双重绑定在生成中是否稳定。
- 长叙事分镜控制的可控性:复杂多场景切换下的创作自由度与一致性平衡。
- 可灵分拆 IPO 的进度:3.0 系列能否支撑上市叙事。
- C 端创作者的真实采用:新能力能否转化为创作者生态的活跃度。
用户评价