Eleven v3 正式可用:AI 语音进入"难辨真人"的新阶段

ElevenLabs 2 月 2 日宣布旗舰语音模型 Eleven v3 正式可用(GA),在语音自然度、情感表现、多语言能力与稳定性上达到新水平,与 Scribe v2、Dubbing v2、Music v2 构成完整音频技术栈,是"最逼真 AI 语音"的技术底座。

2 月 2 日,ElevenLabs 宣布其旗舰语音模型 Eleven v3 正式可用(Generally Available)。对一个以"逼真"立命的公司来说,v3 的 GA 意味着它的语音合成技术进入了一个新的代际——语音自然度、情感表现、多语言能力与稳定性同时达到新水平,成为"最逼真 AI 语音"的技术底座。

从 v1/v2 到 v3 的技术脉络

ElevenLabs 的语音模型迭代路径清晰:v1/v2 奠定语音克隆与 TTS 基础,v3 则强化了长文本一致性、情感/语气控制与多语言(覆盖数十种语言)能力。与 v3 同期,ElevenLabs 还发布/迭代了 Scribe v2(语音转文字,2026 年 1 月)、Dubbing v2(配音,2026 年 5 月)、Music v2(2026 年 5 月)等,形成"语音合成 + 识别 + 翻译 + 音乐"的完整音频技术栈。

一个商业帝国的底座

v3 的意义不只在技术。结合其 D 轮融资(估值 110 亿美元)与 5 亿美元 ARR,ElevenLabs 正以 v3 为底座构建语音 AI 的商业帝国:语音 Agent、配音、有声书、客服——这些场景都建立在"AI 语音足够逼真"的前提之上。v3 的 GA,等于为这些商业场景的地基打上了"合格"的标签。

从行业视角看,Eleven v3 的 GA 标志着 AI 语音质量迈入"难以与真人区分"的新阶段。这既是技术的胜利,也带来新的问题:当 AI 声音与真人无异,"声音的信任"如何建立?深度伪造的治理如何跟上?对国内语音 AI 企业(字节、阿里、出门问问等)而言,v3 既是竞争参照——逼真度已经卷到新高度——也是安全警示——逼真度的另一面是滥用风险。AI 语音赛道的下半场,比拼的将不仅是"像不像",还有"能不能负责任地用"。

后续值得跟踪的几个方向:

  1. v3 与 v2 的实际听感差距:真实场景中的自然度与情感表现对比。
  2. 多语言能力的覆盖范围:数十种语言中,中文等语种的音质水平。
  3. 深度伪造的治理:ElevenLabs 的语音水印与溯源方案。
  4. 国内 TTS 的跟进:本土语音厂商能否在自然度上缩小差距。
版权声明:本文内容来自 ElevenLabs 官方博客 。本平台对该内容进行了编译和整理,仅用于信息传播和学习交流之用。如有侵权,请联系我们进行处理。

用户评价

  • 加载评价中...