ElevenLabs 语音生态再进阶:Scribe v2 与 ElevenAgents Expressive Mode,把"会说话"升级为"会表达"
ElevenLabs 持续扩展语音生态,Scribe v2 语音识别与 ElevenAgents 表达能力增强并进,配合 Music v2、Dubbing v2,三层产品结构(创作/会话/API)同步强化。
ElevenLabs 语音生态再进阶:Scribe v2 与 ElevenAgents Expressive Mode,把"会说话"升级为"会表达"
ElevenLabs 在 2026 年持续推进其语音生态,最新更新聚焦两大主线:Scribe v2 语音识别(STT)与 ElevenAgents 的表达能力增强(Expressive Mode),并叠加 Music v2、Dubbing v2 等创作端里程碑。这家以"AI Communication Platform"自我定位的公司,正通过 ElevenCreative、ElevenAgents、ElevenAPI 三层结构,把语音从"生成"推进到"理解与会话"。
- Scribe v2(STT):2026-01 发布,官方披露在多项语音识别基准上达到 98% 准确率,补齐了平台在"语音理解"侧的短板。
- Expressive Mode for Agents:2026-02 推出,让客服/业务语音 Agent 不只是"回答正确",还能表达语气与情绪,提升人机对话的自然度。
- 创作端双里程碑:Music v2 与 Dubbing v2 于 2026-05 落地,把音乐生成与多语言配音能力整体升级。
- 三层产品结构成型:ElevenCreative(创作)、ElevenAgents(会话)、ElevenAPI(开发者)共用同一底层模型与资产体系。
版本背景
ElevenLabs 的核心资产是语音基础模型,覆盖 Text to Speech、Speech to Text、Voice Cloning、Dubbing、Music Generation、SFX 与 Image & Video 等能力。其语音模型谱系包括:Eleven Flash(75ms 超低延迟)、Eleven Multilingual v2(高拟真)、Eleven v3(高表现力)与 Scribe v2(STT,98% 准确率)。官网标注支持 70+ 语言、5000+ 预设语音库。
2026 年的更新主线,是把"语音生成"与"语音理解"放进同一条产品链路,减少企业多供应商拼接造成的音色不一致与数据孤岛问题——这也是其从"TTS 工具"升级为"语音基础设施"的关键一步。
本次版本亮点
语音理解侧:Scribe v2
- 高准确率转写:官方披露多项基准 98% 准确率,覆盖多语言场景。
- 支撑会话闭环:STT 与 TTS 协同,让语音 Agent 具备"听得懂—答得出"的完整闭环,而不是只做单向播报。
会话侧:ElevenAgents Expressive Mode
- 情绪表达能力:Agent 可根据上下文调整语气与情感表达,显著改善客服场景的听感体验。
- 业务配置能力:面向客服与业务流程提供可配置、可监控的语音与文本对话 Agent。
创作端:Music v2 与 Dubbing v2
- Music v2:音乐生成能力整体升级,补齐创作者音频资产链路。
- Dubbing v2:多语言配音能力增强,支撑影视与内容全球化分发。
对开发者的意义
对国内开发者与产品团队而言,ElevenLabs 的生态演进有两点值得留意。其一,语音 Agent 正在成为客服、外呼、营销触达的新载体,而"表达力"是区别于传统 IVR 的关键变量——Expressive Mode 这类能力直接影响用户对 AI 客服的接受度。其二,STT + TTS + Agent 的一体化方案,比"多家拼装"在音色一致性与数据治理上更有优势,但也要注意语音数据的合规与隐私要求。
对比来看,开源侧的
Whisper 在 STT 上提供了免费自托管的另一条路径,而 ElevenLabs 的价值在于把识别、生成与会话打包成可治理的企业级服务,二者分别适合"自建数据管道"与"快速上线"两类团队。
使用路径建议
- 创作者:从 ElevenCreative 入手,体验语音克隆、配音与音乐生成,验证内容生产工作流。
- 企业客服/外呼:评估 ElevenAgents 的 Expressive Mode 与监控能力,小流量试点后扩容。
- 开发者:通过 ElevenAPI 集成 TTS/STT/Agent 能力,关注七档订阅(Free 到 Enterprise)与用量 Credits 的成本模型。
值得跟踪的方向
- Scribe v2 的中文与方言覆盖:多语言转写质量在国内本地化场景的实测表现。
- Expressive Mode 的落地场景:在客服、有声内容等场景的采纳率与用户接受度数据。
- 企业合规与数据安全:语音数据在国内使用的合规路径,是决定国内团队是否接入的关键前提。
用户评价