Deepgram API
Deepgram 是业界领先的语音 AI API 平台,通过一套统一的 API 提供实时语音识别(STT)、文本转语音(TTS)、语音 Agent 编排和音频智能分析。Nova-3 模型支持 50+ 语言,转录延迟低于 300ms;Flux 对话式模型内置话轮检测;Aura-2 TTS 延迟低于 200ms。平台已通过 SOC 2、HIPAA、GDPR 认证,企业级客户包括 Twilio、Cloudflare、Sierra 等。
Deepgram API 的全面解析:统一语音 AI 基础设施
核心参数与统计
| 维度 | 规格 |
|---|---|
| 产品定位 | 统一语音 AI API 平台(STT / TTS / Voice Agent / Audio Intelligence) |
| 交付形态 | 云端 API(公共云/私有云/自托管) |
| 基础模型 | Nova-3(通用转录,50+ 语言)、Flux(对话式 STT,10 语言)、Aura-2(TTS,40+ 英文语音) |
| STT 延迟 | 实时流式 <300ms(Nova-3),Flux 内置话轮检测 |
| TTS 延迟 | 流式 <200ms(Aura-2) |
| 支持语言 | STT 50+ 语言,TTS 英文为主(含多口音) |
| 安全合规 | SOC 2 Type 1 & 2、HIPAA(签 BAA)、GDPR、CCPA、PCI |
| 部署方式 | 公共云 API、私有云/单租户 VPC、本地自托管 |
| GitHub 组织 | 658 followers,115 仓库,450+ stars(Python SDK) |
| 公司成立 | 2015 年,总部美国旧金山 |
| 融资情况 | 2026 年 1 月完成 $130M C 轮,估值 $1.3B(独角兽) |
| 最新版本 | 2026.07 — Flux Multilingual + Voice Agent API GA |
参数解读:Deepgram 的核心竞争壁垒体现在三个"统一"——统一的 API 入口(单一 Voice Agent API 整合 STT/LLM/TTS)、统一的流式基础设施(STT 与 TTS 共享同一流式管道,减少握手延迟)、统一的部署方案(同一套 API 可跑在公共云、私有云或本地)。这种架构设计使得端到端语音交互的全链路延迟被压缩到业界最低水平之一。对于开发者而言,这意味着不需要在多家服务商之间拼接 STT、NLU、TTS 三个独立系统,一个 API Key 即可完成从语音输入到语音输出的闭有。
用户与市场认可
企业级客户覆盖:Deepgram 的客户名单横跨多个行业的头部企业,包括 Twilio(通信基础设施)、Cloudflare(边缘计算)、Sierra(企业 AI Agent)、Cresta(客服智能化)、Kore.ai(企业对话 AI)、Daily(实时通信框架)、Vapi(语音 Agent 平台)、Granola(会议笔记)、Jack in the Box(快餐连锁)等。产品页显示其客户遍及联络中心、医疗、媒体、金融服务等领域。
开发者社区:GitHub 组织拥有 658 名关注者,官方 SDK 覆盖 Python(450 stars)、JavaScript/TypeScript(268 stars)、Go(87 stars)、.NET(53 stars)、Java(8 stars)和 Rust(66 stars)。社区活跃于 Discord 和 GitHub Discussions,官方提供技术文档API Playground 和示例代码库。
市场认可度:2026 年 1 月完成 1.3 亿美元 C 轮融资,估值达 13 亿美元跻身独角兽阵营,由知名投资机构领投。同一时期收购了 OfOne(面向免下车餐厅的语音 AI 公司),表明其在垂直场景的扩张野心。行业媒体如 Reuters、SiliconAngle、Forbes 均有报道。
成本优势
C 端 / 个人开发者
Deepgram 提供 $200 免费额度,无需绑定信用卡即可注册使用。所有公共模型端点均可在免费额度内体验。适合个人开发者做原型验证、小规模实验或学习集成。
API / 开发者层级
计费模型为按量付费(Pay-As-You-Go),支持预购年付套餐(Growth 计划,享最高 20% 折扣):
语音识别(STT)价格对比:
| 模型 | Pay-As-You-Go(流式/分钟) | Growth(流式/分钟) | Pay-As-You-Go(预录/小时) | Growth(预录/小时) |
|---|---|---|---|---|
| Flux English | $0.0065/min | $0.0057/min | $0.0077/min | $0.0065/min |
| Flux Multilingual | $0.0078/min | $0.0068/min | 同上 | 同上 |
| Nova-3 Monolingual | $0.0048/min | $0.0042/min | $0.0077/min | $0.0065/min |
| Nova-3 Multilingual | $0.0058/min | $0.0050/min | $0.0092/min | $0.0078/min |
| Custom | 联系销售 | 联系销售 | 联系销售 | 联系销售 |
STT 附加功能: 敏感信息脱敏(Redaction)$0.0020/min、关键词增强(Keyterm Prompting)$0.0013/min、说话人分离(Diarization)$0.0020/min;Smart Formatting 免费包含。
语音合成(TTS)价格:
| 模型 | Pay-As-You-Go | Growth |
|---|---|---|
| Aura-2 | $0.030/1k 字符 | $0.027/1k 字符 |
| Aura-1 | $0.015/1k 字符 | $0.0135/1k 字符 |
Voice Agent API 价格(全包):
| 套餐 | Pay-As-You-Go | Growth |
|---|---|---|
| Standard(Deepgram 全栈) | $0.075/min($4.50/hr) | $0.068/min |
| Standard - BYO TTS | $0.065/min | $0.051/min |
| Custom - BYO LLM + TTS | $0.050/min | $0.041/min |
| Advanced | $0.163/min | $0.146/min |
音频智能(Audio Intelligence): 摘要生成 $0.0003-$0.0006/1k tokens(输入/输出),主题检测、情感分析、意图识别已含在定价内。
企业 / 私有化层级
企业版按需定价,需联系销售团队确认。支持以下差异化能力:定制模型训练(Custom Model Training)、单租户 VPC 部署、本地自托管(Self-hosted)、HIPAA BAA 签署、更高并发限制、专属 SLA。对于月均处理超过数万小时音频的高用量场景,企业合同通常可在 Growth 价格基础上进一步获得折扣。
隐性成本提示:Deepgram 不计费静音段(silence)或不向上取整音频时长,实际有效费用可能低于按原始时长计算的预期。但附加功能(脱敏、关键词增强、说话人分离)均独立计费,在多附加功能叠加使用时会显著增加单次转录成本。
主要功能
-
实时语音识别(Streaming STT):通过 WebSocket 流式传输音频,Nova-3 模型延迟低于 300ms 返回中间结果,支持话轮检测和自动断句。适用于需要低延迟反馈的实时对话场景,如语音助手和在线客服。
-
预录音频转录(Pre-recorded STT):REST API 提交音频文件(支持多声道),Nova-3 支持 50+ 语言,批量处理速度最高可达竞品的 40 倍。适用于播客、会议录音、呼叫中心质检等非实时场景。
-
对话式语音识别(Flux):专为语音 Agent 设计的识别模型,内置自然话轮检测(End-of-Thought Detection)和打断处理(Barge-in),无需依赖 VAD(语音活动检测)外部组件。支持 10 种语言,2026 年 7 月已推出多语言版本。
-
文本转语音(Aura-2 TTS):流式神经网络语音合成,延迟低于 200ms,提供 40+ 英文语音(含美式、英式、澳洲等口音),支持上下文感知的语速和情感调节。通过 Deepgram Prompting 技术可微调发音风格。
-
统一 Voice Agent API:单 API 整合 STT → LLM 编排 → TTS 全链路,支持 BYO LLM(OpenAI、Anthropic 等)和 BYO TTS。内置函数调用、意图路由、会话中动态配置切换。固定价格 $4.50/hr 全包。
-
音频智能分析:基于轻量级专精模型提供摘要生成、情感分析(词/句/对话三级)、意图识别、主题检测。无需调用昂贵的通用大语言模型即可从对话音频中提取结构化洞察。
-
高级转录增强:说话人分离(Diarization)自动标记谁在何时说话;自动标点/大小写/数字格式化(Smart Formatting);关键词增强(Keyterm Prompting)可将特定领域术语的识别召回率提升最高 90%;敏感信息脱敏(Redaction)自动移除社保号、信用卡号等 PII;填充词转录(Filler Words)保留"嗯""啊"等口语标记。
专家视点:Deepgram 的产品线之间存在显著的协同效应——STT 的输出可作为 Audio Intelligence 的直接输入,而 Audio Intelligence 的摘要又可以作为 TTS 的输入用于自动生成语音报告。Voice Agent API 则将 STT 和 TTS 通过 LLM 编排层串联为端到端语音对话管道,开发者无需分别处理流式音频的同步、编解码和连接管理。这种"采集-理解-生成"的闭有能力,使得 Deepgram 不仅仅是一个 API 集合,而是一个完整的语音 AI 操作系统。
模型与版本演进
主线发布
- 2025.02 — Flux 对话式 STT:首次将话轮检测直接嵌入声学模型,告别传统的独立 VAD 组件。支持英语单一语言,面向实时语音 Agent 场景。
- 2025.04 — Aura-2 TTS:第二代神经网络语音合成模型,40+ 英文语音,延迟 <200ms。相比 Aura-1 在发音准确率、自然度和对专业术语(医学术语、金融术语)的处理上有跨越式提升。
- 2026.01 — Nova-3 GA:第三代通用转录模型正式商用。相比前代 Nova-2,在专有名词识别(如产品名、人名、地名)上提升显著,配合 Keyterm Prompting 可使特定术语的识别准确率从 10% 提升至 90% 以上。支持 50+ 语言,强噪声有境下的鲁棒性大幅改善。
- 2026.06 — Flux Multilingual + Voice Agent API GA:Flux 扩展至 10 种语言(英/西/德/法/印地/俄/葡/日/意/荷)。Voice Agent API 正式商用,标志着 Deepgram 从单一 API 向全栈语音 AI 平台转型的关键节点。
- 2026.07 — 持续迭代:CLI 工具、自托管资源API 规范等基础设施持续更新,GitHub 组织下 115 个仓库保持高频活跃。
候选验证
Deepgram 还提供 Custom Model Training 服务,允许企业用户基于专有数据集对 Nova-3 模型进行微调,进一步提升边缘场景的识别准确率。该服务需联系销售团队评估数据体量和场景需求。
技术优势
端到端深度学习架构:Deepgram 从 2015 年成立起就采用端到端深度学习(而非传统的声学模型+语言模型管线),通过单一的深度神经网络直接学习从音频波形到文本的映射。这种架构的优势在于:消除了传统管线中各模块之间的信息损失,模型可以更充分地利用上下文信息进行推断。
统一流式基础设施:STT 和 TTS 运行在同一套流式基础设施上,共享 WebSocket 连接管理、音频编解码和流式缓冲区调度。这带来的直接效果是——当 STT 将音频转为文本TTS 再将回复文本转为语音时,中间不需要在不同服务之间切换网络连接,端到端语音闭有的延迟被压缩到最低。
低延迟引擎:产品页宣称 Nova-3 的实时转录中间结果可在 300ms 以内返回,Aura-2 的首次音频字节可在 200ms 以内到达。实测数据(来自 Phonely CEO 的公开评价)显示 Aura-2 的端到端延迟通常低于 200ms,比其他主流 TTS 供应商快 2-4 倍。这种低延迟对于语音 Agent 场景至关重要——人耳可以感知 300ms 以上的延迟,低于这个阈值才能实现自然的对话节奏。
专精任务模型 vs. 通用大模型:Audio Intelligence 功能使用轻量级、专精任务的小模型(而非通用大语言模型),在摘要、情感、意图、主题四个维度上实现了更高的领域准确率和更低的推理成本。产品页明确表示,这些模型是在领域对话数据上微调的,因此对于特定任务(如客服对话摘要)的准确性优于同等成本的通用 LLM 方案。
灵活的部署拓扑:公共云 API → 私有云/单租户 VPC → 本地自托管,覆盖从原型验证到严格合规企业的全部部署需求。自托管方案基于 Docker/Kubernetes,提供完整的 Helm Chart 和部署脚本(GitHub: self-hosted-resources, 39 stars)。
如何使用
注册与 API Key
- 访问 console.deepgram.com 注册账号。
- 注册即获 $200 免费额度,无需绑定信用卡。
- 在控制台创建 API Key,选择所需权限(STT / TTS / Agent / Intelligence)。
- 通过 REST API、WebSocket 或官方 SDK 发起请求。
快速调用示例
Python:实时语音识别(WebSocket):
from deepgram import Deepgram
import asyncio
dg_client = Deepgram('<YOUR_API_KEY>')
async def transcribe_stream():
# 使用 Nova-3 模型进行实时流式转录
connection = await dg_client.transcription.live(
{"model": "nova-3", "language": "en-US", "smart_format": True}
)
async def on_message(self, result, **kwargs):
print(result.channel.alternatives[0].transcript)
connection.on("transcript", on_message)
asyncio.run(transcribe_stream())
cURL:预录音频转录:
curl -X POST https://api.deepgram.com/v1/listen、model=nova-3&smart_format=true \
-H "Authorization: Token <YOUR_API_KEY>" \
-H "Content-Type: audio/wav" \
--data-binary @audio.wav
cURL:文本转语音(Aura-2):
curl -X POST https://api.deepgram.com/v1/speak、model=aura-2-odysseus-en \
-H "Authorization: Token <YOUR_API_KEY>" \
-H "Content-Type: application/json" \
-d '{"text": "Hello, welcome to Deepgram voice AI."}' \
--output speech.mp3
Voice Agent API 配置:通过 WebSocket 连接 wss://agent.deepgram.com/agent,发送包含 Agent 配置(LLM 选择、系统提示词TTS 语音)的 JSON 消息启动会话。完整示例见官方文档。
可用 SDK
Deepgram 提供官方 SDK:Python、JavaScript/TypeScript、Go、.NET、Java(社区版 Rust 也可用)。所有 SDK 均开源在 github.com/deepgram。此外,官方 CLI 工具支持从终端直接调用 STT/TTS/音频智能功能。
产品定价
付费模型总结:
| 层级 | 适合对象 | 付费方式 | 起步条件 |
|---|---|---|---|
| 免费额度 | 个人开发者、原型验证 | $200 赠金 | 注册即得 |
| Pay-As-You-Go | 中小团队、成长型应用 | 按量计费,无最低消费 | 赠金用尽后自动切换 |
| Growth | 中高用量应用 | 预购年付套餐(省 20%) | $4K+/年 |
| Enterprise | 大用量、合规要求、定制需求 | 联系销售 | 商务确认 |
免费额度详情:$200 赠金可用于所有公共 API 端点(STT/TTS/Audio Intelligence/Agent)。未使用的赠金不失效。不需绑定信用卡即可注册。
并发限制:Pay-As-You-Go 下 STT REST API 50 并发WebSocket 150 并发;TTS 45 并发;Voice Agent 45 并发。Growth 套餐对应提升至 REST 50、WSS 225、TTS 60、Agent 60。Enterprise 可协商更高并发。
应用场景
-
联络中心与客服语音 AI:实时转写客户与坐席对话,结合 Audio Intelligence 自动生成通话摘要、检测客户情绪、识别意图并按主题分类。典型用户包括 Stream It、Sharpen、Cresta、Revenue.io。核验重点:在嘈杂的呼叫中心有境中,Nova-3 的口音和噪声鲁棒性是否满足实际识别率要求;Keyterm Prompting 能否覆盖业务专有词汇。
-
语音 Agent 与对话式 AI:基于 Voice Agent API 构建端到端语音 AI 代理,用于外卖点餐(Jack in the Box)、客户服务(Sierra、Aircall)、医疗预约等场景。Flux 的内置话轮检测和打断处理使得对话体验更接近真人互动。核验重点:BYO LLM 模式下,LLM 的响应延迟会成为端到端延迟的瓶颈;需评估 LLM 选择与 Deepgram 流式管道的适配度。
-
媒体播客与视频字幕:利用预录 STT 的高速批处理能力(最高 40x 实时速率)为播客、视频、直播流生成字幕和搜索索引。结合说话人分离和智能格式化,大幅降低人工校对成本。核验重点:多说话人场景下 diarization 的准确率是否满足出片标准;多语言内容需确认目标语言是否在支持列表内。
-
医疗临床文档:通过 HIPAA 合规的 STT API 实现临床对话的实时转录,支持医学术语(通过 Keyterm Prompting 增强),减少医生文书工作负担。Deepgram 产品页显示已有兽医领域客户(Talkatoo)通过 Nova-3 将专业术语识别准确率从 10% 提升至 625% 改善。核验重点:必须签署 BAA;中文医疗术语的支持程度需单独验证。
-
语音分析与企业情报:大规模分析客服录音、销售通话、会议记录,通过 Audio Intelligence 提取趋势和模式。相比通用 LLM 方案,Deepgram 的专精模型在成本上降低 10-100 倍,适合每日数百万分钟级别的音频分析。核验重点:摘要/情感/意图的准确率是否满足业务决策需要;是否支持自定义分类体系。
适用人群
-
语音应用开发者:需要低延迟、高准确的 STT/TTS API 来构建语音助手、语音客服或对话式 AI 产品的后端工程师。Deepgram 的 SDK 覆盖主流语言,文档完善,API Playground 可立即体验效果。前置条件:具备 REST API 或 WebSocket 编程能力;$200 赠金足够完成 MVP 验证。
-
AI Agent 平台与框架:如 Vapi、Daily(Pipecat)、Cognigy、Kore.ai 等平台级产品,将 Deepgram 的语音能力内嵌为自身平台的模块。Voice Agent API 的 BYO LLM 能力使这些平台可以保留自己的模型选择。前置条件:需要企业级合同以获得更高并发和 SLA 保障。
-
企业联络中心与技术负责人:负责客服系统升级、通话质量分析或 AI 坐席引入的决策者。Deepgram 的 SOC 2/HIPAA/GDPR 合规体系和对 Amazon Connect 的原生集成降低了企业采购的风险门槛。前置条件:私有云或自托管部署通常需要 6-12 个月的技术评估和 PoC 周期。
-
新媒体与内容创作者:有高频语音转文字需求(播客转稿、采访整理、视频字幕)的内容团队。通过预录 STT 的批处理和智能格式化功能,可将数小时的音频在几分钟内转为结构化文稿。前置条件:需要对接工具或自行开发集成脚本;中文支持通过 Nova-3 Multilingual 可用,但准确率需实测。
-
不适配人群:需要极低预算下进行纯离线大批量转录(无网络依赖)的项目(推荐考虑 Whisper 等开源方案);需要使用中文语音合成的高质量 TTS 场景(Deepgram 当前 TTS 以英文为主,中文语音支持情况未公开,需以官方文档为准);需要视频级别高表现力情感语音(如游戏角色配音、有声书)的场景——Aura-2 面向的是专业对话场景而非艺术表演场景。
总结与展望
Deepgram 的核心竞争力在于"全栈语音 AI 的统一交付"——它将过去需要拼接多家的 STT、TTS、NLU 能力整合到一套 API 中,并在此基础上叠加了低延迟流式引擎、专精音频智能模型和灵活的部署选项。2026 年上半年的 Flux Multilingual 发布和 Voice Agent API GA,标志着 Deepgram 从"语音识别 API 供应商"向"语音 AI 操作系统平台"的跃迁。
当前限制与不确定项:
- TTS 的语音多样性仍以英文为主,多语言 TTS 的覆盖范围和应用效果未公开,对于非英文市场的客户需确认可用性。
- Voice Agent API 的 BYO LLM 模式下,端到端延迟受外部 LLM 响应速度制约,Deepgram 官方给出的 $4.50/hr 定价假设了使用其推荐的 LLM 配置。
- 中文等亚洲语言的 STT 准确率虽有 Nova-3 Multilingual 支持,但相比英语的公开 benchmark 数据更少,潜在用户需进行实际语料测试。
- 自托管部署的资源需求(GPU 型号、推理节点数量)未在公开页面明确说明,需联系销售获取硬件推荐。
- Audio Intelligence 的摘要/情感/意图模型目前不支持自定义训练,企业若有高度垂直的分类需求可能需要额外的人工规则兜底。
采购与采用风险评估:
- 对于中小团队,建议从 $200 免费额度开始,先验证核心场景(STT 准确率TTS 自然度、端到端延迟)是否满足业务基线,再按需升级至 Growth 计划。
- 对于企业级采购,必须通过 PoC 核验三件事:① 部署拓扑(公共云 vs 私有云 vs 自托管)是否符合合规矩阵;② 关键场景的识别准确率(尤其是专有词汇和噪声有境);③ 年度 TCO 是否在预算范围内(确认附加功能费用、并发峰值成本、以及额外支持的定价)。
- 关注 Deepgram 的产品迭代节奏(约 2-3 个月一个大版本),建议在合同中加入版本升级和 API 废弃的过渡期条款。
相关工具:ElevenLabs、
Udio
版本信息
- Flux Multilingual + Voice Agent API GA :推出 Flux Multilingual 多语言对话式语音识别模型(10 种语言),Voice Agent API 正式商用($4.50/hr),Aura-2 TTS 模型上线,Nova-3 成为默认生产转录模型
- Nova-3 General Availability :Nova-3 模型正式发布,显著提升专有名词和噪声有境下的识别准确率,支持 50+ 语言,Keyterm Prompting 提升关键词召回率最高 625%
- Aura-2 Text-to-Speech Launch :发布 Aura-2 TTS 模型,40+ 英文语音,延迟低于 200ms,面向企业级对话场景优化
- Flux Conversational STT Launch :发布 Flux 对话式语音识别模型,内置话轮检测与打断处理,专为实时语音 Agent 场景设计
用户评价