AI音频
-
Whisper Live Kit WLK
自托管的超低延迟实时语音转写工具包,兼容 OpenAI REST、Deepgram WebSocket 与原生流式接口
-
Gemini 3.1 Flash TTS Google
Google推出的新一代文本转语音模型,支持70+语言和音频标签导演级控制
-
Whisper OpenAI
OpenAI 开源通用语音识别模型,MIT 许可,支持 99+ 种语言的转写与翻译
-
FunASR Tongyi Lab
阿里通义实验室开源的工业级语音识别工具包,50+语言170x实时率、私有化部署
-
Voicery Voicery
高质量AI语音合成服务,提供自然逼真的文字转语音能力
-
Voicemod Voicemod
实时AI变声工具,支持游戏、直播和社交场景的语音趣味化处理
-
Fun-CosyVoice 3.5 FunAudioLLM
阿里通义实验室FunAudioLLM团队推出的多语种语音生成模型,支持FreeStyle自然语言指令控制与零样本语音克隆
-
Fun-ASR-Realtime Alibaba Cloud
阿里千问推出的流式实时语音识别大模型,支持16种方言和30种语言实时识别
-
Voicebox Meta
Meta 研究团队提出的通用语音生成模型,核心卖点是零样本、多任务和更快推理
-
Fun Asr Fun-ASR
通义实验室开源的端到端语音识别大模型,支持中文方言与31种语言
-
Typecast Typecast
710+ AI语音角色 + SSFM 语音合成模型——最有表现力的AI语音平台
-
Fish Audio Fish
主打情感表现力的文本转语音与语音克隆平台,背后有开源 Fish-Speech 模型











