Fun-ASR1.5 免费

-

Fun-ASR1.5 是阿里通义团队推出的端到端语音识别大模型,基于MoE架构,单模型支持30种语言、七大方言体系及二十余种地方口音,内置智能标点预测与文本归一化能力。

Fun-ASR1.5 产品界面

Fun-ASR1.5:阿里通义端到端语音识别模型

Fun-ASR1.5 的核心参数与统计

项目 详细信息
产品名称 Fun-ASR1.5(阿里通义语音识别模型)
产品类型 端到端语音识别大模型
交付形式 Python库 / API / CLI / MCP Server
支持语言 30种语言(中、英、日、韩、法、德、西、葡、俄、阿拉伯语等)
方言覆盖 七大方言体系,重点优化上海话、粤语、四川话等15种高需求方言
架构 MoE(混合专家架构)
最新版本 FunASR 1.3.19(2026-07-19)
开源协议 MIT(工具包)/ 模型权重另附协议
GitHub Stars 19.3k
目标用户 开发者、企业、研究机构

参数解读:单模型覆盖30种语言意味着部署时不需要为每种语言单独维护模型实例,MoE架构确保只有在识别特定语言时激活对应专家模块,推理效率高于同等规模的密集模型。方言字错误率(CER)相较上一版本下降56.2%,在实用场景中能显著减少人工校对成本。

Fun-ASR1.5 的用户与市场认可

Fun-ASR1.5 背后是阿里巴巴达摩院开源的 FunASR 项目(GitHub 19.3k Stars),是目前中文语音识别领域社区最活跃的端到端工具包之一。PyPI 累计下载量已覆盖大量个人开发者和企业用户,社区贡献者超过 178 人。

在基准测试中,Fun-ASR-Nano(Fun-ASR1.5 系列旗舰模型)在中文长音频测试集上的字错误率(CER)仅为 8.20%,远低于 Whisper-large-v3-turbo 的 21.71%,推理速度达到 340 倍实时(搭配 vLLM),是 Whisper 的 26 倍以上。SenseVoiceSmall 模型在 CPU 上即可达到 17 倍实时推理,无需 GPU 即可满足生产级吞吐。

该项目已被广泛应用于会议纪要、智能客服、语音搜索、字幕生成、在线教育等场景,企业级用户可通过阿里云百炼平台直接调用 API。

Fun-ASR1.5 的成本优势

Fun-ASR1.5 是完全开源的项目,核心优势在于零许可证成本。

成本维度 说明
工具包使用 MIT 协议,完全免费,可商用
模型权重 以模型卡协议为准,大部分可免费商用
API 调用(阿里云百炼) 按量计费,具体以阿里云实时报价为准
私有化部署 自建服务器,仅需承担基础设施成本
竞品对比(Whisper API) 自部署情况下推理速度高 26 倍,同等吞吐下硬件成本大幅降低

C 端成本:通过魔搭社区在线体验完全免费,本地部署仅需一台带 GPU 的机器(CPU 也可运行 SenseVoiceSmall 模型)。 B 端成本:企业可选择阿里云百炼 API 按量付费,或私有化部署避免数据出域。自部署模式下,Fun-ASR1.5 的推理效率使其在同等硬件上可承载远高于 Whisper 的并发量。

Fun-ASR1.5 的主要功能

  • 多语言识别:单模型覆盖中、英、日、韩、法、德、西、葡、俄、阿拉伯语等 30 种语言,无需为每种语言部署独立模型。适用于跨国会议、多语言内容生产场景。

  • 自动语种切换(Code-Switching):无需预设语种标签,自动识别并处理同一段对话中的多语言混合语音。这对于中英混杂的商务会议、科技播客等场景极为实用,免去手动分段标注的繁琐。

  • 方言与口音识别:覆盖七大方言体系及二十余种地方口音,重点优化上海话、粤语、四川话、闽南语等 15 种高需求方言。方言字错误率较上版下降 56.2%,支持原汁原味的方言文字还原。

  • 古诗词诵读识别:构建了涵盖《诗经》《楚辞》、李白杜甫诗集、苏轼辛弃疾词作等经典文本的真人诵读语料库,字符级准确率达 97%。对国学教育、文化传承数字化场景有独特价值。

  • 智能后处理:基于上下文语义自动插入逗号、句号、问号等标点符号,同时将口语中的数字、日期、金额、电话等自动转换为规范书面格式。该功能可大幅减少会议纪要、法律笔录等场景的后期人工编辑时间。

Fun-ASR1.5 的模型与版本演进

Fun-ASR1.5 是一个持续迭代的开源项目,最新主干版本为 FunASR 1.3.19(2026-07-19 发布)。核心演进脉络如下:

版本 日期 关键变化
FunASR 1.3.19 2026-07-19 实时 WebSocket 长会话诊断日志打包到 PyPI 文档中
FunASR 1.3.18 2026-07-19 修复 CLI 字幕分段回归,SRT 输出按句子切分
FunASR 1.3.17 2026-07-19 SenseVoice llama.cpp 运行时改进,Windows CUDA 支持
FunASR 1.3.16 2026-07-18 Fun-ASR-Nano 实时 WebSocket 服务从 PyPI 直接安装
FunASR 1.3.15 2026-07-17 流式传输可靠性提升,Fun-ASR-Nano 兼容性修复
FunASR 1.3.3 2026-05-24 funasr-server CLI、OpenAI 兼容 API、MCP Server
Fun-ASR-Nano-2512 2025-12-15 首个 Fun-ASR-Nano 旗舰模型发布

模型谱系上,FunASR 工具包提供多个模型选择:Fun-ASR-Nano(中/英/日 + 方言)、Fun-ASR-MLT-Nano(31 语言)、SenseVoiceSmall(5 语言 + 情感识别)、Paraformer(低延迟流式 ASR)、Qwen3-ASR(52 语言)等,用户可根据场景精度、语言覆盖和硬件条件灵活选型。

Fun-ASR1.5 的技术优势

Fun-ASR1.5 的核心技术优势可以从架构、推理效率、部署灵活性三个层面拆解:

  • MoE 混合专家架构:模型内部包含多个语言相关的专家子网络,听到特定语言时仅激活对应专家模块。这一设计使单模型覆盖 30 种语言时参数效率远高于同等规模的密集模型,推理时计算量大幅降低,同时各专家模块可独立优化互不干扰。

  • 分级分阶段训练策略:在训练阶段分级、分阶段使用精准数据进行训练——先做通用多语言预训练,再进行方言/口音微调,最后做专项场景(如古诗词)对齐。这种训练流程使得模型在真实世界复杂语音场景下的鲁棒性显著优于单一阶段训练的模型。

  • 全链路部署矩阵:从 Python 库(pip install funasr)到 OpenAI 兼容 API 服务(funasr-server),从 llama.cpp/GGUF 边缘端二进制到 Docker 容器化部署,从 MCP Server 到 vLLM 批量推理引擎,覆盖了从个人开发机到大规模生产集群的完整部署需求。特别是 llama.cpp 运行时将 FunASR 带到纯 CPU 和边缘设备上,无需 Python 运行时,在 IoT 和嵌入式场景中具备独特优势。

  • 推理性能领先:Fun-ASR-Nano + vLLM 达到 340 倍实时(RTFx),SenseVoiceSmall 在 CPU 上达到 17 倍实时。对比 Whisper-large-v3 的 13 倍实时(GPU),FunASR 在 CPU 上的推理速度甚至超过 Whisper 在 GPU 上的表现,使 CPU 无卡部署成为可行方案。

Fun-ASR1.5 如何使用

Fun-ASR1.5 提供多种使用方式,开发者可根据场景灵活选择:

入口 说明
Python 库(pip) pip install funasr,通过 AutoModel API 调用
CLI 命令行 funasr audio.wav 即转写,支持 SRT/JSON 输出
OpenAI 兼容 API funasr-server --device cuda 启动服务,POST /v1/audio/transcriptions
MCP Server 供 Claude/Cursor 等 AI Agent 调用语音识别能力
魔搭社区在线体验 浏览器直接使用,无需安装:https://modelscope.cn/studios/iic/FunAudio-ASR
llama.cpp 二进制 纯 CPU/边缘端运行,无需 Python 有境

Python 快速上手

from funasr import AutoModel

model = AutoModel(model="FunAudioLLM/Fun-ASR-Nano-2512", device="cuda")
result = model.generate(input="audio.wav")
print(result[0]["text"])

CLI 一行转写

funasr audio.wav --output-format json --spk --timestamps

启动 API 服务

funasr-server --device cuda
# 服务启动后在 localhost:8000 提供 OpenAI 兼容接口

典型使用流程:安装 FunASR → 加载模型(自动下载权重)→ 输入音频文件/流 → 获取结构化识别结果 → 后处理(标点/归一化)。全程无需手动设置语种标签,模型自动识别。

Fun-ASR1.5 的产品定价

Fun-ASR1.5 的开源策略使其在成本上具有显著优势:

  • 社区版(免费):通过 PyPI 安装GitHub 仓库下载、魔搭社区在线体验,全部免费。MIT 开源协议允许商业使用和二次开发。
  • 阿里云百炼 API(按量付费):对于不想自建基础设施的用户,可通过阿里云百炼平台调用 API,按调用量计费,具体价格以阿里云实时定价页面为准。
  • 企业私有化部署(自建):企业可在自有服务器上部署,仅需承担计算资源成本。利用 FunASR 的高推理效率,单张 GPU 可承载大量并发请求。

与商业语音识别服务(如 Azure Speech、Google Cloud Speech-to-Text、Whisper API)相比,Fun-ASR1.5 自部署方案的 TCO(总拥有成本)在中大规模使用场景下具有显著优势,且数据不出域,满足合规要求。

Fun-ASR1.5 的应用场景

  • 跨国会议与多语言转写:在跨国会议中实时精准转写多语言混合对话内容,无需提前预设语种,单模型即可覆盖 30 种语言。自动标点与文本归一化大幅降低了后期整理成本。

  • 智能客服语音分析:将客服通话录音批量转写为结构化文本,支持方言识别和说话人分离,用于服务质量监控、热点问题挖掘和情绪分析。

  • 在线教育与国学数字化:古诗词诵读识别的 97% 字符准确率使其成为国学在线教育的独特工具,可将学生诵读实时转写为文字并进行比对评分。

  • 内容生产与字幕生成:视频创作者可通过 CLI 一行命令将音频转写为 SRT 字幕文件,支持说话人标签和时间戳,适用于播客、课程视频、新闻采访等内容制作。

  • 物联网与边缘设备语音交互:通过 llama.cpp/GGUF 运行时,Fun-ASR1.5 可在纯 CPU 设备上运行,适用于智能音箱、车载语音、工业控制等边缘场景。

Fun-ASR1.5 的适用人群

  • AI 应用开发者:需要将语音识别集成到自有应用中的开发者,可通过 Python SDK、REST API 或 MCP Server 快速接入,pip install funasr 即可开始。

  • 企业IT与数据团队:需要私有化部署语音识别服务的企业,FunASR 提供完整的部署矩阵(Docker、Kubernetes、OpenAI 兼容 API),支持数据不出域。

  • 研究机构与学术用户:开源模型权重和完整的训练、微调工具链,适合语音识别、方言学、多语言 ASR 等方向的研究工作。

  • 内容创作者与媒体人:需要将音频/视频快速转写为文字、生成字幕的创作者,CLI 一行命令完成转写,支持 SRT/JSON/VTT 等格式输出。

  • 不适配人群:对超低延迟(<100ms 端到端)有严苛要求的实时通信场景,建议测试后评估;需要纯云端免运维托管服务的用户,建议优先考虑阿里云百炼 API 而非自部署;不熟悉命令行或 Python 编程的纯业务用户,需通过阿里云百炼可视化界面或第三方集成使用。

Fun-ASR1.5 的总结与展望

Fun-ASR1.5 是阿里通义团队在语音识别领域的重要开源成果,其核心竞争力在于:单模型多语言覆盖(30 种语言 + 七大方言)降低了多模型部署的运维复杂度;MoE 架构带来的推理效率使其在同等硬件上实现远超竞品的吞吐量;全链路开源策略(MIT 协议 + 完整部署工具链)为企业和开发者提供了低成本、高可控的语音识别基础设施。

局限性:模型权重虽可免费使用,但不同模型的许可协议存在差异,商用前需确认具体模型卡的授权条款;超低延迟流式场景(如实时对讲翻译)仍需针对性调优;对极低资源边缘设备(MCU 级别),llama.cpp 运行时仍在持续优化中。

采购/采用风险评估:作为阿里巴巴达摩院维护的开源项目,FunASR 具备长期稳定的社区和企业支持,19.3k GitHub Stars 和 178 名贡献者证明了其生态活跃度。企业在采用时需注意:开源版本不提供 SLA 保障,关键生产有境建议通过阿里云百炼 API 获取企业级支持;模型权重的独立许可协议需要在商用前逐一确认;项目迭代节奏较快(月均多个小版本发布),生产有境应锁定版本并做好回归测试。总体而言,对于有自建能力和数据合规需求的团队,Fun-ASR1.5 是目前中文语音识别领域最具性价比的开源选择之一。

相关工具:Udio

版本信息

  • FunASR 1.3.19 :新增实时WebSocket长会话诊断功能,改进CLI字幕生成与标点加载,更新社区文档。
  • FunASR 1.3.18 :修复SRT字幕分段回归问题,支持句子级时间戳请求,改进标点模型加载。
  • FunASR 1.3.17 :增加实时WebSocket会话诊断日志,SenseVoice llama.cpp运行时改进,Windows CUDA支持。
  • FunASR 1.3.16 :Fun-ASR-Nano实时WebSocket服务可直接从PyPI安装,支持客户端驱动的端点模式。
  • FunASR v1.3.15 :提升流式传输可靠性,修复Fun-ASR-Nano兼容性问题,改进CLI与文本处理。

用户评价

  • 加载评价中...