大数跨境

阿里 SenseVoice:一个 234M 的语音模型

阿里 SenseVoice:一个 234M 的语音模型 路过银河AI
2026-10-03
18
导读:阿里 SenseVoice:一个 234M 的语音模型,和官方资料里四组对不上的数字中文互联网上关于它传得

SenseVoice 专注高精度多语言语音识别、情感辨识和音频事件检测,支持超过 50 种语言识别,效果优于 Whisper 模型,中文与粤语提升显著。其推理速度比 Whisper-Small 快数倍,比 Whisper-Large 快十余倍。

针对网络上关于 SenseVoice 的各项数据传闻,经查阅官方 README、论文、ModelScope 模型页及 GitHub 接口数据,现将可追溯的官方信息与存在争议的数据进行梳理,以正视听。

核心结论:模型本身真实可靠,官方已于 2026 年发布补丁澄清早期夸大宣传。但在速度、参数量、训练数据量及许可证等方面,官方不同文档间存在口径差异,媒体转载时往往选取了其中某一版本,导致信息混乱。

图:SenseVoice 官方主视觉(来源:SenseVoice 官方仓库,MIT)

一、核心功能与定位

根据官方 README 定义,SenseVoice 是一款具备音频理解能力的音频基础模型,集成了以下四大任务:

  • 语音识别(ASR)
  • 语种识别(LID)
  • 语音情感识别(SER)
  • 声学事件分类/检测(AEC/AED)

该项目归属于通义系开源动作之一,GitHub 仓库创建于 2024 年 7 月,目前挂在 QwenAudio 组织下。其技术架构为非自回归端到端框架,通过在语音特征前拼接 LID(语种)、SER(情感)、AED(事件)及 ITN(逆文本正则化)四个嵌入向量来指定任务。输出格式通常为标签前置形式,如 <|en|><|NEUTRAL|><|Speech|><|withitn|>。

官方提供了便捷的 WebUI,通过 python webui.py 即可启动。

图:SenseVoice 官方 WebUI 界面(来源:SenseVoice 官方仓库,MIT)

重要澄清:说话人分离并非 SenseVoiceSmall 模型的原生能力。演示中看到的“区分说话人”功能,实则是 FunASR 结合 FSMN-VAD 和 CAM++ 构建的 Pipeline 能力,而非该模型单独完成。

二、支持的情感、事件与语种

以下标签集合均源自官方 README,属于可严格核对的基础信息。

1. 情感标签(7类)

包括:<|HAPPY|>、<|SAD|>、<|ANGRY|>、<|NEUTRAL|>、<|FEARFUL|>、<|DISGUSTED|>、<|SURPRISED|>。此外还有 emo_unk 表示情感未定。部分媒体报道仅列举了前四种,遗漏了后三种,易造成误解。

2. 音频事件标签(8类)

包括:<|BGM|>、<|Speech|>、<|Applause|>、<|Laughter|>、<|Cry|>、<|Sneeze|>、<|Breath|>、<|Cough|>。

3. 语种标签(5类)

当前公开模型支持:<|zh|>(中文)、<|en|>(英文)、<|yue|>(粤语)、<|ja|>(日文)、<|ko|>(韩文)。

在情感识别方面,官方在 CREMA-D、MELD 等 7 个数据集上进行了评测,并提供了复现脚本,展现了较高的透明度。在事件检测方面,虽然在 ESC-50 等数据集上与 BEATs、PANNs 进行了对比,但官方明确指出:受限于训练数据,其事件分类效果与专业事件检测模型仍有差距,不建议完全替代专用模型。

图:官方情感识别结果表(来源:SenseVoice 官方仓库,MIT)

图:官方音频事件检测对比(ESC-50)(来源:SenseVoice 官方仓库,MIT)

三、速度与性能:官方数据的差异

关于推理速度,官方不同渠道给出的数据存在不一致,需仔细甄别。

  • GitHub README 与论文:指出 SenseVoiceSmall 推理速度比 Whisper-Small 快 5 倍以上,比 Whisper-Large 快 15 倍。
  • ModelScope 模型页:声称比 Whisper-Small 快 7 倍,比 Whisper-Large 快 17 倍。且同一页面内同时出现了“15 倍”和“17 倍”两种表述。

其中,“10秒音频推理耗时 70ms”的数据源自论文 Table 7(RTF 0.007),这一具体数值是可信的。因此,关于“快几倍”的说法,取决于引用的文档版本。媒体转载时多采用 ModelScope 的较高数值,读者在引用时应注明出处。

图:官方推理效率对比(来源:SenseVoice 官方仓库,MIT)

四、参数量与语种范围的真相

1. 参数量 234M

官方 README 和 ModelScope 仅表述为“与 Whisper-Small 相当”。具体数字 234M 仅出现在论文 Table 7 中,与 Whisper-Small 的 224M 确实处于同一量级。

2. 语种范围:5种 vs 50+种

这是一个常见的混淆点。

  • 开源模型(SenseVoiceSmall):仅支持中、粤、英、日、韩 5 种语言。
  • 研究模型(SenseVoiceLarge):支持 50+ 种语言,但该模型并未开源。

官方在 2026 年澄清指出:“40万小时/50+语种”是整体研究项目的训练数据规模,而用户可下载的 Checkpoint 仅支持 5 种语言。此外,训练数据量在 README(40万小时)与论文摘要(30万小时)中也存在表述差异,建议以最新更新的 README 为准,或同时引用两者。

关于“中文与粤语提升 50% 以上”的说法,经查证仅见于部分媒体报道,官方文档中仅有“明显效果优势”的定性描述,并无具体百分比数据。

图:官方多语言 ASR 结果对比(来源:SenseVoice 官方仓库,MIT)

五、许可证与商用规则

许可证问题极易产生合规风险,需特别注意代码与权重的区别。

  • 代码:遵循 MIT License。
  • 权重:遵循 FunASR 模型开源协议。虽然 ModelScope API 返回字段显示为 Apache-2.0,但这与官方说明不符,应以 README 和模型卡为准。

针对 FunASR 协议中“仅供参考和学习”的条款,官方已明确澄清:允许商业使用官方 SenseVoiceSmall 权重,该条款仅为免责声明。但使用时必须遵守署名要求,保留模型名称。自行微调后的衍生权重可保持私有。需注意,此澄清仅适用于官方权重,第三方转换版本(如 GGUF)需单独核实其条款。

六、生态现状与应用

截至 2026 年 10 月 3 日,SenseVoice 在 GitHub 上拥有近万 Stars,ModelScope 下载量突破 6000 万次,显示出极高的实用价值。约 940 MB 的模型体积使其在轻量级应用中具备优势。

社区生态方面,已有多个优秀的第三方适配项目:

项目 特点
Triton + TensorRT GPU 部署加速,支持 fp16
sherpa-onnx 支持 10 种编程语言,覆盖 iOS/Android/树莓派等多平台
SenseVoice.cpp 基于 GGML 的纯 C/C++ 推理,支持多比特量化,无依赖
streaming-sensevoice 通过截断注意力实现伪流式推理,牺牲少量精度换取实时性
OmniSenseVoice 轻量推理库,支持 Batch 推理

此外,仓库地址已从 FunAudioLLM/SenseVoice 迁移至 QwenAudio/SenseVoice,旧地址虽设有重定向,但部分资源链接可能失效,建议开发者直接使用新地址。

【声明】内容源于网络
0
0
路过银河AI
1234
内容 1083
粉丝 1
路过银河AI 1234
总阅读38.9k
粉丝1
内容1.1k