大数跨境

讯飞星火VoiceWise ASR 再升级:方言直转普通话、录音文件识别吞吐提升 2.5 倍

讯飞星火VoiceWise ASR 再升级:方言直转普通话、录音文件识别吞吐提升 2.5 倍 讯飞金融科技
2026-07-29
2
企业对语音识别的要求,正在从“能不能转成文字”,走向“转写结果能不能直接用、系统能不能规模化跑起来”。
在客服、外呼、质检、访谈、会议记录等场景中,语音数据往往来自复杂的业务现场:客户可能使用粤语、四川话、西南官话等方言,音频可能来自 8k 电话信道,也可能来自 16k App 高清语音;当录音量快速增长,离线识别效率又会直接影响质检、合规审查和服务回溯的处理周期。
近日,讯飞星火 VoiceWise ASR 再次迭代升级,正式推出 VoiceWise ASR 方言翻译专项版本与 VoiceWise ASR 录音文件识别专项版本。前者面向方言转写和多采样率接入,让识别结果更易读、更便于后续业务处理;后者面向海量录音离线处理和国产化环境部署,通过模型框架重构与软硬件协同调优,提升系统吞吐能力和资源使用效率。
VoiceWise ASR 方言翻译专项版本:让方言录音更易进入业务链路
在金融、保险、运营商、政务热线等场景中,方言并不少见。客户咨询、续保外呼、投诉处理、满意度回访等语音数据中,常常会出现粤语、四川话、西南官话等表达。
过去,方言识别虽然可以“听懂”,但转写结果往往仍保留大量方言语法、地域词汇和口语表达。对人工质检来说,阅读理解成本较高;对后续 NLP 处理来说,也会影响语义分析、摘要生成、意图识别和风险识别等环节的稳定性。
1. 方言翻译:从“方言原文转写”到“普通话书面表达”
VoiceWise ASR 方言翻译专项版本正式支持粤语、四川话、西南官话的方言翻译,可将方言音频直接转换为标准普通话书面表达,方言翻译准确率均达 85% 以上
这意味着,方言语音不再只是被“原样转写”,而是可以直接形成更适合企业阅读、质检和分析的标准文本。
对客服质检而言,报告可读性更高;对语义分析而言,文本更容易对齐标准普通话表达;对外呼、回访、访谈等场景而言,也可减少人工复核和二次整理工作。
2. 全采样率兼容:一个版本覆盖更多语音入口
除方言翻译外,VoiceWise ASR 方言翻译专项版本还进一步提升了采样率兼容能力
在企业实际部署中,语音来源并不统一。坐席助手、智能导航、外呼系统等电话信道场景通常使用 8k 音频;App 语音交互、会议记录、高清录音等场景则更多使用 16k 音频。
过去,不同采样率场景往往需要分别部署和授权不同引擎。各业务流量难以共享算力资源,低峰期容易出现机器闲置;多版本并行还可能带来授权重复、版本管理分散和运维链路复杂等问题,造成机器利用率不高和资源投入浪费。
新版本实现全采样率兼容,无论是 8k 电话录音,还是 16k App 语音输入均可通过一个版本统一覆盖,并在不同采样率下保持稳定识别效果
这使企业能够以同一套识别能力承载更多业务入口,在客服质检、外呼、座席助手等不同场景之间灵活调配资源,提高机器利用率,减少重复授权和多版本维护投入。
从“多套引擎分别适配”,到“一个版本统一承载”,VoiceWise ASR 正在降低企业语音识别的部署和运维复杂度,让授权与算力资源得到更充分利用。
VoiceWise ASR 录音文件识别专项版本:让海量录音处理更高效、更适配国产化环境
在银行、保险、电商、政务等行业,客服录音、外呼录音、投诉录音、回访录音等数据量持续增长。大量录音文件需要进入质检、合规审查、服务回溯和经营分析环节。如果离线识别速度跟不上,录音积压、质检滞后和管理响应变慢就会成为业务瓶颈。
1. 框架重构与协同调优:整体吞吐量提升至原来的 2.5 倍
传统自回归 ASR 模型在生成文本时,需要依赖前文结果逐步输出,计算过程相对串行。在大批量录音文件处理场景中,这类模式容易限制整体吞吐能力。
此次升级以非自回归框架重构为基础,减少文本生成对前序结果的串行依赖,提高批量音频的并行处理能力;同时围绕昇腾 910B 国产化环境,对推理链路、资源调度和运行适配进行协同优化,使框架能力能够在国产算力上充分释放。
在保证识别准确率的前提下,经过框架重构与国产化适配调优,VoiceWise ASR 录音文件识别专项版本的整体吞吐量提升至原自回归版本的 2.5 倍,即单位时间处理能力提升 150%
以某保险公司质检场景为例,每日约需处理 10 万小时客服录音进行全量质检。按同等业务量和约 8 小时处理窗口测算,旧版本预计需要约 195 台服务器;新版本预计仅需约 78 台服务器即可完成处理,服务器需求量减少约 117 台,降幅约 60%。
2. 国产化适配:让性能提升稳定落到实际部署环境
对企业级 AI 系统而言,国产化适配不只是“能够运行”,还要兼顾识别准确率、吞吐能力、稳定性和运维可用性。
VoiceWise ASR 录音文件识别专项版本已面向华为昇腾 910B 完成深度适配与优化,原生支持昇腾 910B NPU,运行环境支持麒麟 Linux,可顺利融入企业现有国产化基础设施。
通过模型框架与国产算力环境的端到端协同调优,新版本能够将高吞吐能力稳定兑现到实际部署中,降低从既有架构迁移至国产化基础设施的改造复杂度和实施风险。
无论是金融机构的国产化改造、政务系统的基础设施替换,还是运营商的自主可控建设,VoiceWise ASR 都可为海量语音识别提供兼顾性能、稳定性与部署效率的能力支撑。
差异化优势:让语音数据更快、更稳地进入业务流程
讯飞星火VoiceWise ASR 的升级路径,始终围绕企业真实业务需求展开。
面向方言高频场景,它不止于方言原文识别,而是进一步实现方言到普通话书面表达的转换,让识别结果更适合业务系统直接使用。
面向多入口语音场景,它通过一个版本兼容 8k/16k 音频,提高机器利用率,减少重复授权和多版本维护。
面向海量录音文件处理,它通过非自回归框架重构与国产化适配协同调优,在保证准确率的同时提升整体吞吐能力,降低单位业务量所需的服务器资源。
面向国产化基础设施,它通过昇腾 910B 和麒麟 Linux 深度适配,让性能提升能够稳定落到真实生产环境。
这些能力共同构成了 VoiceWise ASR 面向企业级场景的差异化价值:识别结果更易用、资源配置更集约、规模化处理更高效、国产化部署更稳定

如需了解讯飞星火 VoiceWise 产品详情、申请测试评估或获取部署方案,欢迎点击下方“阅读原文”留言,我们将第一时间与您联系。
*数据来源:基于讯飞实际项目应用测试数据

【声明】内容源于网络
0
0
讯飞金融科技
用人工智能助力金融数字化转型
内容 193
粉丝 0
讯飞金融科技 用人工智能助力金融数字化转型
总阅读3.3k
粉丝0
内容193