大数跨境

口语转录,一步到位!全国产算力语音识别模型,听得懂上下文了

口语转录,一步到位!全国产算力语音识别模型,听得懂上下文了 智东西
2026-09-24
6
导读:四大维度实测讯飞最新语音识别大模型。

四大维度实测讯飞最新语音识别大模型。
作者 |  杨京丽
编辑 |  李水青

智东西9月24日报道,昨日,科大讯飞推出最新语音识别大模型Spark-ASR-2.0。该模型基于讯飞语音基座大模型Spark-Audio-1.0-Preview构建,重点提升通用识别、复杂声学场景识别、上下文识别和文本流畅规范性四大维度。

值得注意的是,语音基座大模型Spark-Audio-1.0-Preview和语音识别模型Spark-ASR-2.0均基于全国产算力展开训练。讯飞正以多年积累的智能语音技术和国产算力平台大模型训练经验为基础,持续推进语音基座及专用模型的技术迭代。

当前,大多数语音识别模型在日常使用中虽能准确转写,但在嘈杂环境、中英文混合输入,或专业会议转录时,仍易出现错漏字;且语气词、重复和临时改口常需二次整理。为验证Spark-ASR-2.0的解决能力,智东西围绕前述四个方向展开实测。结果表明,该模型表现稳定,能通过上下文修正歧义、减少口头语,输出可直接使用的文本。目前,Spark-ASR-2.0已上线讯飞输入法,并通过讯飞开放平台提供API服务,后续将逐步应用于讯飞AI眼镜、智能办公本和讯飞听见等产品。

01. 通用与复杂场景实测:方言、术语与悄悄话轻松识别

方言与专业术语精准识别

在通用识别能力方面,首先使用河南话进行测试。模型在话音刚落瞬间即完成准确识别。据悉,Spark-ASR-2.0现已支持全国202种方言免切换识别。

接着,在中英文混合及专业术语场景下,使用包含RISC-V、TPU、VISA等英文缩写及芯片专业术语的长句进行测试。Spark-ASR-2.0完整且准确地识别了整段内容及专业词汇,这将大幅减少科技媒体、技术会议等场景的人工校对成本。

复杂声学场景表现出色

在复杂声学场景实测中,首先在地铁噪音场景下,模型在明显背景噪声中仍能区分环境与说话声音,准确识别并完整转写“一号线”、“东单”等关键信息。

此外,在悄悄话识别能力测试中,即使刻意压低音量使用气声说话,模型仍能准确识别完整内容,完美适配办公室等不便大声说话的场景。

02. 上下文纠错与口语规范:转写实现“零返工”

上下文智能纠错

准确识别语音只是第一步,用户更期望模型能根据上下文输出流畅规范的文本。在上下文识别测试中,模型能根据后文“山峰的峰”,准确判断出“张三峰”的正确写法,避免同音字错误;也能结合语境解释,将易混淆的“灵”和“苓”自动纠正。

口语规范化与复杂信息排版

在文本流畅性方面,面对日常语音中常见的停顿、磕绊、改口,模型能自动删去冗余内容,将时间修正为“8点半”,并按正确格式输出邮箱地址。

在包含日期、取件码、快递单号等复杂信息的测试中,模型准确识别各类信息,且连续数字、字母和符号混合输出的格式规整,无遗漏或中断,转写结果可直接使用。

03. 技术解析:先快速识别后重点纠错,推理成本仅增10%

基于全国产算力的架构演进

Spark-ASR-2.0的升级建立在讯飞语音大模型的持续演进之上。9月16日,科大讯飞推出基于全国产算力训练的语音基座大模型Spark-Audio-1.0-Preview,支持语音转写、多语言翻译、多方言识别、环境音识别、情感分析及复杂音频问答等任务。Spark-ASR-2.0作为基于该底座打造的专用模型,同样基于全国产算力训练,进一步聚焦识别的准确性、实时性、语言理解与文本规范。

相较于去年首发的非自回归语音识别大模型Spark-ASR-1.0(实现推理成本下降84%,效果提升16%),Spark-ASR-2.0在核心场景的WER(词错误率)绝大多数低于业界最优水平,在方言、高噪和小音量场景下表现尤为突出。

非自回归与自回归融合创新

为兼顾识别效果、响应速度与推理成本,Spark-ASR-2.0延续了非自回归识别能力,并融合LLM增强的自回归识别能力。模型先由非自回归模块并行快速生成整段语音的初步转写,再通过投机解码判断是否存在需结合上下文进一步理解或修正的内容。

该机制避免了对全文重新解码,在控制推理时延和计算成本的同时,提升了对复杂语境和口语化内容的识别能力,整体推理成本较上代仅增加10%。

上下文注入与混合语言优化

针对中英文混合场景的数据匮乏问题,模型通过补充英文专有词与热词进行联合训练,提升了专业术语识别能力。同时,引入动态上下文注入机制,结合当前语音、个性化热词和用户历史修改,从万级热词库中筛选候选词,在不增加响应时延的前提下,大幅提升人名及易混淆表达的识别准确率。

04. 结语:语音识别走向“流畅成文”

当前,语音识别的竞争焦点已从单纯的声音转文字,转向复杂环境下的稳定转写与口语自动成文。科大讯飞从实际需求出发,解决降噪、专业术语、口头语等痛点,推动语音识别向“流畅成文”演进,使其成为直接提升效率的生产力工具。

这亦是科大讯飞长期深耕智能语音技术的延续。讯飞曾连续六届斩获语音识别国际权威赛事CHiME冠军,并以第一完成单位身份荣获2024年“多语种智能语音关键技术及产业化”国家科学技术进步奖一等奖。

在大模型时代,科大讯飞将深厚技术积淀与AI深度融合。从语音基座模型到语音识别大模型,再到未来规划的系列语音大模型,讯飞正不断突破技术天花板,持续推动应用落地与业务赋能。

【声明】内容源于网络
0
0
智东西
各类跨境出海行业相关资讯
内容 11851
粉丝 0
智东西 各类跨境出海行业相关资讯
总阅读251.8k
粉丝0
内容11.9k