大数跨境

应用实践|Audio OCR:让电脑真正“听见”世界

应用实践|Audio OCR:让电脑真正“听见”世界 阿里语音AI
2026-07-16
2
导读:基于 Fun-ASR 的桌面 Audio OCR,让电脑播放的声音像图片 OCR 一样被实时捕获、复制和搜索。
语音识别早已不只是字幕、听写或会议纪要。
如果一个API 能稳定、低延迟地把正在发生的声音变成文字,它就不再是简单的“转写工具”,而是一种全新的输入能力——让应用真正开始听见世界。基于阿里云百炼Fun-ASR 实时语音识别 API 打造的桌面原型 Audio OCR for Desktop,正是对这一能力的直观验证。它试图回答一个朴素却关键的问题:
如果电脑正在播放的声音,也能像图片OCR 一样被实时捕获、复制、搜索和回看,会怎么样?
这个原型没有手写大量代码。从系统音频捕获、Fun-ASR API 调用、桌面悬浮窗、macOS 状态栏工具、快捷键、本地保存到 AI 建议,所有功能都通过持续迭代想法、试错与方向调整逐步落地。这也是实时语音识别真正有趣的地方:当API 足够稳定,一个“能不能做”的想法,可以很快变成“先跑起来看看”。

它怎么工作

Audio OCR 可以识别两类声音:

  • 声卡输出:电脑正在播放的声音,例如视频、直播、会议、播客。

  • 麦克风输入:当前正在说的话。

两路可以单独开启,也可以同时运行。

(图1:系统工作流程图)

系统通过抓取声卡音频与麦克风输入,将数据送入 Fun-ASR 实时识别 API,输出带 LIVE / FINAL 状态的文字结果。LIVE 表示模型正在实时跟听并可能持续修正,FINAL 则代表语句已稳定,可直接用于保存、搜索或导出。

识别结果一方面推送到桌面悬浮字幕窗,另一方面保存为带时间线的本地文字记录与字幕文件。

(图2:状态栏菜单)

它看起来有点像音乐软件的桌面歌词:声音一边播放,字幕一边出现。

悬浮窗里会显示当前识别内容、最近两条已确认结果,以及 LIVE / FINAL 状态。

  • LIVE:模型正在实时跟听,结果可能继续修正。

  • FINAL:一句话已经结束,可以保存、搜索、导出。

(图3:悬浮窗界面)

为什么适合展示 Fun-ASR

这个 demo 的好处是,普通人一眼就能看懂。

声音刚出来,文字就跟上。不是“识别完以后给你一坨文本”,而是可以直接变成字幕、笔记、搜索入口、剪辑素材。

它能直观展示 Fun-ASR 的几个特点:

  • 低延迟:音频流式送入,文字持续返回。

  • 实时修正:先返回 LIVE,再稳定成 FINAL。

  • 带时间线:后续可以做字幕、剪辑、回放。

  • 可编程:识别结果可以继续接 Agent、规则、搜索、大模型。

这不是在证明“我们做了一个字幕工具”,而是在证明:

当实时语音识别足够快、足够稳,应用就可以拥有一对“耳朵”。

下面是一个真实运行的例子:

[00:03.310 -> 00:19.670] 他中国互联网传奇人物,他用他的创业精神打造了一个真实而庞大的电商王国,他所创立的电子商务平台正在影响着上亿人的生活。[00:20.870 -> 00:32.39049岁,他辞任 CEO,用实际行动践行着《道德经》中的至理名言:功成名遂身退,天之道。[00:33.070 -> 00:47.430] 他就是阿里巴巴集团董事局主席马云,他用成功告诉所有人,如果我可以成功,那么80%的创业者都可以成功。[00:47.970 -> 00:57.890] 敬请期待《马云说创业》看创业教父马云如何为创业者们拨开云雾、指点迷津。

接上LLM


Fun-ASR 负责把声音变成实时文字流,LLM 可以继续理解、判断和行动。

在通话、面试、销售沟通等场景中,对方说的话由声卡识别,本地说的话由麦克风识别。两路文字合在一起,就变成 LLM 可以理解和分析的实时上下文。

原型中已经做了一个轻量版本:状态栏里可以选择 AI 任务,让大模型读取最近的声卡和麦克风转写,实时生成建议窗口。
目前支持:
  • 总结:把刚才听到的内容压成几行摘要。
  • 麦克风答复建议:提示下一句怎么回。
  • 面试者建议:帮面试者判断问题意图、组织回答。
  • 面试官建议:帮面试官整理回答、生成追问。
  • 自定义提示词:自己定义实时分析任务。

这类能力的关键不只是大模型,而是前面那条低延迟、稳定的实时转写流。提示来得太晚,就已经错过对话节点。

还可以什么

Audio OCR 只是一个小例子。同样的能力还可以做:

  • 任意播放器的实时字幕层
  • 视频课程自动笔记
  • 直播、播客、采访打点
  • 本地会议字幕和回看
  • 剪辑素材搜索
  • 游戏或协作语音指令
  • 销售、客服、面试、培训的实时辅助

本质都是一件事:

把连续的声音,变成实时、可操作、可编程的信息流。

结语

这个原型不是终点。

真正想展示的是:当 Fun-ASR 把实时语音识别做得足够快、足够稳,声音就可以变成应用里的实时输入流。

它不只能做字幕,也可以做笔记、搜索、剪辑、会议回看、对话辅助,甚至成为 Agent 感知世界的一部分。

如果说过去的应用主要靠键盘、鼠标、摄像头和截图来理解用户,那么 Fun-ASR 提供的是另一种能力:

让应用听见正在发生的声音。

这也是 Fun-ASR 最有想象力的地方。

【声明】内容源于网络
0
0
阿里语音AI
阿里巴巴通义实验室语音团队,基于多模态大模型语音识别、语音合成、自然语言理解等 AI 技术,实现“能听、会说、懂你”式的智能人机交互体验。
内容 132
粉丝 0
阿里语音AI 阿里巴巴通义实验室语音团队,基于多模态大模型语音识别、语音合成、自然语言理解等 AI 技术,实现“能听、会说、懂你”式的智能人机交互体验。
总阅读730
粉丝0
内容132