▎它怎么工作?
Audio OCR 可以识别两类声音:
-
声卡输出:电脑正在播放的声音,例如视频、直播、会议、播客。
-
麦克风输入:当前正在说的话。
两路可以单独开启,也可以同时运行。
(图1:系统工作流程图)
系统通过抓取声卡音频与麦克风输入,将数据送入 Fun-ASR 实时识别 API,输出带 LIVE / FINAL 状态的文字结果。LIVE 表示模型正在实时跟听并可能持续修正,FINAL 则代表语句已稳定,可直接用于保存、搜索或导出。
识别结果一方面推送到桌面悬浮字幕窗,另一方面保存为带时间线的本地文字记录与字幕文件。
(图2:状态栏菜单)
它看起来有点像音乐软件的桌面歌词:声音一边播放,字幕一边出现。
悬浮窗里会显示当前识别内容、最近两条已确认结果,以及 LIVE / FINAL 状态。
LIVE:模型正在实时跟听,结果可能继续修正。
FINAL:一句话已经结束,可以保存、搜索、导出。
(图3:悬浮窗界面)
▎为什么适合展示 Fun-ASR
这个 demo 的好处是,普通人一眼就能看懂。
声音刚出来,文字就跟上。不是“识别完以后给你一坨文本”,而是可以直接变成字幕、笔记、搜索入口、剪辑素材。
它能直观展示 Fun-ASR 的几个特点:
低延迟:音频流式送入,文字持续返回。
实时修正:先返回 LIVE,再稳定成 FINAL。
带时间线:后续可以做字幕、剪辑、回放。
可编程:识别结果可以继续接 Agent、规则、搜索、大模型。
这不是在证明“我们做了一个字幕工具”,而是在证明:
当实时语音识别足够快、足够稳,应用就可以拥有一对“耳朵”。
下面是一个真实运行的例子:
[] 他中国互联网传奇人物,他用他的创业精神打造了一个真实而庞大的电商王国,他所创立的电子商务平台正在影响着上亿人的生活。[] 49岁,他辞任 CEO,用实际行动践行着《道德经》中的至理名言:功成名遂身退,天之道。[] 他就是阿里巴巴集团董事局主席马云,他用成功告诉所有人,如果我可以成功,那么80%的创业者都可以成功。[] 敬请期待《马云说创业》看创业教父马云如何为创业者们拨开云雾、指点迷津。
▎接上LLM
Fun-ASR 负责把声音变成实时文字流,LLM 可以继续理解、判断和行动。
在通话、面试、销售沟通等场景中,对方说的话由声卡识别,本地说的话由麦克风识别。两路文字合在一起,就变成 LLM 可以理解和分析的实时上下文。
原型中已经做了一个轻量版本:状态栏里可以选择 AI 任务,让大模型读取最近的声卡和麦克风转写,实时生成建议窗口。
目前支持:
-
总结:把刚才听到的内容压成几行摘要。
-
麦克风答复建议:提示下一句怎么回。
-
面试者建议:帮面试者判断问题意图、组织回答。
-
面试官建议:帮面试官整理回答、生成追问。
-
自定义提示词:自己定义实时分析任务。
这类能力的关键不只是大模型,而是前面那条低延迟、稳定的实时转写流。提示来得太晚,就已经错过对话节点。
这类能力的关键不只是大模型,而是前面那条低延迟、稳定的实时转写流。提示来得太晚,就已经错过对话节点。
▎还可以做什么
Audio OCR 只是一个小例子。同样的能力还可以做:
-
任意播放器的实时字幕层 -
视频课程自动笔记 -
直播、播客、采访打点 -
本地会议字幕和回看 -
剪辑素材搜索 -
游戏或协作语音指令 -
销售、客服、面试、培训的实时辅助
本质都是一件事:
把连续的声音,变成实时、可操作、可编程的信息流。
▎结语
这个原型不是终点。
真正想展示的是:当 Fun-ASR 把实时语音识别做得足够快、足够稳,声音就可以变成应用里的实时输入流。
它不只能做字幕,也可以做笔记、搜索、剪辑、会议回看、对话辅助,甚至成为 Agent 感知世界的一部分。
如果说过去的应用主要靠键盘、鼠标、摄像头和截图来理解用户,那么 Fun-ASR 提供的是另一种能力:
让应用听见正在发生的声音。
这也是 Fun-ASR 最有想象力的地方。

