大数跨境

练口语一年几百块的会员费,被两个开源模型免费平替了

练口语一年几百块的会员费,被两个开源模型免费平替了 兰心运营笔记
2026-09-21
5
导读:AI TOOL · 开源平替2026.09练口语得买年度会员?
AI TOOL · 开源平替

2026.09

练口语得买年度会员?

一个只听,一个只判

口语评测被拆成两半


实时 ASR · 封闭空间判决 · 12GB 显存本地跑

Confucius4-R2T2 × Jev

开源本地部署

📦 3 个看点 + 结语

👉 滑动

PART 01

160ms 真流式

只增不改

PART 02

错读交给模型

漏读多读交给算术

PART 03

一张卡就能跑

12GB 显存起步

PART ///

写在最后

说点实在的

念错的词当场变红,念完出总分——现在能在自己的显卡上跑

上周在客厅干了一件挺无聊的事:对着屏幕大声念英文

念的时候,屏幕上的字会跟着进度逐词往下亮;念错哪个词,它当场变红;念完给总分,还告诉这句里哪几个词是漏读、哪几个词是多念出来的。

这东西以前是要花钱的。口语打分、逐句纠音、流利度评分,一年几百块,录音还得上传到别人的服务器。

现在它被两个开源模型拆开平替了。一个负责「听」,一个负责「判」,一张 12GB 显存的 NVIDIA 卡就能跑起来。

想在家大声朗读练口语的,这篇建议先收藏

01

PART


分工挺好玩:一个听,一个判

DIVISION OF LABOR

这两个模型完全不是一个路子

TOOL 听

R2T2 · 把你说的话变成文字

只增不改,还顺手给出时间戳。

TOOL 判

Jev · 只回答封闭问题

是不是、选哪个、打几分,多一个字都不答



一个负责感知,一个负责裁决

真正有意思的是 Jev 的“本事”窄得离谱:是否、选一个选项、1 到 5 打分,然后给一个概率,就这样。它不是通用大模型,没法让它写文章、聊天、做翻译。

但它快。单次判决几十到几百毫秒,调用成本几乎可以忽略。

所以项目里只问它文本层面的事:读的是不是原文那个词、错法属于哪一类、整段意思有没有走样。发音、重音、口音它一概不评价——它只读文本,判不了声学特征,要评这些得另接音素级的发音评测模型。

02

PART


R2T2:真流式,最细 160ms 吐一个词

REAL-TIME ASR

R2T2 全称 Real Real-Time Transcription,网易有道出品,底座是 Qwen3-ASR,1.7B 规模,整体约 2B 参数

它的核心创新叫 stable prefix,最长稳定前缀。

传统流式 ASR 的干活方式是“先猜后改”——一边听一边往外吐词,下一秒听到更多音,就把刚说出口的字改掉。I want to book 过一会儿可能变成 I want to look

给人看实时字幕,改一改无伤大雅。可下游要是再接一个模型,它就得跟着反复撤销自己刚做的判断,前一步判完的分全作废。

R2T2 的机制是:已经提交出去的文本,只增加,不修改。它吐出来的每一个词都是终局判决

有了这层保证,才敢把识别结果直接拿过来,去算漏读、多读、错读。否则屏幕上画好的线要来回闪,判过的分得重判。

吐词间隔最低 160ms,解码块能在 80ms 到 2s 之间调。而且这个延迟不是用准确率换来的:

数据集
R2T2
Qwen3-ASR base
LibriSpeech clean(英文)
2.13
3.86
CN-RealSI(中文)
3.48
4.92
TED-LIUM(英文)
3.34
3.75

开源流式 ASR 里目前是SOTA 水平,跟头部闭源系统比也不虚。模型权重在 Hugging Face 和 ModelScope 上都能下,推理代码走 Apache 2.0

03

PART


漏读、多读、错读,到底谁在算

WHO COUNTS WHAT

这是整个项目里最喜欢的设计。

它没有把所有东西都丢给大模型,而是先做词级对齐。对齐会挑出哪些词对不上,只有这些“对不上”的词才值得去问模型,剩下全是本机算术

评判项直接摊开看:

评什么
谁算
对应哪类错误
读的是不是原文那个词
Jev
错读
错法属于哪一类(替换、ASR 拼写变体、自我纠正)
Jev
错读细分
整段意思有没有走样(1–5 打分)
Jev
语义走样
漏读、多读、完整度
词级对齐 + 算术
漏读、多读
语速与停顿
R2T2 时间戳 + 算术
总分
本机加权

错读交给模型判,漏读多读交给算术算

一句话说清两个模型的分界线

这也解释了为什么 stable prefix 是前提,而不是一个可有可无的优化项。文本只增不改,屏幕上的线才不会闪判过的分才不用重判

04

PART


一张卡就能跑,但 Mac 不行

HARDWARE

自部署 R2T2 的门槛比想象中低:一张 NVIDIA 显卡,12GB 显存够用,需要Ampere 架构以上

Mac 跑不了,因为它的 infer_mode 绑死了 vLLM,必须有 CUDA。

没显卡也想先看效果的话,把 ASR_PROVIDER 设成 mock 就行——不碰麦克风,预埋三类真实错误,整条判分链路照样跑通

音频不出本机,也没有时长限制。这点对练口语的人挺重要:可以反复念同一段,念到满意为止,不用担心被按分钟计费

想马上试,也可以走网易有道的线上 demo 中继,单次会话 30 秒上限,适合先摸个手感。

05

PART


三分钟上手,两个坑

QUICK START

仓库是 Next.js 写的,跑起来三步:

...bash

npm install

npm run dev # http://localhost:3000

npm test # 对齐 / mock / 节奏算术的单测,不联网

.env.local 里填这几行,别提交到 git

...env

JEV_API_KEY=sk-ai-v1-...

JEV_ENDPOINT=https://zenmux.ai/api/v1/systemone

JEV_MODEL=typesafe/jev-1.13


ASR_PROVIDER=r2t2

R2T2_WS_URL=wss://...

R2T2_LANGUAGE=English

两个坑,自己都踩过一遍:

!坑一 · 变量名 🕳

变量名必须叫 JEV_API_KEY。别写成 ZENMUX_API_KEY,shell 里很可能已经有同名的环境变量,会把 .env.local 里的设置覆盖掉,然后会对着一个"key 明明是对的却报 401"的报错发呆。

!坑二 · 别塞原文 🕳

别设 R2T2_SYSTEM_PROMPT 去塞原文。看着挺聪明——把原文告诉模型,它不就能读得更准了吗?实际结果是 LLM 解码器会顺着提示,把念错的词直接“修”成原文,分数一路满分,评测彻底失真。这条调试时想了很久才反应过来。

///

LAST


说点实在的

FINAL THOUGHTS

一直觉得,2026 年最有意思的 AI 应用形态,不是又一个大模型,而是两个小模型各干一件窄事,拼出一个以前要花钱才有的体验。

R2T2 只干听,Jev 只干判,加起来把口语评测这件事做完了,还顺手把隐私和费用的问题一起解决。仓库 README 里那句描述挺喜欢——“对着屏幕念一段英文,念完就知道哪个词念错了”。就这么点事,做到位了就是刚需

有卡的今晚就能试,没卡的先用 mock 模式看看效果。在家大声朗读练起来。

R2T2 模型:https://huggingface.co/netease-youdao/Confucius4-R2T2
开源项目:https://github.com/wquguru/dasheng

分享的主要是关于 AI、互联网、创业、副业、职场规划等思路。

如果觉得文章不错,随手点个赞、在看、转发三连吧,如果想第一时间收到推送,也可以给个星标⭐~谢谢你看我的文章,我们,下次再见~

点赞
在看
转发

THANKS FOR READING


【声明】内容源于网络
0
0
兰心运营笔记
分享电商、兼职、副业运营笔记,了解你不知道的信息差,欢迎订阅!
内容 71
粉丝 1
兰心运营笔记 分享电商、兼职、副业运营笔记,了解你不知道的信息差,欢迎订阅!
总阅读25.2k
粉丝1
内容71