95美元 vs 4000万美元:一个不会说话的AI,48小时被开源追平
素材说明:本文基于公开报道、开源项目自述数据与开发者实测交叉整理,
数字均标注来源与测试条件,非单一来源转载。
01 48 小时,14 个项目,95 美元
9 月 15 日,一家拿了 4000 万美元种子轮的公司发布了一个模型。
9 月 17 日,有人用 95 美元把它复现了。
准确地说:Jared Palmer 花约 95 美元的 Modal H100 租金,外加 3 美分的 Jev API 调用费,基于通义千问 Qwen3.5 训练出了三个开源决策模型——Kev,0.8B / 4B / 9B,Apache 2.0 协议全公开。
成绩单是这样的(new-source 锁死测试集):
|
|
|
|
|---|---|---|
|
|
|
|
| Kev-9B | 0.837 |
|
|
|
|
|
|
|
|
|
差 2 个百分点。
同一周里,还有 Bespoke Labs 的 Nimble(Qwen3.5-9B 微调),在 324 条 held-out 样本上拿到 90.12%,Jev 是 93.21%——差 3 个点,而它只有 90 亿参数,比 Qwen3.8-27B 小三倍,还高出 5 个点。
还有 SemIf(2685 stars)、jevlike(1122 stars)、openjev。
发布不到一周,社区炸出了十几个项目。
被复现的这个模型叫 Jev,出自 TypeSafe AI,创始人 Diogo Almeida 是 RLHF 和 InstructGPT 的共同发明人——ChatGPT 和 GPT-4 背后最核心的那一步,出自他手。
而他这次做的模型,一句话都不说。
02 让 AI 学会闭嘴的人,正是当年让它开口的人
Jev 不聊天,不写代码,不解释任何事情。你问它问题,它不回一句话——它只回一个数字、一个选项,或者一个 0 到 1 之间的值。
它在 Vercel 的 AI Gateway 上线 24 小时内,接近 13% 的付费团队在用,是 GPT-5.6 系列的两倍、Fable 5.1 的六倍以上。Vercel 称其为"网关历史上采用最快的模型"。一周内,Vercel、Cloudflare、LangChain、Langfuse 全部接入。
Almeida 这样解释它的必要性:
"像问 LLM 一样,向 System One 模型抛出一大堆结构化问题,答案几乎瞬间返回。而 LLM 的响应要慢上几百倍。看看 LLM 是怎么顺序生成的——这对自然对话很棒,但对计算机完全没用。"
大语言模型一个 token 一个 token 往外吐,因为人类说话就是一句一句的。但软件不需要句子。软件需要的是判断结果。
它只提供三种东西,官方叫 primitives:
-
- Choice
—— 从你给的选项列表里选一个,带置信度 -
- Score
—— 在你定义的刻度上给个分,带置信度 -
- Noul
—— 是/否判断,只返回一个 0 到 1 之间的值,不给置信度 -
速度 70 到 500 毫秒,对标前沿模型是 3 到 329 秒。价格:输入每百万 token 0.042 美元,输出免费——因为它根本不生成文本,没东西可计费。
独立开发者 Flavio Copes 给过一个最精准的比喻:
"Jev 就是一个聪明的 if 语句。"
03 但真正的用法,藏在一组 62.6% 里
大部分报道都在讲"快 200 倍、便宜 400 倍"。
真正值得注意的,是另一组数字。有人拿 2000 封钓鱼邮件做了独立测试:
|
|
|
|---|---|
|
|
62.6% |
|
|
|
| Jev,拆成五个窄问题 | 95.0% |
同一个模型、同一个任务,问法不同,差 32 个百分点。
所以结论不是"Jev 更强"或"Jev 更弱",而是:决策模型的性能,不取决于模型,取决于你怎么拆问题。
这是它和聊天模型最根本的区别。你问 ChatGPT 一个问题问得糙,它还能靠上下文猜你的意思,糊弄出一段像样的回答。你问 Jev 一个问题问得糙,它就老实给你一个 62.6%。
它把"你到底想要什么"的成本,从模型身上挪回了你身上。
顺带一句:这个技巧不只适用于 Jev。TypeSafe 自己的图表显示,光是把一个长判断拆成几个小问题,就能让现有模型涨 15 个百分点。你今天就能试。
04 社区把它玩坏了
发布这几天,最好看的不是论文,是开发者拿它做的怪东西。
jevchat(Kyle Pena)——把 Jev 变成一个聊天模型。做法是在每一步问它:"给定用户的问题和已经写好的回复,下一个符号是什么?"一个一个符号往外蹦。
效果极其糟糕。Hacker News 用户 ericpruitt 的评价是:
"这是 Morty 拿着死亡水晶说话的数字等价物。"
(《瑞克和莫蒂》里那块能让人看见所有可能死亡方式的水晶。)
jev-left-pad(Fatih Kadir Akın)——用 Jev 实现 2016 年那个著名的 npm 包。问它:"要在值前面加几个空格才能达到目标长度?"选项从"需要 0 个空格"到"需要 10 个空格"。上了 Hacker News,108 分、44 条评论。
jev-2048(Andy Gayton)——让它玩 2048。有人做了个 Jev 对战 LLM 的网页,Jev 每一步返回概率(比如"向左:0.78"),LLM 只返回一个固定动作。选 2048 是因为它强制连续几百次判断,把速度和成本差异放大到肉眼可见。
这些项目没一个"有用"。但它们把一个抽象概念变成了所有人都能看懂的东西:这不是一个会说话的 AI,这是一个会下注的 AI。
05 开源这边的活儿,干得比想象中漂亮
玩笑归玩笑,开源复现是真的硬。
Nimble 的训练数据怎么来的,是这批项目里最值得看的。他们搞了个方法叫 contrastive data curation(对比式数据构造):
构造两个几乎一模一样的样本,只改一个关键事实,让正确答案翻转。
比如规则是"只有 Mira 可以授权账户 42 的退款"。两个样本里政策部分完全不变,只把授权记录的签名人从 Mira 改成 Noah。前者答案 true,后者翻成 false,其余文本一字不差。
模型被迫学会的,是到底哪条证据才真正应该改变决策。
这个方法的妙处在于:不需要人工标注概率,也不需要从 Jev 蒸馏。标签是硬的对/错,模型自己学会区分。整个训练集 2676 条,覆盖 10 个领域。
推理时它不生成思维链、不生成 JSON——直接读候选答案 token 的 logits 转成概率,程序拼成结构化输出。能不生成一个 token,就不生成一个。 单张 H100 上,每题中位 106 毫秒。
Kev 那边挖出了一个更有意思的发现:学习率是控制基座能力流失的关键。默认学习率 2e-4 会把基座模型已经学会的知识"训没",降到 5e-5 就能保住大部分。
这说明这类微调不是让模型学新东西,而是教它怎么"用"已有的能力去做决策。
架构上,Kev 把多个问题塞进同一个 token 序列,用注意力掩码让它们互相看不见——一次前向传播里批处理一堆独立判断。实测:6 个问题打包成一次请求是 166 毫秒、253 个 token;拆成 6 次请求是 246 毫秒、408 个 token,答案的最大概率差是 0.0000。
隔离性是真做到了。
另一个项目 SemIf 在单张 RTX 3090 上,回答 21 个是/否标准用 1.023 秒,生成式方法要 5.332 秒。
而且——这些项目全部声明没有从 Jev 蒸馏。它们证明的是:做 System One 决策模型,不需要秘密配方。
06 那么问题来了:那半个百分点,值多少钱?
这是整件事里最尖锐的一个问题。
Kev-9B 在自己的硬件上跑,离托管版 Jev 只差 2 个百分点(clauday 的报道里甚至说是半个百分点,取决于比哪一组测试集)。训练成本 95 美元。
如果两三个百分点就是托管服务的全部价值,那人们到底在为什么付钱?这个差距能撑到下一个基座模型发布吗?
目前桌上唯一的证据,是校准度:Jev 的 Brier 分 0.211,Kev-9B 是 0.237。也就是说,准确率快追平了,但 Jev 对"自己有多确定"这件事的判断,仍然更诚实。
而校准恰恰是最容易被忽视、也最容易出事的地方。Kev-4B 在 8.2% 的问题上,会给一个错误答案分配 0.9 以上的概率——它错得极其自信。
反过来看也有好消息:在"完全无依据的不可知问题"压力测试里,Kev-9B 只有 5% 的极端案例过度自信,碾压上一代的 26%,甚至反超了 Jev 的 9%。
一句话总结这个局面:决策模型剥离了文字创作的幻觉,却无法免除概率本身的盲区。
还有一个绕不开的偏见问题。有人让 Jev 给一些地区做评分,它把 Cupertino 排最高、East Palo Alto 排最低。Simon Willison 的警告还是那句:"希望没人用它给求职者排名。"
好消息是,正因为调用便宜到几分钱能跑上千次,系统的结构化评测第一次变得负担得起。
07 不是孤例:大家都在把"生成"从关键路径上拆掉
如果把视野拉开,Jev 不是单独一个怪东西。
一周之内,至少四个产品在做同一件事——把自由生成从关键路径上移除:
-
- Cua 的 CUA-S1
:给屏幕上已有的 UI 元素打分,而不是生成点击坐标 -
- Jev
:返回校准过的概率,而不是一段话 -
- Vercel 的 json-render
:返回一个组件 id,而不是生成标记语言 -
- Kev
:这些概率应该来自你自己机器上那个 90 亿参数的模型 -
没人协调过这件事。
行业里已经有个说法描述这个分工——快慢分工:昂贵的大模型负责规划这类"慢思考",高频、原子化的"快判断"交给轻量决策模型。负责组装这套分工的工程层,叫 Harness。
贵模型想,便宜模型判。
顺带说一句国内的:TypeSafe 官方使用条款写明网站核心面向美国境内访客,服务只部署美西海岸(那个 70-500 毫秒是西海岸本地测的),且官方自承中文等 CJK 语料准确率不如英文。APUS 在 9 月 19 日开源了 fast-browser-use,用本地 Qwen3.5-9B 在 M2 Pro 上跑浏览器自动化,中位 18 秒,零云端调用、数据不出本机。
官方进不来、中文弱、数据要出海——这三件事叠在一起,本地路线对国内团队可能才是真正能落地的那个。
08 名字里藏着答案
最后说回这个名字。
Jev,取自 19 世纪经济学家 William Stanley Jevons。他提出了著名的杰文斯悖论:当技术进步提高了某种资源的使用效率,这种资源的消耗量反而可能上升,而不是下降。
煤炭蒸汽机效率越高,煤烧得越多。
一个"让决策变便宜 400 倍"的模型,取名叫 Jev。这不是在炫速度,是在说结果:决策的成本一旦暴跌,决策的用量就会暴涨。
过去三年,AI 一直在做同一件事——让模型说话说得更好。而 Jev 有意思的地方在于,它是第一个靠拒绝说话而变得重要的模型。
它不会替代大模型。但那些原本不可能自动化的判断——那些因为"调一次 API 太贵太慢"而一直由人肉承担的小决定——会开始被接管。
不是某个模型变快了。是"判断"这件事,从奢侈品变成了自来水。
而自来水的特点从来不是贵不贵。
是你拧开就有,然后就再也想不起没水的时候。
你怎么看? 如果一个开源模型能在你自己机器上跑到只差 2 个百分点,你还愿意为托管 API 付费吗?评论区聊聊。

