大数跨境

Jev之后,AI 正在分裂成两个物种,一个会说,一个只会判断

Jev之后,AI 正在分裂成两个物种,一个会说,一个只会判断 重构零售实验室
2026-09-21
2
导读:我们花了四年教 AI 说话 ,却忘了大多数时候,机器要的根本不是一篇八股文, 只是一个 0 到 1 之间的数字

商派获得腾讯云企业版 WorkBuddy 代理授权,零售数智化进入“对话即操作”新时代


“我们花了四年教 AI 说话,却忘了大多数时候,机器要的根本不是一篇八股文,只是一个 0 到 1 之间的数字。”——重构零售实验室

近期,AI 领域出现一种反常现象:一款名为 Jev 的模型上线后,不生成任何文字,仅返回一个 0 到 1 之间的概率值,却在几天内引发全球开发者创建近 500 个开源项目。这款功能更窄、能力更单一的“哑巴”模型,精准切中了生成式 AI 四年叙事中的痛点——过度追求表达能力而忽视了判断效率。

01

THE SILENT MODEL

「哑巴」模型,凭什么炸场

以智能家居社区 Home Assistant 上的 HA-Jev 插件为例,其逻辑极简:读取洗衣机功率曲线和房门状态,向模型提问“衣服是否被遗忘”,模型仅返回置信度数值。若超过 0.8 则触发提醒,单次判断成本仅为 0.000015 美元,耗时几十毫秒。

几十毫秒
一次判断的耗时

$0.000015
一次判断的花费

“过去一直在用大语言模型回答根本不需要它的问题。衣服忘没忘拿,是一个判断,不是一篇八股文。”

Jev 的出现揭示了行业过往的误区:过度依赖千亿参数模型进行冗长的思考与表达,再通过正则提取答案。而 Jev 仅有“一根神经”,专注于极速概率匹配。


三个典型案例印证了其核心价值:

上下文压缩:开发者利用插件对历史工具调用进行相关性打分,将 100 万 token 的臃肿上下文在 1 秒内压缩至 8.6 万,全程无文字生成。

手机操作:Droidrun 团队利用 mobile-jev 控制真机完成 Uber 叫车流程,9 个操作步骤仅需 21 秒,完全依赖概率匹配而非文字模型。

数据清洗:处理 9081 条产品匹配数据,传统大模型因成本过高被弃用,而 Jev 仅耗 13 分钟,账单低至 32 美分。

这些案例的共同点在于:它们全都是判断,一次表达都没有。摘要是一次昂贵的生成,而过滤只是一次冷酷的判断。


02

THE JEVONS PARADOX

杰文斯悖论,被用反的那半句

Jev 之名源于 19 世纪经济学家威廉·斯坦利·杰文斯提出的“杰文斯悖论”:当资源使用效率提升、成本下降后,总消耗量反而暴涨。在 AI 领域,这意味着效率提升改变的不仅是“同一件事的成本”,更是“值不值得做”的阈值。

Jev 的定价为每百万输入 token 0.042 美元,输出免费。以此测算,一天进行 1 万次业务决策,月成本约 120 美元;而同等准确率的顶级推理模型月账单高达 3.5 万美元。

$120
Jev 方案月成本

$35,000
顶级推理模型月成本

真正的变革在于解锁了新工作。例如,Distribb 创始人利用 Jev 扫描 600 个网页并重构内部链接地图,布设 500 多个链接仅花费 21 美分。这并非让原有工作更便宜,而是让原本因成本过高从未被列入考虑的任务变得可行。

“这不是内容创作,这只是 8790 次‘该连还是不该连’的决策题。”

对于业务而言,机会不在于“用 AI 把现有流程做得更省”,而在于那些过去因算不过来账而从未做过的事,现在它们算得过来了。

核心启示:别再问“这能不能用 AI 做得更便宜”,要问“有哪些事,我们过去从没做,只因为算不过来账”。


03

WHO IS THE CUSTOMER

AI 的客户,从人变成了软件

过去四年,生成式 AI 的核心 KPI 是“像不像人”,旨在优化自然语言表达。然而,Jev 将客户换成了软件本身。在机器与机器的通信中,自然语言是最差的协议,HTTP 无需写诗,TCP 握手无需寒暄。程序需要的是明确指令和可比较数值。

这一转变带来几个关键结论:

Prompt 工程的冗余:大量提示词工程存在的理由仅是为了限制模型的表达欲。当判断与表达分离,这些补丁将大面积失效。

上下文工程的本质:高效的上下文处理靠的是精准判断而非昂贵总结。摘要是生成,过滤是判断。

API 设计哲学的变革:从“多轮对话”转向“一次函数调用返回一个概率”。Chat completion 接口形态对程序而言带有过多多余情绪。

能说会道是给人看的功能,而非给机器用的能力。将高表达模型用于系统内部调度,如同请辩论冠军指挥交通信号灯。

“让会说的人去说,让会判断的去判断。”


04

A ONE-SENTENCE COMPILER

它不是新分类器,是「一句话编译器」

尽管分类器、意图识别等技术早已存在,但 Jev 真正改变的是“定义一件事”的成本。传统流程需定义标签、标注数据、训练模型,周期长且成本高。而 Jev 允许直接用一句自然语言描述标准并调用,堪称“一句话编译器”。

成本下降分为两种:执行成本下降(量变)与定义成本下降(质变)。执行成本决定做不做得起,定义成本决定敢不敢想。

Jev 的大火,点燃了开源社区的热情|图片来源:Google DeepMind

值得注意的是,判断模型能替代“读”,但替代不了“想”。它不产生新知识,仅在已学会的语义空间做切分。因此,推理模型不会消失,而是退守至处理真正复杂问题的领域。

!踩坑提示:判断模型能替代「读」,替代不了「想」。它不产生新知识,只是在已经学会的语义空间里做切分;它能飞快告诉你「这段代码像不像有问题」,但它不会发明新的架构。所以别急着给推理模型写悼词——它们不会消失,只是从「每件事都掺一脚」退到「只在真正难的事上出手」。

随着开源社区迅速跟进,利用 Google 的 DiffusionGemma 做出对标实现,“判断模型”已确立为一个独立品类,未来必将呈现多供应商格局。


05

THE MISSING LAYER

零售业那层一直空着的中间地带

零售业是“判断”密度最高却最未被满足的行业。过往自动化决策面临三重困境:规则引擎覆盖不了长尾,纯人工贵且慢,大模型成本高无法规模化。判断模型恰好填补了比规则懂语义、比人工便宜、比大模型快两个数量级的空白。

零售场景中典型的“无需说话”的判断包括:

同款识别:跨平台主图对应哪个 SKU,这是判断而非创作。

评论分诊:区分需人工介入的评论与单纯情绪表达。

订单风控:识别刷单或黄牛特征,规则难写全,大模型跑不起。

客服路由:快速判定问题类型,无需多轮问答。

时机判断:基于概率决定用户此刻是否该收到优惠券。

这一层的点亮改变了决策密度。以往零售自动化颗粒度停留在品类级,因 finer 粒度算不过来账。如今,10 万个 SKU 每天进行 100 万次语义判断,总成本仅约 15 美元。这使得决策颗粒度可从品类级下沉至单品级、单客级乃至单次会话级,实现了经营分辨率的质变。

10 万
单个品牌的 SKU 数

100 万
每天可做的判断次数

≈$15
这样一天的总成本

架构建议:将系统拆分为“感知层”和“推理层”。感知层负责 99% 的日常决策,运行便宜、快速的判断模型;推理层仅在需要向人输出长文或处理复杂问题时唤醒。两层接口即为一个概率值。


06

THE HIDDEN BILL

便宜的背面:谁来审计成千上万次判断

当判断成本低至十万分之一点五美元时,潜在风险随之而来:

首先,判断会泛滥。低成本可能导致团队随意增加语义审查和过滤层,导致系统复杂度失控。

其次,可解释性崩塌。概率判断难以像规则引擎那样打印审计。当决策链包含数百次黑盒输出,故障排查将极度困难。“过去的 bug 有堆栈,未来的 bug 只有置信度”。

最后,成本转移。节省的 API 费用可能转化为调试时间、人工复核及审计成本。真正的门槛在于是否清晰定义了判断标准。

!落地建议:给每一个上线的判断建一本「判断台账」:写清判断标准、正反样例、阈值、责任人和复核周期。当判断便宜到可以随手加的时候,能分清哪些判断值得留,才是真正的壁垒。


EPILOGUE

让会说的人说话,让会判断的判断

回顾过去四年,生成式 AI 如同口才极好却不懂业务的顾问,试图用长篇大论解决所有问题。Jev 提供了更冷静的答案:智能本就可拆解。部分工作只需快速判断,部分才需推理表达。长期绑定二者是一种结构性浪费。

未来的系统架构将走向分布式分工:海量毫秒级判断交由廉价的直觉模型,仅在需向人输出长文或提供情绪价值的节点,才唤醒昂贵的生成模型。这并非简单的降本增效,而是 AI 架构从中央集权走向专业化的起点。

Jev 不会取代大模型,它只是让大模型回归其应有的位置——不再假装全能,而是在真正需要的地方发挥作用。


END
以"AI+ 开源”双轮模式,商派打造面向未来增长的自主可控、安全智能的新商业底座



【声明】内容源于网络
0
0
重构零售实验室
各类跨境出海行业相关资讯
内容 10821
粉丝 0
重构零售实验室 各类跨境出海行业相关资讯
总阅读343.1k
粉丝0
内容10.8k