如果过去一周你逛过 X(推特)、Hacker News 或者任何一个开发者社区,大概率会被一个名字刷屏:Jev。
它很奇怪——这是一个不会聊天的 AI。你没法让它写首诗、改一段代码、或者陪你唠嗑。你给它一段信息,问一个范围明确的问题,它回你一个带概率的数字。
就这么简单,但它火到 Redis 之父 antirez 都专门发推泼冷水,那条推文被看了 11.6 万次。
所以,Jev 到底是下一个范式级突破,还是又一场 AI 泡沫里的小浪花?今天这篇,咱们把它讲清楚,也顺便泼几盆凉水。
一、Jev 到底是什么
一句话:Jev 是一个"决策模型"。
它由创业公司 TypeSafe AI 在 9 月 15 日发布。创始人 Diogo Almeida 来头不小——前 OpenAI 研究员,RLHF、InstructGPT、GPT-4 的核心参与者。
我们习惯的 AI 是这样的:你输入一句话,它一个字一个字地"吐"出回答(这叫自回归生成)。Jev 不走这条路。你给它一份 state(可以是一段文字、一段 JSON、或者一串数据),再附上几个你已经定义好答案范围的问题,它一次性把答案算出来,每个答案都带着概率和置信度。
TypeSafe 管这叫 "System One Model"(系统一模型),借的是《思考,快与慢》里的概念:
-
• 系统二:慢思考,深度推理,写论文、做数学题——这是 GPT、Claude 们干的事。 -
• 系统一:快直觉,一眼判断——Jev 干的就是这个。
具体到接口,Jev 只会回答三种问题:
-
• Noul(是否):"这封邮件是在明确要求退款吗?" → 回你一个 0 到 1 之间的概率,比如 0.93。 -
• Choice(分类):"这条工单该分给哪个团队?" → 从你给的清单里挑一个,并给出每个选项的概率。 -
• Score(打分):"这位客户有多生气?" → 在一个有序区间里给你打 0、1、2 分。
注意一个关键点:答案的范围是你事先定死的。Jev 只能在你的清单里选,选不出去。这也是官方所谓"零幻觉"的真正含义——它保证不乱编,但不保证一定选对。
二、为什么大家这么兴奋
三个数字最抓人:
-
• 延迟 70–500 毫秒(普通 LLM 要好几秒); -
• 输入价格 $0.042 / 百万 token,而且输出免费; -
• 官方自称比用 LLM 做同样决策快 20–200 倍、便宜 40–400 倍(注意,这是它自己测的)。
更妙的是一个经济学彩蛋。Jev 这名字致敬经济学家 Jevons,"杰文斯悖论"说的是:一种资源用得越高效、越便宜,人类对它的总消耗不降反升。TypeSafe 的赌注是——当一次 AI 判断便宜到可以忽略不计,软件里原本一个普通的 if 判断,都可能被替换成一次 AI 判断。需求不会减少,只会被重新释放。
社区已经玩开了:有人拿它给搜索结果重排序,有人用它给客服工单自动分流,甚至有人魔改出 jev-leftpad、jev-2048(是的,它真的能玩 2048)。Simon Willison 还用开源模型 Qwen 复刻了一个社区版 Kev。
三、但,先别急着高潮(三盆冷水)
第一盆:antirez 的冷水。 Redis 之父 9 月 21 日发推,大意是——Jev 或许有很窄的应用场景,但围绕它的炒作,恰好说明 AI 泡沫里大多数人分不清什么重要、什么不重要;和 AI 领域正在发生的其他事比,它只是一件小事,热度却爆了。
第二盆:可能没有真护城河。 技术博主 Sean Goedecke 点破了一个关键——所谓"快结构化输出",其实用现成的 LLM 也能做:把回答预填成 "choice": ",然后只让它生成那一个受限的 token,速度就能提上去。换句话说,Jev 的"秘密配方"很大程度上是推理策略,而不是神秘的新模型。开源社区已经在拿 Qwen 等模型复刻类似效果。
第三盆:黑箱与偏见。 Simon Willison 自己也有顾虑:普通 LLM 起码还能编个理由,Jev 连理由都没有,你只拿到一个浮点数。如果它把某封邮件判成垃圾、把某个候选人排到末尾,你根本不知道是哪条信号起了作用。这种不透明,用在招聘、风控这类场景,偏见风险反而更高。
再补几点现实约束:Jev 目前闭源、架构和训练数据都没公开;它自报的性能数字还没被第三方独立验证;上下文窗口只有 32k,长文档得先做切片。
四、那它到底值不值得关注?
我的判断是:Jev 不会取代 ChatGPT,但它戳中了一个被忽略的真问题。
过去我们太习惯用"系统二"的价格,去处理软件里大量"系统一"的判断——一封邮件要不要转人工、一个请求该调哪个工具、一段内容要不要拦截。这些本来是瞬间反应,我们却让大模型慢慢推理、慢慢生成。
Jev 的价值,不在于它有多聪明,而在于它把"判断"从"生成"里拆了出来,做成了一个便宜、稳定、可被程序直接消费的计算原语。
给你一个实用的判断框架:
-
• ✅ 该用:高频、窄问题、错误成本低、或者"不确定就交给更聪明的模型 / 人工"的场景——工单分流、垃圾识别、路由决策、Agent 的工具选择。 -
• ❌ 别用:需要解释理由、涉及高利害决策(如招聘、信贷)、或者问题本身开放模糊的场景。
结尾
说到底,Jev 这一个模型会不会昙花一现,我不敢打包票。但它背后那句话值得记住:不是所有 AI 任务都需要一个会聊天的模型,有些只需要一个会做决定的。
当"判断"便宜到像 if 语句一样无处不在,我们写的软件,可能和今天长得很不一样。
END
#agent #jev
如果这篇文章对你有帮助,欢迎点赞、在看、转发

