最近 AI 圈有个反差很大的事:一个叫 Jev 的模型一周刷屏,但它不聊天、不写代码、不写作文,只干一件窄事——做选择题。
它的来头不小。创始人 Diogo Almeida 是 InstructGPT 和 RLHF 的核心成员,也就是 ChatGPT 早期对齐技术那批人。定价更狠:输入每百万 token 0.042 美元、输出免费,社区直接叫它「AI 界的蜜雪冰城」。
01
Jev 到底是什么
传统文本大模型是生成式的,一个问题抛出去,它一个词一个词往外蹦。创作、推理、写代码都行,可一旦遇到「从几个选项里挑一个」,就显得太重、太贵、太慢。
Jev 走的是另一条路:一个轻量的系统一(System-1)分类与打分模型。每次调用,你给它一段上下文和一组明确的选项,它直接输出每个选项的概率分布,挑出置信度最高的那个。延迟在几十到几百毫秒,成本只有主流大模型的几十分之一。
Diogo 在 X 上发的公告帖拿下了将近4000万浏览。大家盯上的不只是便宜,而是它补上了 Agent 工作流里最缺的一块——低延迟的决策控制面。
第一类:把游戏和仿真变成实时决策
这一组最能直观感受 Jev 的「快」。核心逻辑都一样:把每一步操作变成几选一,交给模型秒回。
-
官方演示里,Jev 直接操控初代《毁灭战士》(Doom),每秒约 10 次动作决策,连续跑一小时只花约 7 美元,比工程师预期还低。 -
@_MaxBlade 让 Jev 同时控制 50 局《地铁跑酷》,换道、跳跃、下滑都是单次小判断,50 局跑完总费用不到 1 美分。
-
中文开发者 paulwei 拿它跑《杀戮尖塔 2》,此前用大模型打牌单步明显卡顿,换 Jev 后单次出牌决策只要 0.7 秒。
-
@faadilhshaik 给经典《超级马里奥》做了 Jev 控制器,直接读结构化游戏内存状态决定起跳和加速,项目已在 GitHub 开源。 -
@jpschroeder 把 Jev 接进 3D 城市仿真,车在虚拟街道里跑,模型按传感器和路况判方向,整套系统不到一小时搭完。 -
@uttkarsh_42 在 MuJoCo 物理引擎里训火箭垂直起降,何时点火、开几台发动机、何时切着陆姿态全交给 Jev,12 次试验后成功着陆,单次完整试验 245 次调用、成本约 0.04 美元。
另外一个偏「压力测试」的玩法:官方用 Wikiracing,从一条维基词条只靠点超链接跳到目标词条,每步面对几百甚至几千个候选链接,用来验证 Jev 在高基数选项下不会胡说。
第二类:浏览器和图像,也能「选择题化」
-
@anshuc 把图像生成拆成逐像素分类,给每个像素位置分配颜色选项和概率,程序按高概率颜色逐步涂抹,拼出完整低保真图像。 -
Browser Use 团队在 Jev 发布三天内推出官方集成库 jev-ultrafast,两天拿下 2700 颗 Star。它把网页操作抽象成「动作」和「目标」两组选择题,全程无截图、不吃多模态 token,一次往返输出两个决策。
-
创始人 Gregor Zunic 放了一段无剪辑实测:Jev 驱动浏览器在真实航司官网完成单次航班查询,耗时 7 秒,调用花费仅 0.0039 美元。
第三类:真正进生产的业务流水线
这部分才是开发者真正兴奋的地方——把「非生成式」的判断从大模型换成轻量决策器。
-
Vercel 工程师 Pranit Sharma 把内部 Shell 命令安全审查分类器从 OpenAI 大模型换成 Jev,处理速度提升 5 到 18 倍,因误判率下降,准确率反而更高。 -
BryoAI CTO Nikhil Mudholkar 拿 Jev 和 Gemini 跑商业邮件意图分类:Gemini 绝对准确率略高,但单次成本贵 10 到 20 倍;更关键的是 Jev 输出的是校准过的真实概率分布,下游业务系统能直接设置信度阈值。 -
客服场景里,系统把每条新工单的关键描述提取出来,由 Jev 从十几个业务组里挑最合适的主管团队,替掉脆弱的手写正则匹配。 -
CI 流水线里,Jev 读改动文件清单和测试报告,对 PR 是否够合并资格给初步判断,高风险 PR 直接打「待人工复查」标签。 -
金融和电商侧,Jev 用来快速识别重复扣费等高危客诉,客户情绪激动或涉及退款时,系统在 100 毫秒内打紧急度标签,优先推人工坐席。
第四类:给 Agent 自己装「决策大脑」
这类玩法不直接面向终端用户,而是把 Jev 塞进 Agent 的骨架里。
-
社区开源了 jev-mcp,能用 Jev 做多来源事实交叉核验、检测 Prompt 里藏的注入攻击,还给检索召回内容打语义相关度分。 -
fast-jev-compaction 在 Coding Agent 跑长任务时,用 Jev 快速判断每轮工具调用值不值得留,剔掉无效日志只留关键状态,被 Jev 官方团队转发点赞。 -
Jev Codex Router 是个多模型路由项目:任务发起前由 Jev 预判代码改动的逻辑复杂度,简单的路由到便宜小模型,复杂跨文件重构才唤醒大模型,整体调用开销压降 60% 以上。 -
Earendil CTO、Sentry 创始人 Armin Ronacher 点出一个判断:让主流生成式大模型自己来做分流决策,经济上不划算;Jev 的极低延迟和成本,才让入口层部署高密度实时流量路由变得可行。 -
LangChain 官方专门写了篇《Building a Harness with Jev》,认为过去 Agent 框架的分类决策逻辑深埋在闭源定制逻辑里,现在有了通用、便宜、确定性高的分类模型,这套决策层能推广到每一个开源 Agent。
第五类:链上交易,与一场关于「置信度」的评测
-
部分 Web3 开发者把 Jev 接进去中心化交易所,高频读买卖订单簿深度,只输出买入、卖出、观望三个动作。社区普遍觉得这是目前最噱头、真实行情里风险也最高的用法。 -
独立测试机构 PrimeLine 做了双盲预注册评测:两项真实任务上,Claude Opus 5 和 Haiku 4.5 的初始绝对准确率原本追平甚至领先 Jev;可一旦允许模型跳过最不确定的样本,Jev 在两项上全部逆转。原因很硬——Jev 输出的置信度有数学统计意义,而通用生成模型的自我评估概率常常严重过自信。
02
怎么上手
官方和主流聚合网关都在第一周内开了入口:
文档 docs.typesafe.ai/introduction控制台 console.typesafe.ai/playground
-
OpenRouter 模型库已上架,标识 typesafe/jev,改个模型名就能切; -
Vercel AI Gateway 在发布 72 小时内完成直连,支持全球边缘低延迟分发。
03
标题写在最后
Jev 从第一天推特狂欢,到一周内被塞进各种生产流水线,给开发者上了一课,关于分工。
带走的两点很实在:别指望小模型有天马行空的推理力,它的强项是把判断压成有限选项后的确定性;当业务要接安全拦截、分流路由、工单分拣这类非生成式任务,用轻量决策器换掉重型大模型,往往既省钱又把延迟拉回毫秒级。
真正值得想的,不是 Jev 能替代谁,而是我们过去把太多本该是选择题的事,硬塞给了会写长篇大论的生成模型。
图片/素材来源于网络,其版权归原作者所有,侵删
⭐“点赞、分享、推荐”三连↓

