在大语言模型争相展示写作与对话能力的当下,一款名为 Jev 的模型却反其道而行之:它不生成完整句子,只提供类型化的决策结果。这一由前 OpenAI 研究员 Diogo Almeida 创立的 TypeSafe AI 推出的新产品,正以“校准后的决策”重新定义 AI 的应用边界。
Almeida 曾参与 ChatGPT 研发并提出 RLHF 算法,但他逐渐意识到,过度优化人类语言能力并未真正解决自动化问题。计算机需要的是结构化、可执行的判断,而非自然语言叙述。基于此理念,TypeSafe AI 于 9 月 15 日正式亮相,同步公布 4000 万美元种子轮融资及首款模型 Jev。
Jev 的核心机制:从生成到决策
Jev 虽基于 Transformer 架构,但并非传统大语言模型。其输入为程序状态与预定义问题,输出则是三种强类型结果之一:
- Choice:从最多 255 个预设选项中选择一个,适用于路由与分类;
- Score:在指定尺度上打分,用于评估紧迫性、风险或质量;
- Noul:返回 0 到 1 之间的概率值,表示某事为真的可能性。
每次响应均附带完整概率分布与置信度评分,无需 JSON 提示词或额外解析器,彻底规避了自由生成带来的格式错误与幻觉风险(注:此处“无幻觉”指不超出预设选项范围,但选项内仍可能出错)。
截图展示了 Jev 与大语言模型在应对相同请求时的表现对比
性能与成本优势显著
TypeSafe 数据显示,Jev 端到端延迟介于 70 至 500 毫秒,比同类大模型快 20 至 200 倍。定价方面,输入每百万 token 仅 0.042 美元,输出免费。由于答案长度不影响计费,用户可放心设计复杂判断逻辑。
在 Ably Pong 演示中,Jev 在 12 秒内完成 47 次操作决策,而 Gemini、Claude 和 GPT 仅能执行两三次。该测试中,Jev 接收球的位置、方向等数值信息,从“向上、向下、静止”三个选项中实时选择最佳动作。
Jev 的实际应用场景
浏览器代理与任务自动化
开源项目 jev-ultrafast 利用 Jev 构建超高速浏览器代理。系统先将网页元素结构化编号,再由 Jev 根据用户目标与当前状态,并行判断下一步应点击、输入还是等待。若需填写文本(如城市名),则调用小型生成模型补充内容,实现精准高效的操作闭环。
上下文压缩与安全过滤
Vercel 工程师 Pranit Sharma 透露,用 Jev 替代 OpenAI 的 Luna 5.6 作为命令安全分类器后,处理速度提升 5 至 18 倍,准确率同步提高。Bryo AI CTO Nikhil Mudholkar 测试发现,Jev 在商业邮件分类任务中成本仅为 Gemini 的 1/10 至 1/20,虽准确率略低,但性价比极高。
企业可自行搭建类似流程:将邮件拆解为多个明确问题,分别用 Choice 判断归属队列、Noul 评估行动必要性、Score 标定优先级,从而实现自动化分拣与响应。
智能模型路由
Earendil CTO Armin Ronacher 指出,Jev 可将幻觉风险的控制权交还用户——当某一判断概率达 95% 时即可采信,50% 则可忽略。此外,其低成本与高速度使其成为理想的模型路由器,能实时预测任务复杂度并分配合适模型,避免滥用昂贵的大模型资源。
命名哲学与未来愿景
Jev 之名源自经济学家 William Stanley Jevons 提出的“杰文斯悖论”:当某种资源成本下降,其使用量反而激增。Almeida 借此类比,预言智力成本降低将催生海量微型智能节点,分散运行于各类场景中,而非集中于少数巨型应用。
TypeSafe 将 Jev 称为“System One Models”,借鉴卡尼曼关于直觉思维的理论,强调其依赖快速直觉判断而非冗长推理链。公司尚未公开具体架构,外界推测其基于开源模型改造而成,专为特定任务调校。
Almeida 坦言,转向合成数据训练是他职业生涯中最明智的决定,远胜于追求上市或依赖人类反馈。他拒绝将 TypeSafe 定义为“前沿实验室”,明确表示:“我们的产物应是智慧,而非恐惧、炒作或造神叙事。”
上线初期,Jev 需求远超预期,API 一度承压。已有团队将其用于信息流筛选,两秒内以 0.007 美元成本剔除广告与诱饵内容;另有营销团队接入 Meta 广告库分析,创意评估效率提升 30 倍,单次成本控制在 3 美元以内。
AI 少说了很多话,软件却多做了几件事。这或许正是下一代智能系统的真正形态。

