大数跨境

AI不一定要“聊天”,OpenAI前研究员研发只做决策的模型,绕开文本生成,响应速度快200倍

AI不一定要“聊天”,OpenAI前研究员研发只做决策的模型,绕开文本生成,响应速度快200倍 DeepTech深科技
2026-09-16
7
导读:大模型一定要一个 token 接一个 token 地生成文字吗?

大模型是否必须逐个 Token 生成文本?9 月 15 日,前 OpenAI 研究员 Diogo Almeida 揭开了其秘密研发两年的项目——Jev。这是一款名为"System One"的全新 AI 模型,与 ChatGPT、Claude 等主流大语言模型(LLM)不同,Jev 不再输出自然语言,而是直接生成结构化判断、概率数值及置信度。

(来源:X)

Jev 是 Almeida 创办的 AI 初创公司 TypeSafe AI 的首款产品。该公司于 2024 年由 Almeida 联合创立后一直处于隐身状态,此次正式亮相并宣布完成 4,000 万美元种子轮融资,由 DCVC 领投,估值约 2 亿美元。

TypeSafe 宣称,在特定结构化工作流中,Jev 的速度比前沿 LLM 快近 200 倍,成本低 400 多倍,且能将“幻觉”和类型错误率降至 0%。Almeida 曾深度参与 InstructGPT 及 GPT-4 的研发,是推动 RLHF(人类反馈强化学习)路线的核心人物之一。如今,他转而质疑该范式在自动化场景中的局限性:若 AI 需在软件后台持续决策,是否有必要先生成文本再解析?

图|Diogo Almeida(来源:Typesafe)

从生成文字到直接决策:Jev 重构 AI 输出范式

理解 Jev 需区分“人机交互”与“机器调用”两种场景。ChatGPT 等生成式模型基于自回归原理,逐 Token 预测并输出字符串,适合处理开放式问题。但在软件后台,如电商系统判断订单异常或客户流失风险时,程序仅需几个数值,却需等待 LLM 生成完整文本后再解析提取,效率低下。

Jev 旨在消除这一中间环节。其接口定义为“非结构化状态输入, typed 概率决策输出”。例如面对用户投诉,传统 LLM 可能输出一段建议文字供程序提取关键词;而 Jev 直接返回预设的结构化结果:“流失风险 82%"、“转人工 91%"、“退款 37%",程序可直接执行后续逻辑。

在技术架构上,TypeSafe 称 Jev 采用“并行采样器”,可在一次查询中并行产出多个结构化结果,而非逐个 Token 生成。尽管官方披露了新型架构、并行采样及新训练方法,但未公开参数规模、网络骨架及预训练数据等细节。目前可确认的是,Jev 在输出接口、训练目标和采样方式上进行了根本性变革。

配套的训练方法 RLCD(Reinforcement Learning for Calibrated Decisions)不再优化回答的讨喜程度,而是专注于概率校准(Calibration)。即模型给出的置信度(如 90%)应与实际准确率高度一致。这使得自动化系统能依据置信度决定是自动执行、二次验证还是转交人工。

(来源:TypeSafe AI)

Jev 的应用场景涵盖分类、路由、评分、信息提取及业务流程分支,甚至可作为其他 LLM 的裁判(Judge)或护栏(Guardrail)。TypeSafe 将其比喻为“智能 if-statement",用语义理解替代硬编码规则。为展示低延迟特性,TypeSafe 演示了 Jev 实时游玩《毁灭战士》,虽未超越专用游戏 Bot,但证明了其在高并发实时判断中的潜力。

性能数据亮眼,但受限于特定任务

Jev 发布的"20~200 倍提速”与"40~400 倍降本”数据引人注目。原理上,因无需自回归生成长文本,Jev 在结构化决策任务中天然具备低延迟和低推理成本优势。

在与 GPT-5.6 Terra 的对比演示中,Jev 一次性输出所有概率,而对照模型仍需逐 Token 生成,速度差异显著。但 TypeSafe 承认,该演示经过高度简化:输入简短、信息密度高且问题已结构化,这些条件放大了 Jev 的优势。

官网引用的"193.6 倍更快、444.6 倍更便宜”数据源自 TypeSafe 自行设计的 Workflow Eval。评测以 GPT-6 Astra 和 Fable 5.1 的平均预测概率为参考基准,衡量 Jev 的接近程度。这表明在 TypeSafe 设定的特定任务中,Jev 能以更低成本达到近似前沿模型的判断力,但尚不足以证明其具备同等的通用能力。

关于"0% 幻觉”的宣称,准确含义是 Jev 的输出空间被严格限定在预定义 Schema 内,不会生成格式错误或越界字段。这属于机制保证而非经验测试结果:若选项仅为 A、B、C,Jev 绝不会输出 D,但仍可能在 A、B、C 中选错。同理,RLCD 的概率校准效果目前缺乏完整的 ECE、Brier Score 等外部独立评测验证,其在分布偏移下的可靠性仍有待观察。

图|TypeSafe 对比 Jev 与多款前沿模型的结构化输出和工具调用错误率(来源:TypeSafe AI)

Jev 启示:AI 分工的新可能

Jev 的出现揭示了 AI 应用的新分工趋势。过去几年,LLM 成为万能接口,但也导致了资源浪费:用昂贵的生成模型处理简单的判别任务。

TypeSafe 的愿景是将专用判别模型通用化、基础化。未来 AI 软件架构可能出现明确分层:大型语言模型负责开放式生成、复杂推理与长程规划;而类似 Jev 的模型则嵌入代码底层,高频处理分类、路由与决策。这种分工若能成立,Agent 将无需在每一步都调用高昂的前沿 LLM。

Jev 的核心价值不仅在于速度提升,更在于其能否覆盖原本必须由通用大模型处理的判断任务。若其能跨行业、跨数据分布保持高精度的判断力与概率校准,将真正确立“软件原生 AI 接口”的新品类价值。

参考链接:

1. https://typesafe.ai/blog/introducing-system-one-models-and-jev

2. https://typesafe.ai/

3. https://www.dcvc.com/news-insights/typesafe-emerges-from-stealth-with-a-new-way-of-doing-ai/

4. https://www.forbes.com/sites/the-prompt/2026/09/15/this-200-million-startup-wants-to-fix-ais-overconfidence-problem/

5. https://openai.com/contributions/gpt-4/

6. https://arxiv.org/abs/2203.02155

7. https://github.com/openai/following-instructions-human-feedback/blob/main/README.md

注:封面/首图由 AI 辅助生成

【声明】内容源于网络
0
0
DeepTech深科技
DeepTech 是一家专注新兴科技的资源赋能与服务机构,以科学、技术、人才为核心,通过科技数据与咨询、出版与影响力、科创资本实验室三大业务板块,推动科学与技术的创新进程。DeepTech 同时是《麻省理工科技评论》中国区独家运营方。
内容 5673
粉丝 2
DeepTech深科技 DeepTech 是一家专注新兴科技的资源赋能与服务机构,以科学、技术、人才为核心,通过科技数据与咨询、出版与影响力、科创资本实验室三大业务板块,推动科学与技术的创新进程。DeepTech 同时是《麻省理工科技评论》中国区独家运营方。
总阅读128.0k
粉丝2
内容5.7k