大数跨境

ChatGPT 初代研究者另起炉灶:Jev 模型,让 AI 不再靠 “写小作文” 做软件决策,放弃文本生成!重构 Agent 底层的 System One 决策模型

ChatGPT 初代研究者另起炉灶:Jev 模型,让 AI 不再靠 “写小作文” 做软件决策,放弃文本生成!重构 Agent 底层的 System One 决策模型 苏哲管理咨询
2026-09-20
14
导读:本次由 ChatGPT 初代核心研究者、InstructGPT 论文作者 Diogo Almeida,正式发布全新 AI 模型 Jev,彻底颠覆传统 LLM 技术范式。过去两年,团队闭门攻关行业核心难

编者摘要:本次由 ChatGPT 初代核心研究者、InstructGPT 论文作者 Diogo Almeida,正式发布全新 AI 模型 Jev,彻底颠覆传统 LLM 技术范式。过去两年,团队闭门攻关行业核心难题:现有大模型对话能力极强,却始终无法落地大规模软件自动化。根本原因在于传统 LLM 必须通过生成自然语言或结构化文本完成判断,再由程序解析执行,速度慢、成本高、易产生幻觉,不适合高频工业级决策。

Jev 摒弃文本生成逻辑,依托全新 RLCD 校准决策强化学习算法,直接输出带精准概率的结构化决策结果,适配风控判定、业务分流、工具选择、审批判断等场景。相较传统大模型,Jev 提速 20–200 倍、成本降低 40–400 倍,输出 Token 免费,最低延迟仅 70ms,且实现概率校准、无类型错误。

行业正式迈入双层智能架构时代:大模型承担复杂推理规划,Jev 承接海量低成本毫秒级决策。伴随 TypeSafe 4000 万美元种子轮融资落地,AI 竞争核心从 “模型更聪明”,转向低成本、可嵌入全场景的工业级智能决策

Jev 新模型10关键问题问与答

1. Jev 是谁做的?

ChatGPT、InstructGPT 联合发明者 Diogo Almeida带队,前 OpenAIGoogle、Meta 核心团队两年隐身研发推出的全新一代 AI 决策模型。

2. 为什么要做 Jev?传统 LLM 不够用吗?

传统大模型擅长 “说话、推理、创作”,但不适合软件自动化。每次判断都要生成文本、再解析,速度慢、成本高、易幻觉,无法大规模塞进业务代码。

3. Jev 和普通大模型最大区别是什么?

放弃文本生成,只做结构化决策。不输出废话、不写小作文,直接输出可被代码执行的判断、分类、评分与置信概率。

4. Jev 的核心技术是什么?

全新训练范式 RLCD 校准决策强化学习。不优化话术好听,只优化判断正确率与可信度匹配,90% 置信基本等于 90% 真实准确率。

5. Jev 性能优势到底有多强?

对比传统 LLM 决策任务:提速 20–200 倍、降价 40–400 倍,输出 Token 完全免费,最低延迟仅 70ms

6. Jev 能解决什么业务场景?

专注高频自动化判断:交易风控、用户分流、审批判定、工具选择、内容核验、智能路由、数据打分等工业级场景。

7. Jev 不能做什么?

不会聊天、不会写作、不会通用创作。它不是替代 ChatGPT,而是替代 LLM 里低效的决策环节。

8. 什么是未来双层 AI 架构?

  • System2(大模型)
    负责复杂推理、规划、创作、长任务
  • System1(Jev)
    负责海量、快速、超低成本的代码级智能判断

9. 商业进展如何?

TypeSafe 刚完成 4000 万美元种子轮融资,顶级机构 DCVC 领投,正式进入商业化落地阶段。

10. 这次 AI 革新的核心变化是什么?

AI 竞争不再只比 “谁更聪明”,而是比谁能把智能足够便宜、足够稳,塞进软件每一处 if 判断,真正实现全域自动化。

附录 TypeSafe AI 发布:System One 模型与 Jev

发布时间:2026 年 9 月 15 日作者:Diogo Almeida,TypeSafe 创始人,ChatGPT 联合发明者之一

在参与发明 ChatGPT 之后,我一直在追问自己:为什么具备超人对话能力的大模型,并没有带来通用人工智能 AGI?过去两年,我在低调研发一套全新的模型训练方法 RLCD,以及一款全新的前沿 AI 模型 —— 今天我们正式发布:Jev

  • 速度提升 20–200 倍
  • 成本降低 40–400 倍(输出 token 完全免费)
  • 面向决策任务优化的前沿可组合智能

在我看来,这是通往 AI 驱动经济革命最短的路径。

但性能提升并非没有代价:Jev 不能生成文本。把 Jev 和传统大语言模型并排对比,就能清晰看到取舍。一个有趣的类比:用并行计算替代串行计算,当年 Transformer 正是靠这一点超越了 RNN 循环神经网络。

介绍 System One 模型与 Jev

多年前大模型在对话能力上就已经超越人类,但大规模自动化落地为什么迟迟没有到来?这是过去四年驱动我持续思考的核心问题。我曾在 OpenAI 参与研发让语言模型学会遵循指令、与人对话的技术,这套成果最终成为 ChatGPT 背后的核心研究。当时我一度认为对话模型可以通向 AGI。但伴随热度不断发酵,我渐渐意识到:这里缺失了一块至关重要的东西。

经过两年秘密研发、无数技术攻坚与研究突破,我非常激动地宣布:TypeSafe AI 正式推出首款System One 模型。这是一类全新的前沿模型,专门用来快速生成结构化决策结果,可直接被软件调用。

我们从零搭建了一套面向自动化的完整技术栈:全新模型架构、最大化效率的并行采样器,以及我们命名为RLCD(Reinforcement Learning for Calibrated Decisions,校准决策强化学习)的训练方法。

首款公开模型 Jev现已开启早鸟访问。在 System One 类任务上,Jev 拥有与现有前沿大模型相当的智能水平,同时速度与效率高出两个数量级。Jev 放弃了自由文本生成能力,但针对结构化输出做深度优化,不会产生幻觉

你可以把 Jev 理解为具备前沿智能能力的函数调用:输入非结构化状态信息,输出带类型约束的概率化决策结果。

非同寻常的论断,需要非同寻常的证据,下文附上完整验证材料。

新旧前沿模型对比表

实验证据与技术结果

我们本身就是怀疑论者,也欢迎所有质疑。有部分结论很容易自行验证:

  1. 单次调用速度:我们确实能达到这个速度,目前公开评测是在西海岸服务器(我们服务部署地)搭配笔记本客户端完成。
  2. 单次调用成本:定价完全透明。我们无法证明定价没有补贴,需要更长时间验证定价可持续性(我们预期未来价格继续下降)。
  3. 无类型错误:只要找到一个反例就可以证伪,但从原理上这在数学层面是保证成立的。

对于更大胆的论断,我们会尽可能补充细节说明。

并排对比演示

演示直观展现 Jev 和 LLM 的核心差异:Jev 并行输出全部概率,而不是自回归逐 token 生成。字符串文本虽然通用性极强,但代价高昂。放弃自由文本生成,反而赋予我们很多新能力!

补充说明:早鸟用户可以打开演示地址。查询经过高度简化,问题选用可读性强的键名,保证页面输出易懂。输入状态是简短精炼的段落,目的是凸显采样机制差异。较短输入会对我们模型有利。细心的人会发现,本次演示中,唯一和 GPT-5.6 Terra 不一致的地方是「客户流失概率等级」。在我们看来,这个问题本身答案就存在模糊性。本演示选用 GPT-5.6 Terra 默认推理模式,因为我们测试下来,它在平均能力上和 Jev 最具备可比性。顺带一提:正是类似的演示,让我们下定决心全力投入 System One 模型这条技术路线。

工作流评测

我们设计了一套全新评测体系,衡量 AI 嵌入代码后的实际表现。评测不优化固定标准答案,也不固定评测框架和模型(避免通过评测工程造成过拟合)。我们假设存在一个正确的计算图(代码实现的工作流),使用当前最强、最昂贵的外部大模型预测结果作为参考概率。

简单说:所有模型使用完全相同的工作流。我们将结果和最强模型(Astra 与 Fable)的均值做对比。

Jev 表现十分突出,在帕累托最优曲线上取得接近两个数量级的优势。我们也对比了在提示词内完成完整思维链逻辑的 LLM,但这类方案效果显著弱于直接使用工作流。

注:这里的调用任务比上面的并排演示复杂得多,更贴近真实业务自动化生产负载。下面是我们发布 4 套工作流里最简单的一套。

真实世界里最可靠的工作流,往往包含大量独立、拆解后的子问题;细粒度行为依赖概率,而不是离散判定。最终结果是分支逻辑,但得到答案的过程需要大量领域工程,并且要求高度稳定。

全部评测数据、案例、分歧样例、完整查询语句与工作流都可以在 evals.typesafe.ai 查看。

补充说明:官网所说193.6 倍提速、444.6 倍降价,就来自这套评测,属于性能上限,真实场景提升幅度通常会更低。工作流任务没有刻意挑选、美化来抬高模型表现,也不在训练数据分布内。但任务由我们模型能力团队编写,依然可能存在偏差。我们以 GPT-6 Astra 和 Fable 5.1 的平均结果作为标准答案,相当于偏向 OpenAI 和 Anthropic,反而可能低估 Jev 与 DeepSeek 模型的相对能力。LLM 使用我们开源的 system-one-adapter-python 封装库,强制 LLM 输出适配我们 API 的结构化决策。这是从 LLM 获取决策结果最准确的方式,但相比不带概率输出的调用,会更慢、更贵。

幻觉与类型安全

幻觉和类型安全本质上高度相关,我们认为类型安全是自动化系统的基础底线。智能体里出现幻觉式工具调用只是麻烦;但如果系统带有延迟保障,或是多层依赖链路中嵌入 AI,幻觉就是致命缺陷。现有模型无论能力多强,依然会产生幻觉、类型报错。

补充说明:LLM 相关数据来自 OpenRouter,存在潜在偏差:更复杂查询大概率会路由到更强的模型。Jev 的类型安全数据不是实测统计:Schema 结构匹配由机制保证,因此在图表中可以直接记为 0 错误。

趣味演示案例

最激动人心的是这套技术可以解锁全新场景,我们还有很多成果待展示,下面是团队最喜欢两个 demo:

  1. Doom 游戏
    这个 demo 很好地展示实时智能,以及代码 + AI 的可能性。开发工程师原本担心每秒 10 次调用(成本约 7 美元 / 小时),但团队觉得比预期便宜。这个项目很有意思,后续我们会发布详细教程,还计划举办黑客松活动

说明:demo 输入是带文本的结构化游戏状态,还没有用到图像输入。纯非 AI 的 Doom 机器人可以打得更好;我们的目标是让机器人对不同形式的游戏状态做出反应,并且可以遵循指令。

  1. 维基竞速 Wikiracing
    游戏规则:从一个维基页面出发,仅依靠页面内链接,抵达目标维基页面。每一步需要在数百到数千链接里做选择。这个场景非常适合展示单位时间内的智能收益,同时体现无幻觉在高选项数量场景下的叠加优势。

说明:纯属巧合,第 2、3 轮挑战起始页面都是 “橡皮鸭”,团队成员才发现。本 demo 里 Jev 的提速幅度低于前面案例,因为对比基准是大模型关闭推理模式(Astra 设置最低推理等级)。这是为了让演示观感更流畅;如果开启推理,LLM 表现会差很多。Jev 最高支持 255 个候选选项。当候选集数量很高时,采用两阶段机制:独立打分,再显式决策,因此偶尔会出现延迟小幅上升。

未来规划

Jev 还处在早期阶段,我们还有大量研发计划,会持续迭代交付🔥。今天 typesafe.ai 正式上线,我们会尽快把开发者从候补名单转为正式访问。我们希望听到大家需要自动化哪些决策任务,Jev 在哪些场景好用,又会在哪里失效。告诉我们你想构建哪些科幻级应用!

创立 TypeSafe 的初衷:我们相信 AI 需要一套软件可以信赖的接口。期待看到新应用不断涌现,渗透到开发者社区与整个经济体系。

FAQ 常见问题

“System One 模型” 和 “Jev” 名字的由来

灵感来自丹尼尔・卡尼曼《思考,快与慢》。模型类别名称来自书中概念:系统 1(System 1)—— 快速、直觉式思考;系统 2 是慢速审慎推理。

传统认知里系统 1 思维容易出错。但基于后续我们会公布的理由,我们认为 System One 模型可以做到比替代方案更可靠。

Jev取自威廉・斯坦利・杰文斯(William Stanley Jevons)。我们认为机器智能的发展路径类似煤炭工业:蒸汽机效率提升之后,煤炭需求反而暴涨。智能成本每下降一个数量级,就会解锁多一个数量级的全新应用场景。

备注

  1. 创始人背景
    Diogo Almeida,ChatGPT 联合发明者,前 OpenAI 研究员,离开 OpenAI 后低调两年创立 TypeSafe AI。
  2. 核心判断
    对话型 LLM 虽然聊天能力很强,但自由文本生成、自回归 token 串行输出、幻觉、类型不稳定、高成本,导致很难大规模嵌入软件做自动化。
  3. Jev 定位:System One 模型
    • ❌ 不生成自由文本、代码、对话;✅ 只输出带概率的结构化决策(分类、打分、布尔判断)
    • 并行一次性输出全部结果,不是逐 token 自回归生成
    • 训练方法 RLCD,目标是校准概率,输出置信度
    • 无类型错误,消除结构化调用幻觉;延迟 70–500ms
  4. 定价
    输入 token $0.042 / 百万 token,输出 token 免费;官方评测最高可达 193.6 倍提速、444.6 倍成本下降。
  5. 适用场景
    软件内自动化决策、路由、风控、大数据批量打分、实时业务逻辑、LLM 结果校验防护;不适合聊天、写文章、写代码
  6. 取舍
    牺牲通用文本生成能力,换取速度、成本、类型安全、可靠概率置信度,目标是让 AI 真正大规模嵌入软件系统,推动产业自动化。

【声明】内容源于网络
0
0
苏哲管理咨询
为企业及组织提供AI+战略、数智化转型咨询及观点、建议等
内容 2226
粉丝 0
苏哲管理咨询 为企业及组织提供AI+战略、数智化转型咨询及观点、建议等
总阅读48.1k
粉丝0
内容2.2k