编者摘要:本次由 ChatGPT 初代核心研究者、InstructGPT 论文作者 Diogo Almeida,正式发布全新 AI 模型 Jev,彻底颠覆传统 LLM 技术范式。过去两年,团队闭门攻关行业核心难题:现有大模型对话能力极强,却始终无法落地大规模软件自动化。根本原因在于传统 LLM 必须通过生成自然语言或结构化文本完成判断,再由程序解析执行,速度慢、成本高、易产生幻觉,不适合高频工业级决策。
Jev 摒弃文本生成逻辑,依托全新 RLCD 校准决策强化学习算法,直接输出带精准概率的结构化决策结果,适配风控判定、业务分流、工具选择、审批判断等场景。相较传统大模型,Jev 提速 20–200 倍、成本降低 40–400 倍,输出 Token 免费,最低延迟仅 70ms,且实现概率校准、无类型错误。
行业正式迈入双层智能架构时代:大模型承担复杂推理规划,Jev 承接海量低成本毫秒级决策。伴随 TypeSafe 4000 万美元种子轮融资落地,AI 竞争核心从 “模型更聪明”,转向低成本、可嵌入全场景的工业级智能决策。
Jev 新模型10关键问题问与答
1. Jev 是谁做的?
由ChatGPT、InstructGPT 联合发明者 Diogo Almeida带队,前 OpenAI、Google、Meta 核心团队两年隐身研发推出的全新一代 AI 决策模型。
2. 为什么要做 Jev?传统 LLM 不够用吗?
传统大模型擅长 “说话、推理、创作”,但不适合软件自动化。每次判断都要生成文本、再解析,速度慢、成本高、易幻觉,无法大规模塞进业务代码。
3. Jev 和普通大模型最大区别是什么?
放弃文本生成,只做结构化决策。不输出废话、不写小作文,直接输出可被代码执行的判断、分类、评分与置信概率。
4. Jev 的核心技术是什么?
全新训练范式 RLCD 校准决策强化学习。不优化话术好听,只优化判断正确率与可信度匹配,90% 置信基本等于 90% 真实准确率。
5. Jev 性能优势到底有多强?
对比传统 LLM 决策任务:提速 20–200 倍、降价 40–400 倍,输出 Token 完全免费,最低延迟仅 70ms。
6. Jev 能解决什么业务场景?
专注高频自动化判断:交易风控、用户分流、审批判定、工具选择、内容核验、智能路由、数据打分等工业级场景。
7. Jev 不能做什么?
不会聊天、不会写作、不会通用创作。它不是替代 ChatGPT,而是替代 LLM 里低效的决策环节。
8. 什么是未来双层 AI 架构?
- System2(大模型)
负责复杂推理、规划、创作、长任务 - System1(Jev)
负责海量、快速、超低成本的代码级智能判断
9. 商业进展如何?
TypeSafe 刚完成 4000 万美元种子轮融资,顶级机构 DCVC 领投,正式进入商业化落地阶段。
10. 这次 AI 革新的核心变化是什么?
AI 竞争不再只比 “谁更聪明”,而是比谁能把智能足够便宜、足够稳,塞进软件每一处 if 判断,真正实现全域自动化。
附录 TypeSafe AI 发布:System One 模型与 Jev
发布时间:2026 年 9 月 15 日作者:Diogo Almeida,TypeSafe 创始人,ChatGPT 联合发明者之一
在参与发明 ChatGPT 之后,我一直在追问自己:为什么具备超人对话能力的大模型,并没有带来通用人工智能 AGI?过去两年,我在低调研发一套全新的模型训练方法 RLCD,以及一款全新的前沿 AI 模型 —— 今天我们正式发布:Jev
-
速度提升 20–200 倍 -
成本降低 40–400 倍(输出 token 完全免费) -
面向决策任务优化的前沿可组合智能
在我看来,这是通往 AI 驱动经济革命最短的路径。
但性能提升并非没有代价:Jev 不能生成文本。把 Jev 和传统大语言模型并排对比,就能清晰看到取舍。一个有趣的类比:用并行计算替代串行计算,当年 Transformer 正是靠这一点超越了 RNN 循环神经网络。
介绍 System One 模型与 Jev
多年前大模型在对话能力上就已经超越人类,但大规模自动化落地为什么迟迟没有到来?这是过去四年驱动我持续思考的核心问题。我曾在 OpenAI 参与研发让语言模型学会遵循指令、与人对话的技术,这套成果最终成为 ChatGPT 背后的核心研究。当时我一度认为对话模型可以通向 AGI。但伴随热度不断发酵,我渐渐意识到:这里缺失了一块至关重要的东西。
经过两年秘密研发、无数技术攻坚与研究突破,我非常激动地宣布:TypeSafe AI 正式推出首款System One 模型。这是一类全新的前沿模型,专门用来快速生成结构化决策结果,可直接被软件调用。
我们从零搭建了一套面向自动化的完整技术栈:全新模型架构、最大化效率的并行采样器,以及我们命名为RLCD(Reinforcement Learning for Calibrated Decisions,校准决策强化学习)的训练方法。
首款公开模型 Jev现已开启早鸟访问。在 System One 类任务上,Jev 拥有与现有前沿大模型相当的智能水平,同时速度与效率高出两个数量级。Jev 放弃了自由文本生成能力,但针对结构化输出做深度优化,不会产生幻觉。
你可以把 Jev 理解为具备前沿智能能力的函数调用:输入非结构化状态信息,输出带类型约束的概率化决策结果。
非同寻常的论断,需要非同寻常的证据,下文附上完整验证材料。
新旧前沿模型对比表
实验证据与技术结果
我们本身就是怀疑论者,也欢迎所有质疑。有部分结论很容易自行验证:
-
单次调用速度:我们确实能达到这个速度,目前公开评测是在西海岸服务器(我们服务部署地)搭配笔记本客户端完成。 -
单次调用成本:定价完全透明。我们无法证明定价没有补贴,需要更长时间验证定价可持续性(我们预期未来价格继续下降)。 -
无类型错误:只要找到一个反例就可以证伪,但从原理上这在数学层面是保证成立的。
对于更大胆的论断,我们会尽可能补充细节说明。
并排对比演示
演示直观展现 Jev 和 LLM 的核心差异:Jev 并行输出全部概率,而不是自回归逐 token 生成。字符串文本虽然通用性极强,但代价高昂。放弃自由文本生成,反而赋予我们很多新能力!
补充说明:早鸟用户可以打开演示地址。查询经过高度简化,问题选用可读性强的键名,保证页面输出易懂。输入状态是简短精炼的段落,目的是凸显采样机制差异。较短输入会对我们模型有利。细心的人会发现,本次演示中,唯一和 GPT-5.6 Terra 不一致的地方是「客户流失概率等级」。在我们看来,这个问题本身答案就存在模糊性。本演示选用 GPT-5.6 Terra 默认推理模式,因为我们测试下来,它在平均能力上和 Jev 最具备可比性。顺带一提:正是类似的演示,让我们下定决心全力投入 System One 模型这条技术路线。
工作流评测
我们设计了一套全新评测体系,衡量 AI 嵌入代码后的实际表现。评测不优化固定标准答案,也不固定评测框架和模型(避免通过评测工程造成过拟合)。我们假设存在一个正确的计算图(代码实现的工作流),使用当前最强、最昂贵的外部大模型预测结果作为参考概率。
简单说:所有模型使用完全相同的工作流。我们将结果和最强模型(Astra 与 Fable)的均值做对比。
Jev 表现十分突出,在帕累托最优曲线上取得接近两个数量级的优势。我们也对比了在提示词内完成完整思维链逻辑的 LLM,但这类方案效果显著弱于直接使用工作流。
注:这里的调用任务比上面的并排演示复杂得多,更贴近真实业务自动化生产负载。下面是我们发布 4 套工作流里最简单的一套。
真实世界里最可靠的工作流,往往包含大量独立、拆解后的子问题;细粒度行为依赖概率,而不是离散判定。最终结果是分支逻辑,但得到答案的过程需要大量领域工程,并且要求高度稳定。
全部评测数据、案例、分歧样例、完整查询语句与工作流都可以在 evals.typesafe.ai 查看。
补充说明:官网所说193.6 倍提速、444.6 倍降价,就来自这套评测,属于性能上限,真实场景提升幅度通常会更低。工作流任务没有刻意挑选、美化来抬高模型表现,也不在训练数据分布内。但任务由我们模型能力团队编写,依然可能存在偏差。我们以 GPT-6 Astra 和 Fable 5.1 的平均结果作为标准答案,相当于偏向 OpenAI 和 Anthropic,反而可能低估 Jev 与 DeepSeek 模型的相对能力。LLM 使用我们开源的 system-one-adapter-python 封装库,强制 LLM 输出适配我们 API 的结构化决策。这是从 LLM 获取决策结果最准确的方式,但相比不带概率输出的调用,会更慢、更贵。
幻觉与类型安全
幻觉和类型安全本质上高度相关,我们认为类型安全是自动化系统的基础底线。智能体里出现幻觉式工具调用只是麻烦;但如果系统带有延迟保障,或是多层依赖链路中嵌入 AI,幻觉就是致命缺陷。现有模型无论能力多强,依然会产生幻觉、类型报错。
补充说明:LLM 相关数据来自 OpenRouter,存在潜在偏差:更复杂查询大概率会路由到更强的模型。Jev 的类型安全数据不是实测统计:Schema 结构匹配由机制保证,因此在图表中可以直接记为 0 错误。
趣味演示案例
最激动人心的是这套技术可以解锁全新场景,我们还有很多成果待展示,下面是团队最喜欢两个 demo:
- Doom 游戏
这个 demo 很好地展示实时智能,以及代码 + AI 的可能性。开发工程师原本担心每秒 10 次调用(成本约 7 美元 / 小时),但团队觉得比预期便宜。这个项目很有意思,后续我们会发布详细教程,还计划举办黑客松活动。
说明:demo 输入是带文本的结构化游戏状态,还没有用到图像输入。纯非 AI 的 Doom 机器人可以打得更好;我们的目标是让机器人对不同形式的游戏状态做出反应,并且可以遵循指令。
- 维基竞速 Wikiracing
游戏规则:从一个维基页面出发,仅依靠页面内链接,抵达目标维基页面。每一步需要在数百到数千链接里做选择。这个场景非常适合展示单位时间内的智能收益,同时体现无幻觉在高选项数量场景下的叠加优势。
说明:纯属巧合,第 2、3 轮挑战起始页面都是 “橡皮鸭”,团队成员才发现。本 demo 里 Jev 的提速幅度低于前面案例,因为对比基准是大模型关闭推理模式(Astra 设置最低推理等级)。这是为了让演示观感更流畅;如果开启推理,LLM 表现会差很多。Jev 最高支持 255 个候选选项。当候选集数量很高时,采用两阶段机制:独立打分,再显式决策,因此偶尔会出现延迟小幅上升。
未来规划
Jev 还处在早期阶段,我们还有大量研发计划,会持续迭代交付🔥。今天 typesafe.ai 正式上线,我们会尽快把开发者从候补名单转为正式访问。我们希望听到大家需要自动化哪些决策任务,Jev 在哪些场景好用,又会在哪里失效。告诉我们你想构建哪些科幻级应用!
创立 TypeSafe 的初衷:我们相信 AI 需要一套软件可以信赖的接口。期待看到新应用不断涌现,渗透到开发者社区与整个经济体系。
FAQ 常见问题
“System One 模型” 和 “Jev” 名字的由来
灵感来自丹尼尔・卡尼曼《思考,快与慢》。模型类别名称来自书中概念:系统 1(System 1)—— 快速、直觉式思考;系统 2 是慢速审慎推理。
传统认知里系统 1 思维容易出错。但基于后续我们会公布的理由,我们认为 System One 模型可以做到比替代方案更可靠。
Jev取自威廉・斯坦利・杰文斯(William Stanley Jevons)。我们认为机器智能的发展路径类似煤炭工业:蒸汽机效率提升之后,煤炭需求反而暴涨。智能成本每下降一个数量级,就会解锁多一个数量级的全新应用场景。
备注
- 创始人背景
Diogo Almeida,ChatGPT 联合发明者,前 OpenAI 研究员,离开 OpenAI 后低调两年创立 TypeSafe AI。 - 核心判断
对话型 LLM 虽然聊天能力很强,但自由文本生成、自回归 token 串行输出、幻觉、类型不稳定、高成本,导致很难大规模嵌入软件做自动化。 - Jev 定位:System One 模型
-
❌ 不生成自由文本、代码、对话;✅ 只输出带概率的结构化决策(分类、打分、布尔判断) -
并行一次性输出全部结果,不是逐 token 自回归生成 -
训练方法 RLCD,目标是校准概率,输出置信度 -
无类型错误,消除结构化调用幻觉;延迟 70–500ms - 定价
输入 token $0.042 / 百万 token,输出 token 免费;官方评测最高可达 193.6 倍提速、444.6 倍成本下降。 - 适用场景
软件内自动化决策、路由、风控、大数据批量打分、实时业务逻辑、LLM 结果校验防护;不适合聊天、写文章、写代码。 - 取舍
牺牲通用文本生成能力,换取速度、成本、类型安全、可靠概率置信度,目标是让 AI 真正大规模嵌入软件系统,推动产业自动化。

