RLHF 核心作者另起炉灶,TypeSafe AI 发布“只判断不聊天”模型 Jev
Diogo Almeida 是 RLHF(基于人类反馈的强化学习)论文的核心作者之一,曾深度参与 InstructGPT、ChatGPT 及 GPT-4 的研发。然而,这位幕后功臣近日携新公司 TypeSafe AI 回归,发布了一款名为 Jev 的 AI 模型。与传统大模型不同,Jev 的定位非常明确:它不会聊天,只做判断。
RLHF:一种通过将人类偏好和评价融入训练过程,以优化 AI 模型的技术。
Almeida 认为,聊天机器人并非通往通用人工智能(AGI)的唯一路径,未来大部分 AI 应作为后台程序安静运行,无需与人对话。基于此理念,他联合连续创业者 Erik Gafni 和前 Meta 研究工程师 Sasha Sheng,于 2024 年在旧金山创立 TypeSafe AI。历经两年研发,该公司估值已达 2 亿美元。
Jev 模型核心机制:System One 快速决策
TypeSafe 将 Jev 定义为"System One Model",其核心职能是快速判断,而非深度推理或文本生成。该模型接收非结构化输入(如邮件、日志、JSON 数据或游戏状态),结合预设的结构化问题,一次性并行输出带概率和置信度分数的答案。
本质上,Jev 是一个智能化的函数调用工具:输入非结构化状态,输出带类型的概率决策。例如,面对“这封邮件属于技术问题、销售问题还是投诉”的指令,ChatGPT 可能生成冗长的分析文本,而 Jev 能在 70 毫秒内直接返回结构化结果:“技术问题 85%,投诉 8%,销售 7%"。
由于输出结构预先定义,Jev 在数学上避免了格式错误。TypeSafe 据此宣称该模型不会产生幻觉,但这一观点在业界尚存争议。
极致性能与成本优势
价格低廉
Jev 的定价极具竞争力:输入 Token 价格为每百万 0.042 美元(即 10 亿 Tokens 仅需 42 美元),远低于主流大模型每百万 0.20 至 10 美元的区间;输出 Token 则完全免费。
速度惊人
从接收请求到返回结果,Jev 仅需 70 至 500 毫秒,而同类任务在传统 AI 模型上通常耗时 3 至 329 秒。实测数据显示,处理同一段客户状态描述,Jev 耗时 0.114 秒,而 GPT-5.6 Terra 耗时 8.566 秒。
独立开发者测试表明,调用 5000 次 Jev 的成本约为 2 美元,平均延迟仅为 150 毫秒。
应用场景实测:从游戏决策到内容质检
尽管不生成文本,Jev 在实时决策场景中表现优异。在“毁灭战士”游戏演示中,TypeSafe 将游戏状态转化为结构化文本,以每秒 10 次的频率发送给 Jev,由其实时决策移动、射击和转向动作。每小时运行成本仅约 7 美元,远低于团队预期。
在维基百科链接跳转测试中,Jev 也能以更少的步数从起始页面到达目标页面,展现出优秀的路径判断能力。
此外,科技博主 Dan Shipper 利用 Jev 在 0.7 秒内完成了对其过往所有文章的评判。他提出一种新范式:由常规大模型负责内容生成,Jev 担任后端质检员,构建高效的生产审核闭环。
争议与命名渊源
技术透明度存疑
目前,Jev 的性能数据均源自 TypeSafe 官方,缺乏第三方独立验证。由于未公开架构、权重、训练数据来源及相关学术论文,业界质疑其是否仅为传统分类器的重新包装。同时,“不会产生幻觉”的说法遭到反驳:类型安全仅能保证输出格式正确,无法确保内容逻辑的真实性。
命名背后的经济学隐喻
"Jev"之名源于 19 世纪经济学家 William Stanley Jevons 提出的“杰文斯悖论”:蒸汽机效率提升导致煤炭消耗量反而增加。Almeida 借此寓意:随着 AI 智能成本降低数个数量级,其使用量将呈指数级增长。
而"System One"的概念则取自丹尼尔·卡尼曼的《思考,快与慢》,象征该模型专注于类似人类直觉的快速判断,而非慢速深度推理。
目前,TypeSafe 已开启早期内测,用户可通过官网 typesafe.ai 加入候补名单。

