整个AI圈都在讨论模型该有多聪明。但有人回头看了一眼:这些聪明,到底变成了多少钱?
在技术播客《Latent Space》中,主持人swyx与TypeSafe AI创始人兼CEO Diogo Almeida聊了一场。Diogo在OpenAI待了约四年,做RLHF和后训练,是InstructGPT论文的共同作者,2024年离职。
2026年9月15日,TypeSafe结束隐身,宣布DCVC领投的4000万美元种子轮,同时发布首个模型Jev——一个不生成文本的模型。而起点,是他当年拼命把InstructGPT推上线,然后眼看着它只被拿去写文案。
他抛出的最大判断是:他猜,今天所有模型对有经济价值的工作,加起来还不到1%。真正该被盯住的指标,是五年内做到3%的全要素生产率(TFP)增长。
左:swyx,右:Diogo Almeida
01
Jev是什么?一个不生成文本的模型
节目一开始,swyx就让Diogo给「活在石头底下」的人一个明确说法:Jev到底是什么。
Diogo说,名字叫什么他们并不执着,最准确的说法是「System 1模型」——他刻意不叫决策模型,因为System 1的含义比决策更广。定义只有一句话:让代码成为消费者。「跟预训练大语言模型不一样,那些是为了给互联网做自动补全的;也跟人类反馈强化学习模型不一样,那种聊天机器人是为了回复文本的。而我们这一类,是让这些东西直接被代码消费。」这也是公司取名TypeSafe的原因。
Jev按「每美元智能」优化,名字取自杰文斯悖论。官方称Jev响应70到500毫秒,比前沿LLM快40到200倍、便宜40到400倍(自测数据)。
但最动人的一段是旧事。他当年为部署InstructGPT争得非常凶,最早的几个版本用的甚至是没发表的算法,因为用PPO清洗数据太慢。「我当时就想,去他的,这东西太他妈好了,我们得把它交到用户手里。」上线后几乎立刻吃下当时大模型市场一半的份额。
然后他发现,这个看起来聪明到让人怀疑是不是AGI的东西,实际只被拿来做文案写作——Jasper、Copy.ai,就是今天被叫做slop的网页内容。「我们当时担心我们把互联网变得更糟了。」于是他回到原点重想缺了什么,答案是机器那一侧。他把这称为自己的北极星,原以为一周就能搞定,结果一训就是很久。
02
拒答是「类型错误」
这一节是全场最硬的一次过招。Diogo反对的不是安全这个原则,而是安全对齐通常和用户的利益错位。
「拒答显然就是个类型错误。你是个人,在跟机器人聊天,突然来个拒答,那真是烦人,但你还得忍着用。」他真正担心的是另一件事:如果这东西是个依赖库在后台跑着?「你想让软件因为某个用户在里面发了条奇怪的消息,就随机崩掉?这完全是疯了。」
swyx在这里给出了全场唯一一次正面反驳:「如果我们拿它去杀人呢?」
Diogo承认这个观点在一些务实的地方站得住,但坚持通用技术的地基不是那种地方。他区分了两个层次:安全对齐放在ChatGPT、Claude这样的产品上非常合理,放在API里则「完全不能接受,因为大家得围着它写程序,这太反用户了」。而如果为了防某些用途去调模型,「那会把智能撕碎」。他的类比是:智能更像数据库,而不是同事——数据库没有义务审查自己被用来干什么。
两人没有完全达成共识,但swyx接住了他的内核:你要的其实是一个任何地方都能用的「认知内核」。
03
为什么拒绝公开跑分
swyx追问:你是担心榜单饱和,还是担心有人在公开榜单上训练?
「不光是容易作弊,还有一大堆问题。」Diogo说,公开榜单极其容易被刷,即使实验室主观上不想刷,最后还是会刷——早年每个实验室都有团队专门收集看起来像MMLU的数据,好让分数好看点。「那其实就是刷榜,只是多了几步的刷榜。」
他请swyx做个思想实验:两年之后市面上大概会有五十个Jev克隆,那大家卖的就只是单位智能。所以他相信长期只能靠感觉和信任,直到你把模型放进一个具体的工作流里去量化。
这也是他们不用用户数据训练的原因:真实世界的数据分布太偏——大家问的东西遵循幂律,你最后会过拟合到那上面。他说他们的目标是让模型长成几年后的通用基础设施,用当下的数据训,只会过拟合到当下。
代价他也讲了。去年融资的时候没人信他们,投资人要的就是跑分,他们的回答是:我们不搞这个。「那是在奖励坏人。我根本不在乎你想要什么。这就是我们。」
swyx的评价是:这是选了难走的那条路,但最后你会造出一家自己愿意在里面工作的公司。
04
所有模型加起来还不到1%
节目最后,Diogo掏出了他认为最没人关心的那个指标。
「我从没见过哪家实验室在乎全要素生产率增长。可经济革命说的就是这个啊。」他反复引用的招牌数字是:TFP增长在五年内读到3%。
他的发难方式是拿年份做对比:2019年的软件超级值钱,可现在都2026年了,AI这么牛,软件几乎还跟当年一模一样,最多就是旁边多了个聊天框。而那个聊天框没法让公司拿它做真正有利益相关的决策,因为它不能被信任去做决策。
于是有了他对今天的判断:所有模型在有经济价值的工作上大致并列在「零」。有可能已经开始动了,但他猜还没到1%。
那瓶颈在哪?他强调不是速度和成本,是可靠性。至于确定性——同样的输入给同样的输出——他认为那是错的北极星。「确定性我们能做,只要有人能说服我们它值得,而且我们手上没这么严重的GPU短缺,我们很乐意把这些模型都做出来。」但现在它会让每美元智能变少。人们真正要的是鲁棒性:相似输入得到相似输出,测法之一是在提示里塞UUID,期待所有回答彼此相似。
顺着这个逻辑,他给出了对SaaS的预测:「反向SaaS末日」——SaaS会被大幅增强,而不是被取代。他说,最清楚哪些环节值得自动化的,就是SaaS公司自己。
这场对话给技术圈留下的问题很具体:你在做的那个AI产品,是在当旁挂的聊天框,还是真的被代码当成了数据库一样的基础设施?
原节目:Latent Space(Jev: System One models for Prod, not God,2026-09-21)《Jev: System One models for Prod, not God — with Diogo Almeida, CEO, TypeSafe AI》

