关于AI智能体能不能替你操作电脑,硅谷一直有两种声音:一种说这玩意两年没进步,另一种说它已经比人快了。
近日在技术播客Latent Space中,主持人Vibhu和Swyx连聊了两场,嘉宾是OpenAI负责Computer Use产品与工程的Ari Weinstein,以及API团队产品负责人Nikunj Handa。Ari做了Shortcuts(前身Workflow),又创办了Mac桌面助手Sky,团队被OpenAI收进来,现在管Computer Use。
Ari讲了他自己最近干的事:订一家备餐服务,手上下单要花两个小时,丢给Computer Use,15分钟就完成了。
两人最后聊到一个更大的问题:当智能体能替人打开任何软件,OpenAI到底是在做API,还是在重演当年AWS那套发明——只不过每个零件都做成AI原生的版本。
左:Vibhu,中:Swyx,右:Ari Weinstein
01
下单两小时,交给它15分钟
节目录制当天是OpenAI DevDay,Ari刚从主题演讲台上下来。当天发布的东西里,他最看重的是把计算机操作智能体(Computer Use agents,能让AI像人一样点开软件干活)装进了Agents API,开发者可以直接用上Codex和ChatGPT里那同一套。他还提了新模型GPT-6.1 Sol:“它的成本是上一代模型Astra的五分之一,如果单看Computer Use,是七分之一。”
Vibhu注意到Dots现在有自己的个人电脑了。Ari解释,每个Dot在云端都有自己的Linux虚拟电脑,能跑完整的桌面应用。Swyx则把YouTube塞进虚拟机里操作,因为很多功能根本没有API。
Ari自己最近在弄的是备餐服务的下单。“我下个单要花两个小时,后来我发现可以让Computer Use帮我下,它十五分钟就搞定了。它比我快八倍。”
Swyx随后抛出争议:有个做头部AI播客的朋友说,Computer Use这两年根本没进步。Ari正面回应:“Computer Use跟当时比,完全是180度不一样。”
02
从卡住,到会自己debug
一年之间到底变了什么?Ari说,最大的差别在失败之后:“以前它们能比较可靠地把任务开个头,但接着就撞上问题;现在它们真的很会debug,很会重试,会反思哪里行哪里不行。”
另一个变化是动作方式。展开Codex里的函数调用会发现,它不再一次只做一个动作,而是直接写JavaScript代码并执行,一次完成很多步。现在靠无障碍接口和直接访问DOM,模型能直接看到整页甚至整个应用。
Ari还讲了一个细节:它越快,越容易被操作本身卡住。“在我们的任务基准里,有相当一部分时间其实是在等DoorDash自己加载。”
他眼下最喜欢的用法,是让Computer Use去测智能体自己写出来的软件:有了它之后,整个软件开发生命周期就能闭环了。至于下一步,他的判断很直接:“下一个前沿是让它的表现真正达到超人类水平。”
03
Jev推了一把,一周做出决策API
第二场对谈的嘉宾是OpenAI API团队的产品负责人Nikunj Handa,他负责随新模型发布把新能力暴露成API。Swyx先问那个大家都盯着的问题:UltraFast是不是跟Cerebras有关,你们既不承认也不否认;接着他问那个更快的东西——决策API:看到Jev之后,你们多快反应过来要跟进?
Nikunj的答案干脆:这事一周前才起步,完全不在原定计划里。“首先要给Diogo和Jev团队点个大大的赞,他们真的启发了市场上这一整块。”他说内部本来也需要一个快得多的分类系统,于是推理和基础设施团队做了个原型,一跑还真能用。
Swyx随即泼冷水:所谓Jev API说白了就是结构化输出,而结构化输出本来就是OpenAI先做出来的。“我完全可以拿Luna,把推理关掉,再套上结构化输出,那我是不是就有一个Jev了?显然不是。”Nikunj同意,并给细节:决策API没有专门训练新模型,就是零样本跑在同一套Luna权重上,靠并行批处理、关掉推理来提速。他透露的第一个内部用户是用户运营团队——把所有的客服工单都分类一遍。Swyx惊讶地重复:“才一周?”
04
缓存保证到12小时,和手动挡的compact
Nikunj把Responses API称作团队的主力干将,眼下的重点是性能:一边重写整个技术栈,把首token时间和首个决策时间压到尽可能快;一边在缓存上往深里做。“现在我们能保证三十分钟内的缓存命中。”他说,团队还刚给一个用户上线了12小时的缓存保证,“哪怕你那条线程用完先放着,三四个小时之后回来接着用,照样还能吃到缓存的性能”。这项能力还在预览阶段。
Swyx的保留意见是:缓存确实必需,但说到底还是会撞上100万token的上下文上限,所以还是需要好的压缩。Nikunj给了两条路:Agents API里压缩直接做进智能体外壳;Responses API里要么服务端自动压缩,要么用斜杠compact自己决定什么时候压。Swyx调侃“这不算AGI,这是个手动挡”,Nikunj认同。
05
你们其实是在造一朵AI云
Vibhu点出一个反差:一边是能一周做出决策API的黑客文化,另一边像Sam Altman说的,OpenAI的API属于市面上最可靠的那一档,而这恰好直接由Nikunj的团队负责。Nikunj没辩解,只承认进展快到惊人。
他举的例子是自家产品:刚上线的Codex安全功能完全建在Agents API上,当天上线的一个会议类产品也是——会议笔记直接从日历流进你的文档。“现在事情进展太快了,大家从想法到落地快得惊人。”
最后收尾的是Swyx的那个类比:“你们其实是在造一朵AI云。这个说法Sam一年前就讲过。就有点像你在复刻当年AWS的那套发明,这个是EC2,那个是S3,但你做的,是每一个对应的AI原生版本。”
对做产品的人来说,问题也留在这儿了:当一朵云开始把缓存、压缩、记忆、工具调用一层层做成API原语,你该自己搭的东西,还剩下多少?
原节目:Latent Space《Why Dwarkesh is Wrong about Computer Use + How OpenAI shipped its Jev competitor in 1 Week》

