近期OpenAI Codex负责人Tibo接受了投资人Matthew Berman的采访,全程44分钟,透露了不少OpenAI接下来的产品方向和技术路线。
Tibo在Google DeepMind的收获
ChatGPT发布大约一年前,Google内部已经有能用的LM Chat,模型能生成连贯有用的内容,当时DeepMind内部也讨论过把它做成公开产品。
Tibo评价说,DeepMind是个很有创造力的地方,但整个组织没有围绕落地产品运作的习惯。到OpenAI之后,他最大的感受是,研究和产品团队从想法阶段就一起协作设计,整个组织有非常强的落地倾向。
OpenAI的文化非常自下而上,一个人有想法就能快速找到伙伴一起推进,很快就能上线,对新想法的阻碍很少。但高速推进也带来问题,很容易堆出一堆互不关联的功能,所以现在OpenAI也在强调简洁、性能、效率,最终要把所有产品统一起来。
OpenAI怎么保持高速迭代
给创业公司的建议很直接:要有信念,尽早拿到真实用户,然后根据反馈快速迭代。
对于OpenAI这种大公司,更难的一点是愿意主动打乱自己已经建好的成果。新能力、新研究出来之后,会重新分配资源,甚至从当前核心业务里抽资源投入新方向。
Tibo说,AI行业的发展不会等你把现有业务做舒服了再前进。而且模型能力不是跑完基准测试就完全清楚,OpenAI训练出新模型之后,内部要大量使用,才会突然发现新的用法,然后调整产品方向。
他举了语音功能的例子,现在ChatGPT的语音足够自然,还能调用工具,他自己已经习惯每天早上拿起手机,把今天要做的事说出来,ChatGPT拿到他的工具权限之后,就自己开始处理工作。模型能力的变化,直接反过来改变了产品设计。
下一代模型和Agent的方向
现在不少高级Codex用户已经习惯了复杂的架构,要手动维护技能文件,处理记忆遗忘,拆分子Agent之后还要协调子Agent的工作,最后堆出一个越来越复杂的小网络。在Tibo看来,这些都还是非常早期的形态。
OpenAI的目标很明确:让Agent深度理解你,理解你的目标、日常工作、你的团队,然后主动帮你干活,不需要用户天天管理这些底层结构。
另一个明确的判断是,笔记本电脑已经开始成为限制。电脑本身是按照人类的工作速度设计的,我们同时处理多少窗口、打字速度、能开多少应用,这些限制对模型不成立。未来模型可能同时跑100个应用,并行探索方案、写测试、编译、验证不同假设,需要的资源会超过单台消费级设备的能力,云端Agent会越来越重要。
开发者工作流会怎么变
OpenAI现在非常在意人的注意力。目前很多人用代码Agent的方式是一次开十几个,不停切换上下文,半小时后再回来检查结果。当Ultra Fast+语音普及之后,工作流会完全改变。
Agent的速度可以接近甚至超过人思考和表达的速度,你可以一直保持在同一个工作流里,边说想法,边看原型,边让它生成报告,接着修改,不需要频繁切换等待。
Tibo把Agent方向分成两类:
- 个人AGI:深度了解你,和你一起工作,主动推送重要信息,覆盖写代码、调研、咨询等各种任务
- 全自动化:比如自动查看生产日志,发现性能问题自己优化,发现回归问题自己修复,安全扫描找到漏洞自动补上,把漏洞暴露窗口压缩到接近0,人类只需要批准高风险操作就行
ChatGPT和Codex为什么一定会合并
这一段基本把OpenAI的长期产品方向说透了。一开始很多用户问,为什么非要把ChatGPT和Codex合并?Tibo的回答是,未来的模型要求它们合并。
未来底层就是同一种技术,同一个架构,同一个多模态、语音优先、高效能的Agent,它天然就能写代码,也天然能做其他所有事。OpenAI最终要做的就是一个个人AGI,界面可以根据每个人的习惯调整。
程序员、设计师、产品经理、普通用户这些分类,只是人类为了理解复杂世界造出来的标签,每个人实际需要的能力都是混合的。主持人问,最后会不会真的只剩一个底层接口?Tibo直接回答,是的。
你和你的妈妈未来用的就是同一个东西,连接的工具不同,做的事不同,看到的界面和拿到的能力不同,但底层就是同一个个人AGI。
未来交互会越来越环境感知化,你在办公室白板写字,AI能看到,你对着它说话,它知道你指的是什么,视觉、语音、语气、动作这些信息都会慢慢融入交互。
对竞争的态度
现在Codex已经有2000万用户,主持人问到了在代码Agent方向存在感很强的Anthropic。Tibo说,他很少关注竞争对手,现在主要盯着模型能力、模型效率,以及怎么把能力交给尽可能多的人。
OpenAI很看重社区和广泛触达,把Codex合并进ChatGPT就是这个思路,把代码Agent能力快速分给产品经理、设计师、销售、营销这些原本不会专门用代码产品的人,这也是Codex最近增长的重要动力。
为什么Tibo老是给用户重置用量限额
这个小故事挺有意思。最开始重置只是补偿,OpenAI快速迭代Codex的时候偶尔会出问题,把服务弄挂半小时,Tibo觉得用户这么依赖产品,那就把用量重置补偿大家。
后来慢慢变成了社区传统,更有意思的是,这个决定基本不需要市场或者财务审批,Tibo原话就是“我想按就按,觉得合适就按”。现在他们甚至做了一个实体的重置按钮,有时候产品没出问题,只是庆祝某个节点,或者想让大家试试新功能,直接就送用量。
为啥OpenAI敢这么送算力?因为他们很早之前就大规模规划计算资源,当时还有人质疑为什么投这么多,现在这笔投入已经见效。另外,新的前沿模型已经开始自己优化推理基础设施,Sol帮助优化Luna的服务栈之后,Luna的价格下降了80%。
除了成本,普通推理的速度相比三个月前已经提高了60%,这还没算Ultra Fast的提升。
递归自我改进已经出现
主持人问,模型优化自己的基础设施算不算递归自我改进的早期形态?Tibo认为算。
大家聊递归自我改进,通常想到的是模型训练下一代模型。现在OpenAI已经大量用模型优化支撑模型自身的基础设施,包括推理栈、CUDA内核、服务、产品形态、云端Agent。
模型变强之后,能帮助OpenAI更快改进运行模型的系统,系统变好之后,又能让模型发挥出更多能力,再把能力投回系统优化。Tibo把整个过程看成一个完整的大系统。
为什么之前暂停前沿强化学习训练
Tibo没有透露具体的安全事件细节,他说随着模型能力提升,对齐和安全的重要性在快速增长,OpenAI因此大幅增加了这部分的投入。那次暂停给了团队时间去理解整个系统,加固安全防护,等到形成明确的安全原则之后,再恢复训练。
他说这就是OpenAI正常研究流程的一部分,需要暂停的时候,内部能很快做出决定。
Ultra Fast会不会变成默认速度
现在OpenAI内部,Ultra Fast最典型的用途是故障响应,出问题的时候每一秒都重要,赶项目、验证核心新想法的团队也会申请。
14倍的token速度不代表所有工作都能快14倍,纯生成代码这种生成密集型任务,能接近满速加速,如果Agent流程里有很多工具调用,瓶颈就跑到网络、CPU和其他开销上,实际大概只有3到4倍加速。
OpenAI内部也没有给所有员工开放无限Ultra Fast,因为员工自己就能把生产GPU全吃光,所以会限制内部用量,大部分容量留给外部客户。
至于这种速度以后会不会永远是付费高端功能,Tibo判断,1到2年后,这种速度就会接近默认。原因不只是推理硬件升级,模型本身的token效率也在快速提高,Sol已经比之前的Terra高效很多,下一代模型还会继续更高效。当然,最顶端永远会有一个更贵更快、堆更多硬件的等级。
对普通人的建议
Tibo最后说的很朴素,现在模型能力正在快速变便宜,Luna这种今天已经很小很便宜的模型,放在六个月前还是前沿水平。这种变化会一直持续,今天昂贵的智能,半年后可能就便宜很多,最后变成非常普遍的资源。
对从没试过AI,甚至有点害怕AI的人,他建议先看看身边的人怎么用,写作、个人咨询、健康、金融,这些都是现在很多ChatGPT用户每天在用的功能。他自己也会用AI看健康问题,至少去见医生之前,先把问题弄明白,和医生交流的时候能掌握更多信息。
很多时候第一次感受到AI的价值,就是找到一个和自己生活有关的小问题,试一次而已。
关注公众号回复“进群”入群讨论

