本期播客,No Priors 邀请了被誉为 AI 推理领域「教父级」人物的 OpenAI 研究科学家 Noam Brown。作为推动「test-time compute scaling」(测试时计算扩展)成为行业主流的关键人物,Brown 的研究轨迹见证了行业对「推理」认知的升级。
Brown 在对话中提出一个严峻观点:当前习以为常的模型评估方式,正在系统性地误导业界对 AI 能力的判断。其核心论点如下:
1. Benchmark 表格陷入「坏均衡」:传统的横向列指标、纵向比分数的方式未控制「推理计算预算」。只要增加思考时间和 Token 消耗,分数即可提升,导致评估失真。
2. 模型能力应视为成本曲线:合理的评估应将模型表现绘制为随 Token、成本或时间变化的函数曲线。唯有控制预算,才能清晰观测新一代模型的实质跃迁,而非单纯比较算力投入。
3. 能力取决于预算投入:现有的负责任扩展政策(RSP)多基于 GPT-3 时代假设,默认模型能力固定。事实上,10 美元与 1000 万美元预算下,模型所能完成的任务截然不同。
4. 递归式自我改进非「一夜爆发」:尽管模型加速了研究流程,但距离自主完成所有研究仍有距离。释放最强能力需大量推理时间,时间本身构成瓶颈。
5. 现有模型潜力被严重低估:以 Erdős 单位距离猜想为例,若投入充足预算(如 10 万美元)并构建合适任务框架,公开模型本可推翻该数学难题。目前因缺乏系统性探索,模型天花板远未被触及。
6. 多智能体协作是复利新源:人类文明优势在于长期协作与知识积累。未来模型需突破短暂上下文窗口的限制,进入大规模协作、共享知识的「协调式复利」状态。

Benchmark 为何失效:从单点跑分到成本曲线
Sarah Guo:欢迎回到 No Priors。今天嘉宾是 AI 推理领域的关键人物 Noam Brown。我们将探讨模型评估体系的失效、大规模推理计算、递归式自我改进及前沿 AI 竞争走向。
Noam Brown:很高兴再次参与。
Sarah Guo:你近期关于大规模推理计算及评估稳健性的文章引发共鸣,写作动机是什么?
Noam Brown:动机源于 o1(文中指代 5.5 系列模型)发布后的反应。初期因 Benchmark 表格显示的提升幅度有限,外界曾怀疑其实力。但用户实际体验后迅速确认了其显著增强。
问题在于传统 Benchmark 表格的呈现方式:它给出单一分数,却未控制每道题目消耗的推理计算预算。o1 实际上是思考效率更高的模型。若在最大设置下运行,旧版模型思考更久且返回更慢;而新版模型更快。一旦控制思考时间变量,新版模型的跃迁便清晰可见。
核心问题在于:模型究竟应该思考多久?过去模型无法进行长程有效思考,性能很快到达平台期。但现代模型在合理任务框架下,可长时间持续思考直至极远的平台期,这使得传统测试方法难以触达其真实性能极限。
Sarah Guo:这意味着我们需要引入基于 Token 的「预算限制」或「耐心限制」。
Noam Brown:完全正确。合理的评估要么设定明确预算(Token、成本、时间),要么将表现绘制为随推理预算增加的函数曲线,以此比较不同模型。

推理计算时代:AI 能力即成本函数
Sarah Guo:面对可能超出常规发布周期预算的评估任务,该如何处理?
Noam Brown:在网络安全等任务中,模型在消耗极高 Token 后性能仍在提升。这种提升并非不连续跳跃,而是呈现持续斜率。未来的研究方向或许是:能否利用低预算下的表现,预测模型在高预算下的表现?
Sarah Guo:用户是否普遍未让模型思考足够久?行业对推理预算的使用是否不足?
Noam Brown:这取决于具体场景。虽然长时思考能提升 Benchmark 分数,但在实际工作流中并不总是实用。最有效的模式是与模型快速迭代。思考时间应灵活调整:需快速响应时则快,需深度推理且用户允许时则慢。目前行业正在寻找这一平衡点。

Benchmark 刷分与扑克机器人:表象与实质
Sarah Guo:如何看待 Benchmark 刷分现象?哪些评估更能代表真实能力?
Noam Brown:Benchmark 刷分极易实现,例如通过多次运行取最优解或引入评判模型,但这在未控制计算预算的情况下具有误导性。公开 Benchmark 永远面临被针对性优化的风险,保留私有测试集是必要手段。
对我而言,构建扑克机器人是极佳的评估方式。该任务开源代码少,需大量推理、迭代及处理细节陷阱。早期模型在此表现糟糕;至 o1 前期版本,已能协助构建求解器,效率提升五倍,但仍存在「自信地误导」问题,需人工严格核查。
最新一代模型在此类任务上表现显著改善,仅需少量引导即可完成复杂求解器构建。预计未来一年内,模型可在几乎无需示范的情况下独立完成此类相当于博士论文级别的任务。

安全评估新难题:高预算下的能力衡量
Sarah Guo:基于推理速度和预算的评估方式,对安全评估有何影响?
Noam Brown:现有的负责任扩展政策(RSP)和风险准备框架多诞生于 GPT-3 时代,默认模型能力固定,未充分考虑测试时计算扩展。当今世界,模型能力是投入资金的函数。1 万美元与 1000 万美元预算下,模型的风险能力截然不同。
核心困境在于:应在何种预算下评估模型风险?现有政策对此缺乏回答,某种程度上是在回避问题。若模型在长周期任务上随预算增加而持续变强,那么对于社会不希望其掌握的能力,同样存在此风险。
此外,模型发布周期加快与长周期评估之间存在矛盾。要确定模型在长时运行后的能力上限,唯一方法是让其真实运行足够久。然而,在新模型发布前,鲜有人将现有模型推至极限,导致我们对模型的真实天花板知之甚少。
Sarah Guo:已发布模型是否存在因时间不足而未被发现的潜在能力?
Noam Brown:绝对存在。Erdős 单位距离猜想的推翻即为佐证。OpenAI 使用内部模型在低预算下发现了反例。随后发现,公开模型在投入适当预算(如 10 万美元)并构建合适任务框架后,亦可达成此结果。这说明此前无人充分探索过「高预算下模型能做什么」。
尽管等待下一代模型可能降低成本,但 OpenAI 的战略重点并非遍历所有开放问题,而是利用当前模型制造更强、更安全、更具成本效率的下一代模型,赋能全球科学家。

递归式自我改进:渐进演变而非一夜爆发
Sarah Guo:大规模推理计算如何影响递归式自我改进(RSI)?
Noam Brown:我们尚未达到「给足预算即成超级智能」的阶段。事实检索类任务不会因思考时间延长而提升;而数独类任务则可随时间无限提升。大多数任务介于两者之间。
目前模型尚缺乏完美的研究判断力,虽能大幅优化现有算法(如我的扑克求解器代码),但难以独立提出超越人类的全新算法。RSI 正在加速研究环节,但受限于未加速的环节,整体呈现渐进式起飞,而非「隔夜智能爆发」。
由于释放模型最强能力需大量推理时间,时间本身将成为瓶颈,限制了智能爆发的速度。

多智能体协作与新的评估均衡
Sarah Guo:前沿领域还有哪些探索不足的方向?
Noam Brown:多智能体协作在大规模下潜力巨大。人类文明的优势在于数十亿人的长期协作与知识积累。当前 AI 模型仍受限于短暂的上下文窗口。未来需实现模型间的大规模协作与知识共享,形成「协调式复利」。
关于前沿竞争,各实验室均已意识到利用模型改进模型研究的重要性及潜在风险。虽然竞争激烈,但共同寻求正面结果的共识正在形成。
在实际应用上,模型已适合辅助高风险决策(如税务、法律文件解读),但仍需人工审慎判断。然而,行业在评估发布上仍陷于「坏均衡」:明知单一分数表格有缺陷,却因惯例而继续发布。打破这一均衡,转向以 Token 或成本为横轴的曲线评估,是提升评估生产力的关键。
对于路由层公司,其价值在于管理并行化与预算分配。但核心检验标准依然是:在控制推理计算预算的前提下,多模型共识是否优于单模型长时思考?唯有在同一尺度下对比,方能做出最优决策。

