一个已完成训练的大模型,在不更换参数、不做微调的前提下,还能挖掘出多少性能潜力?
当行业聚焦于 Test-time Scaling(测试时扩展),试图通过推理阶段的算力堆叠实现突破时,开源框架 LLM-as-a-Verifier 引发了现象级讨论,并迅速登顶 GitHub 热榜。
面对日益复杂的 AI Agent 任务,如何低成本且精准地评判大模型输出的对错,一直是行业难题。由 Jacky Kwok 牵头,联合斯坦福大学、加州大学伯克利分校及英伟达研究院组成的团队,给出了突破性解法。
在高难度的 Terminal-Bench 2.1 基准测试中,DeepSeek V4 Flash 仅需对每个任务采样 5 条候选轨迹,利用自身作为验证器(Verifier)筛选最优解(Best-of-5),系统成功率便从 79% 跃升至 88%,超越了闭源前沿模型 Claude Fable 5。
更引人注目的是成本优势:DeepSeek 自验证的单任务成本约为 0.11 美元,而 Fable 5 高达 1.3 美元,前者不足后者的十分之一。尽管有观点质疑多次采样会消耗更多 Token,但得益于开源模型极低的单价,其“单任务总成本”依然具备碾压性优势。
论文一作 Jacky 确认,公布的成本数据已完整覆盖“生成 N 条候选轨迹”与“后续验证”的全流程开销。
核心突破:无需额外训练的通用验证框架
研究团队于今年 7 月发布论文《LLM-as-a-Verifier: A General-Purpose Verification Framework》,其核心在于提出一种无需额外训练奖励模型(Reward Model)或专用验证器,即可直接利用现有 LLM 对 Agent 执行轨迹进行细粒度验证和排序的方法。该方案已在编码、机器人控制及医疗诊断等多个领域得到验证。
此次更新的 v0.2.0 框架新增了对 DeepSeek V4 Flash 的支持及 Terminal-Bench 2.1 基准。其架构巧思在于:验证信号不仅用于测试时扩展,还可服务于进度跟踪和强化学习。针对复杂 Agent 强化学习中缺乏高质量“奖励信号”的痛点,该框架基于概率加权生成的“连续验证分数”,提供了平滑且高密度的奖励信号(Dense Reward)。
在具体终端控制任务中,系统首先由 DeepSeek-V4-Flash 生成 5 条 mini-swe-agent 执行轨迹,随后模型化身“裁判员”为轨迹打分,最终由 LLM-as-a-Verifier 完成细粒度排序并选出最优解。
实验数据显示出显著的性能跃迁:
- 阶梯式涨点:无验证时,模型原生成功率为 78.7%;在 Best-of-3 设定下跃升至 86.5%;当扩大至 Best-of-5 时,成功率进一步推高至 88.0%。
逼近上限的 Oracle 指标:理想选择上限(Oracle)达到 96.6%。综合不同 Agent 配置数据显示,理想选择器下的覆盖率最高可达 98.9%。
这意味着,对于绝大多数复杂任务,正确解题轨迹早已包含在候选池中。大模型并不缺乏生成正确答案的能力,限制系统表现的关键在于缺乏一双能精准识别最优解的“眼睛”。
从“粗糙裁判”到“概率显微镜”
既然候选池中已存在正确轨迹,为何传统的"LLM-as-a-Judge"方案往往失效?核心痛点在于离散评分的颗粒度过粗。
传统评判通常要求模型输出 1 到 5 分的整数。在处理长逻辑代码或复杂操作时,质量存在细微差异的轨迹常被判定为同一分数。实测显示,单次离散评分的平局率高达 26.7%,导致系统无法完成最优筛选。
实验表明,提高评分粒度、增加重复验证和拆分评价标准,均能持续提升验证准确率。这证明验证侧计算能力的提升本身即可成为独立的 Scaling 维度。
LLM-as-a-Verifier 的破局点在于不再依赖干瘪的文本输出,而是深入截获模型输出评价时的底层对数概率分布(logprob)。
核心机制:连续评分
不同于普通 LLM Judge 仅读取最终离散分数,该框架利用不同评分 Token 对应的概率分布计算连续验证分数。即使两条轨迹最终都被判为"4 分”,只要模型对相邻档位的概率分布不同,仍能拉开差距。
验证能力的三维扩展(3D Scaling)
团队将 Verification Compute 沿三个方向扩展:增加评分粒度、对同一轨迹重复评估、将复杂评价拆分为多个标准分别判断。
随着这三个方向上的验证预算增加,验证准确率持续提升,确立了 Verification 作为独立 Scaling 轴的地位。
算法与工程降本:PPT 排序与前缀缓存
随着候选数量增加,全量两两比较的计算复杂度呈爆炸式增长。团队提出 Probabilistic Pivot Tournament(PPT) 算法,避免完整两两比较,以更少的计算量完成排序;工程侧则通过前缀缓存降低长 Agent 轨迹的重复输入成本。
重新审视 Agent 的算力账本
过去的 Test-time Scaling 多关注多采样与多搜索,而 LLM-as-a-Verifier 补上了关键一环:候选生成后,验证本身也值得投入计算。对开发者而言,模型选型应关注单位成功任务的总成本。利用廉价模型多跑几次再通过 Verifier 筛选,可能比直接调用昂贵旗舰模型更具性价比。
这对开源模型意义重大。研究证明,现成 LLM 本身就能承担细粒度验证工作,甚至可同时充当生成者与验证者。Verifier 有望成为 Agent Harness 中的运行时基础能力。

