一种常见的多智能体配置是 planner、solver、verifier 各司其职,工具全开,对所有请求套用同一套结构。查一个报表数值与核对一整本预算表,走的是同一条流程。Google 与亚利桑那州立大学提出的 SHIFT 针对这一做法给出替代方案,即按查询动态构建 harness,简单任务仅保留单个 reader,复杂任务再引入验证回路与 Python 执行。
一、问题与动机
论文将智能体系统的角色、指令、工具与通信结构统称为 harness。其难点在于,一种设计的优劣只能通过实际执行观测,而执行本身产生成本。若为每个查询评估多种候选结构,开销将成倍放大。
Figure 1 展示了这一差异。左侧的固定 harness 以同一 Reader 与 Solver 处理三道任务,简单查询尚可,但列合计计算得到 190、增长率计算得到 10%,两处均错误。右侧 SHIFT 按查询构建结构,简单查询仅用一个 reader,合计任务配置验证回路,增长率任务配置带 Python 的验证器,三道均正确。
二、方法
SHIFT 的核心是一个轻量本地模型,作者称为 architect,基于 Gemma 骨干,接两个输出头。policy 头预测下一步的构建动作,value 头对尚未执行的结构直接估计效用,该效用同时权衡准确率与执行成本。
红框标注两处关键结构,左侧为 policy 与 value 两个头,右侧为 Execute,仅被选中的结构会真正调用执行器。搜索阶段采用蒙特卡洛树搜索,依据架构师的预测组合角色、指令与工具,全程不调用执行器。构建过程在单块 H100 上耗时不足一秒,相对通常持续数十秒至数分钟的执行,额外开销可忽略。训练阶段才实际执行,policy 从搜索访问计数中学习,value 从执行结果中学习,奖励为任务成功减去 token、延迟、超时以及新增工具与智能体的惩罚。该训练成本一次性投入,并在后续查询上摊薄。
三、关键前提,不存在通用 harness
该工作的一个重要论据是,统一配置在多数场景下并不划算。
Figure 3 给出增加结构带来的效用变化,红框标注的两行形成对照。上方算术任务 GSM8K 将智能体数量从 1 增至 4 以上,准确率无提升,token 消耗增至约 19 倍,效用为负。下方财务文档任务 OfficeQA 同样增加结构,准确率提升约 50 个百分点,效用显著为正。同一动作在不同任务上分别表现为浪费与刚需,构成逐查询构建的直接动机。
四、实验结果
实验覆盖六个基准、九千一百九十三个任务,统一采用 Gemini 3.5 Flash 作为执行器,与十七个基线对比。SHIFT-search 平均准确率 79.9%,较最强基线 Trace 高 7.2 个百分点,配对自助法 95% 置信区间为 4.42% 至 9.88%。增益集中于两个长程、工具密集型基准,OfficeQA 上所有基线均低于 30%,SHIFT-search 达 59.3%,GAIA 上达 68.6%,较 Trace 分别高 30 与 15 个百分点。在算术与多跳问答等短程任务上,单个 agent 已接近上限,瓶颈位于模型而非结构,SHIFT-search 与领先方法基本持平。
SHIFT-value 为低成本档位,依据预测效用选择结构,平均准确率 74.5%,仍高于全部基线,执行 token 较最强基线减少 32%。同一架构师可同时提供最准确与最经济的两档配置,按预算选择。
五、消融与分析
消融实验进一步验证了若干设计选择。限制动作空间后,仅允许加工具或仅允许改指令,准确率均下降,联合选择较单一维度最多高 9.1 个百分点。搜索与贪心逐步构建的平均准确率基本一致,79.9 对 79.8,但执行 token 减少约三成。仅做一步前瞻的价值贪心成本最低,准确率却降至 60.2,原因在于无法为需要后续步骤才显现收益的智能体计分。价值头的选择能力也经过单独验证,在同一候选池中选取预测效用最高者,HotpotQA 上达 49.6,随机选择仅 39.1。迁移方面,以 GSM8K 训练的架构师不重训直接用于更难的 MATH-500,结合学习到的 policy 与 value 时表现最好。
六、结论与局限
SHIFT 将多智能体系统的构建从依赖经验与试错,推进到可学习、可预测的框架。它以冻结骨干、仅训练 LoRA 的轻量 Gemma 作为架构师,把设计成本从每次推理转移到一次性训练并摊薄,不依赖更大的执行器,在六个基准上同时取得最高平均准确率与显著更低的成本档位,可直接用于智能体产品。
其边界同样明确。方法节省的是执行器调用成本,架构师训练与搜索开销单独计,仅通过摊薄消化。在执行器能力较强、结构对成败影响较小的短程任务上,优势收窄,作者亦指出此类任务的瓶颈位于模型。结构选择依赖预测模型的效用估计,预测精度是关键,当前结果显示其在留出候选中能稳定选出更优结构。方法能否推广到更开放的真实工作流,仍取决于后续复现与生产环境验证。
论文信息
标题 Dynamic Harness Search: Building Multi-Agent Systems Per-Query via Prediction
作者 Som Sagar, Shasha Li, Hejie Cui, Ransalu Senanayake, Sercan Ö. Arık
机构 Google, Arizona State University
PDF https://arxiv.org/pdf/2610.04137

