大数跨境

大模型工具调用新范式!谷歌ToolGrad 反向生成高质量数据集

大模型工具调用新范式!谷歌ToolGrad 反向生成高质量数据集 苏哲管理咨询
2026-10-02
16
导读:ToolGrad 是面向大模型工具调用场景的数据集生成新范式,先构造可成功执行的工具调用链,再反向生成用户提问,区别于传统 “先写用户 query,再搜索工具方案” 的旧方法。传统方案容易出现标注失败
编者摘要:ToolGrad 是面向大模型工具调用场景的数据集生成新范式,先构造可成功执行的工具调用链,再反向生成用户提问,区别于传统 “先写用户 query,再搜索工具方案” 的旧方法。传统方案容易出现标注失败、通过率低的问题;ToolGrad 通过增量链式拼接 API,逐步验证工具执行链路,产出高通过率的工具使用样本。 其核心流程包含 API 提议器、API 执行器、API 选择器、反向优化器四大模块:分批选取 API、并行执行、依据执行报告筛选可用工具,最后反向优化得到用户查询与应答。对比传统 ML、TextGrad,ToolGrad 的优化目标是工具调用数据集,以 API 执行评估结果作为 “梯度信号”,增量组装验证后的 API 工作流。 在 BFCL 评测中,1B/4B/12B 的 Gemma-3 模型经过 ToolGrad 优化后,分数大幅提升,12B 模型达到 83.1,追平商用大模型。和基线 ToolBench(DFS)对比,通过率从 63.8% 提升至 99.8%,优化步骤减少、LLM 调用成本略有下降,同时单样本真实工具调用次数更高,数据集质量更强。

10 个关键问题Q&A

Q1:ToolGrad 最核心创新是什么? A:改变传统 “先用户提问,再找工具” 的思路,先构建能成功跑完的 API 工具链,再反向生成用户查询,从源头提升数据集标注通过率。
Q2:传统工具数据集方法为什么通过率低? A:先生成用户问题,再搜索匹配工具调用方案,容易出现工具调用逻辑错误、执行失败,产生大量标注失败样本。
Q3:ToolGrad 的 “梯度” 是什么? A:不是数值梯度,是基于 API 执行报告得到的 LLM 选择信号,用来挑选有效的 API,组装工作流。
Q4:ToolGrad 四大模块分别做什么? A:API 提议器产出候选 API;API 执行器并行执行 API 并输出执行报告;API 选择器筛选有效 API;反向优化器更新用户查询与完整工作流。
Q5:ToolGrad 与 TextGrad 的区别? A:TextGrad 目标优化提示词 Prompt;ToolGrad 目标直接生成高质量工具调用数据集,优化对象不同。
Q6:在 BFCL 评测上 ToolGrad 效果如何? A:Gemma-3 1B/4B/12B 模型都有大幅提升,12B 模型得分 83.1,性能比肩 Gemini、GPT、Claude 等闭源商用大模型。
Q7:ToolGrad 对比 ToolBench (DFS) 基线有哪些提升? A:标注通过率由 63.8% 提升至 99.8%;单样本真实工具调用次数更多;优化迭代步数从 34.3 降到 20.0,LLM 推理成本小幅下降。
Q8:ToolGrad 的增量链式组装 API 是什么意思? A:一小批一小批逐步添加、验证 API,每加入一个 API 都验证执行结果,逐步构建完整、可成功运行的工具调用链路。
Q9:ToolGrad 生成数据集有什么特点? A:样本工具调用链路更长更复杂,标注通过率极高,适合微调大模型的工具调用能力。
Q10:ToolGrad 的局限有没有提及? A:原文未重点阐述局限;核心代价是需要多次执行 API 来获取执行报告,依赖 API 执行环境来反馈成败信号。
附录 ToolGrad:基于文本 “梯度” 高效生成工具调用数据集

发布时间:2026 年 9 月 10 日 作者:周忠义(研究科学家)、杜若飞(谷歌 XR 交互感知与图形学负责人)

ToolGrad 是一套数据集生成框架,颠覆了传统范式:先产出工具调用的答案,再生成用户提问。研究表明,该设计能够让大语言模型获得更强的工具调用能力。

AI 智能体在现实任务自动化方面展现出巨大潜力,例如执行谷歌搜索、读取本地电脑文件、运行编写的 Python 脚本。想要实现这类智能体工作流,大语言模型必须学会正确、高效地调用工具。要训练大模型掌握工具使用能力,就需要工具调用链路数据集以及对应的用户查询。在我们之前的研究(InstructPipe:基于人工指令与大模型生成可视化流水线模块)中,评估数据依靠人工标注,但如果要支撑大模型微调工作,人工标注很难规模化落地。

为简化数据生产流程,已有研究(arXiv:2307.16789、arXiv:2409.00920)尝试用智能体反复试错,自动寻找工具调用路径。这类主流标注方法分为两步:(1)从 API 池中采样,生成假设性用户指令;(2)使用深度优先搜索(DFS)智能体寻找对应的工具调用解法。该方法本质上效率低下:它的核心思路是从智能体复杂探索轨迹里提炼有效样本,用于训练大模型。

在论文《ToolGrad》(发表于 ACL 2026 Findings,论文链接:https://aclanthology.org/2026.findings-acl.950/,开源代码:https://github.com/zhongyi-zhou/toolgrad)中,我们提出了一套全新方案:先构建真实可信的工具调用链路,再标注对应的用户提示词。直观来看,明确的工具调用解法比用户提问包含更清晰无歧义的信息,因此从工具使用链路反向生成用户查询,只需要单次大模型推理,标注难度大幅降低。

实验结果证明:这种先答案、后提问的方案,能够以更低成本生成更复杂的长时序工具调用数据。使用该数据集训练后的大模型,性能优于基线方法训练的模型;在分布外(OOD)测试集(包含模型从未见过的工具)上,性能甚至可以比肩顶尖闭源大模型。

传统方法是先写用户查询,再搜索对应的解决方案,数据生成通过率很低;而 ToolGrad 先产出可行的工具调用链路,再生成提示词,因此拥有很高的样本通过率。

基于文本 “梯度” 迭代生成工具调用链路

标准机器学习系统会计算小批量训练样本上的数值损失梯度,再通过优化算法更新模型权重。近期一项研究(arXiv:2406.07496)把这套思路迁移到提示工程:使用大模型评审器给出自然语言形式的详细反馈,这类反馈被称为文本梯度(textual gradients)。文本梯度会指导原始提示词迭代优化,生成新版本,更好完成目标任务。

ToolGrad 将文本梯度的概念,从提示词优化拓展到合成数据集生成。它不再优化静态文本提示词,而是借助文本梯度,从庞大工具库中迭代构建复杂且合法的 API 工作流。

ToolGrad 的优化组件对比传统机器学习、TextGrad

ToolGrad 框架

ToolGrad 包含四个核心模块,按顺序完成提案、执行、筛选、更新:

  1. API 提案器(API Proposer)
    每一轮迭代中,从采样得到的 API 集合筛选少量有潜力的候选接口,用来扩展当前工作流。
  2. API 执行器(API Executors)
    并行测试选中的 API,生成详细执行报告。
  3. API 筛选器(API Selector)
    审阅执行报告,挑选效果最优的一次 API 调用;这一步相当于文本梯度,提供改进方向,将选中调用追加到工作流中。
  4. 大模型更新器(LLM Updater)
    修改合成用户提问与 AI 回复,使之匹配新增的 API 调用。

重复上述迭代流程,最终得到一条完整样本:用户查询、经过验证的 API 调用工作流、AI 最终回复。

ToolGrad 先产出可行的工具调用链路,再生成提示词,样本通过率很高。

实验

数据生成效率评估

我们首先评估数据生成的成本与质量。实验采用 arXiv:2307.16789 中的 API 库,包含 16000 + 真实世界 API,用来构建工具调用数据集。我们对比 ToolBench 上传统先查询方案(深度优先搜索 DFS)与本文先答案方案 ToolGrad。实验结果表明:ToolGrad 可以用更低生成成本,产出更复杂的工具调用数据,并且样本通过率更高。

基线(先查询)方案与本文(先答案)方案的数据生成效率对比

伯克利函数调用排行榜

我们基于 ToolBench API 库,构建小规模数据集 ToolGrad-500。使用该数据集对 Gemma-3 系列模型(1B、4B、12B)做微调,得到 ToolGrad-1B、ToolGrad-4B、ToolGrad-12B。我们在伯克利函数调用排行榜(gorilla.cs.berkeley.edu)上评估模型工具调用能力,该评测集所用工具集与 ToolBench 完全不同。

对比对象包含:

  1. 未微调的原始基座模型;
  2. 顶尖闭源大模型(Gemini、GPT、Claude);
  3. 前沿工具调用专用开源模型(arXiv:2409.00920、arXiv:2410.04587v2)。

核心结论:

  • 相比基线持续提升
    在 ToolGrad-500 数据集上做后训练,Gemma-3 在全部参数量规格下,工具调用能力都获得显著提升。
  • 性能超越部分闭源模型
    ToolGrad-12B 取得 83.1 分,性能极具竞争力,接近同期业界顶尖闭源模型:Gemini-2.5-Pro(83.2)、Claude-4.5 Opus(82.8),并且优于 GPT-5(74.4)。
  • 自进化特性
    ToolGrad-500 数据集由 Gemini-2.5-Flash-Lite 生成。有意思的是,用该数据集微调后的 Gemma-3-12B,性能超过了生成数据集的 “教师模型”。
  • 领先其他开源模型
    ToolGrad-12B 显著优于其他开源工具调用专用模型,包括在更完善 API 库上微调的 ToolACE。

BFCL 评测结果:Gemma-3、ToolGrad 系列、Gemini 2.5、GPT-5、Claude-4.5、ToolACE、Hammer-2.1-7B

结论与未来方向

ToolGrad 证明:借助先答案范式,可以更高效、可靠地构建高质量工具调用数据集。这套智能体框架利用文本梯度迭代串联 API 调用,解决了真实标注数据生产中长期存在的成本与规模化瓶颈。该方案实现接近 100% 的数据生成通过率;体量相对较小的模型也能取得出色效果;并且验证了学生大模型可以超越生成训练数据的教师模型。

未来研究方向:扩展框架,适配规模更大、动态变化更强的 API 生态,落地更多真实场景;进一步研究自进化能力,实现持续在线学习,逐步完成模型个性化。随着智能体工作流越来越多地嵌入企业与日常任务,ToolGrad 这类框架为训练高性能、可低成本规模化部署的数字智能体打下重要基础。

致谢

本研究主要由周忠义在谷歌担任访问研究员期间完成。感谢核心贡献者 Kohei Uehara、张浩宇、周静涛、顾琳、徐征、原田达也的支持;感谢 Adarsh Kowdle、Shahram Izadi 提供战略指导与宝贵评审意见。

【声明】内容源于网络
0
0
苏哲管理咨询
为企业及组织提供AI+战略、数智化转型咨询及观点、建议等
内容 2265
粉丝 0
苏哲管理咨询 为企业及组织提供AI+战略、数智化转型咨询及观点、建议等
总阅读53.8k
粉丝0
内容2.3k