觉
AI觉醒星球
Awakening is here
Knowledge File / AI小生意项目库
2026-09-11 2 浏览 免费阅读

ToolGrad:用文本“梯度”高效生成工具使用数据集

Google XR 团队在 ACL 2026 提出 ToolGrad,把传统“先生成用户问题、再用 DFS 智能体试错找解”的标注流程反转过来:首先生成正确的工具调用链,再反向标注用户指令,并用“文本梯度”式的提案—执行—选择—更新四模块迭代扩展工作流。结果是更低成本、更复杂的长链路工具使用数据,训练出的模型优于 ToolBench、ToolACE 等基线,并在未见工具的分布外数据集上追平 SoTA 闭源模型。

SOURCE / AI小生意项目库 MIN / 9 ACCESS / 免费阅读 POST / 2026-09-11 06:50:22

原贴

查看原文
作者:Google Research Blog 来源站点:research.google 原贴时间:

原文

Zhongyi Zhou, Research Scientist, and Ruofei Du, Interactive Perception & Graphics Lead, Google XR ToolGrad is a data generation framework that reverses the traditional paradigm by first generating tool-use answers before user queries. We show this design enables LLMs to achieve better tool-use performance. AI agents have shown great potential in automating real-world tasks, such as conducting a Google Search, reading local computer files, or executing generated Python scripts. To achieve such agentic workflows, LLMs need to learn how to use tools correctly and efficiently. To teach large language models tool uses, we need datasets of tool-use chains and their corresponding user queries. In our prior work introduced in InstructPipe , we manually annotated our evaluation data, but it is impractical to scale up the human annotation for advanced LLM fine-tuning workstreams. To streamline the data workstream, prior work, e.g., ToolBench and ToolACE , explored using an agent to automatically search a tool-use path with trial and error. This representative annotation approach involves two steps: (1) generate a hypothetical user instruction from a sampled API pool, and (2) use a depth-first search (DFS) agent to find its tool-use solution. This approach is inherently inefficient because its core concept is to distill valuable trajectories from a complex agent exploration for training an LLM. In “ ToolGrad: Efficient Tool-use Dataset Generation with Textual ‘Gradients ’”, presented at ACL 2026 , we introduce an alternative solution paradigm. ToolGrad first generates a ground-truth tool-use chain and then annotates its corresponding user prompt. Intuitively, an explicit tool-use solution provides more unambiguous information than a prompt, making the annotation, from tool usage to the use query, much easier and requiring only one LLM step. Our result shows that our answer-first approach can generate more complex (long-horizon) tool-use data with lower cost. LLMs trained on our generated data also outperform those trained on baseline methods, and even match SoTA proprietary LLMs on out-of-distribution (OOD) datasets with unseen tools. While prior art generates tool-use datasets by searching solutions of user queries with low pass rate, ToolGrad generates successful tool-use chains before generating prompts, yielding high pass rate. Standard machine learning (ML) systems improve by computing numerical loss gradients across mini-batches of training samples, which are then used by an optimization algorithm to update model weights. Recently, TextGrad adapted this paradigm for prompt engineering using an LLM critic to provide rich, descriptive feedback in plain text — feedback called “textual gradients”. These textual gradients then guide the refinements of a given prompt into a new draft that can better resolve the target task. ToolGrad adapts the concept of textual gradients from prompt optimization to synthetic dataset generation. Rather than optimizing a static text prompt, ToolGrad uses these gradients to iteratively construct complex, valid API workflows from large tool libraries. Comparing the optimization components of ToolGrad to traditional ML and TextGrad. ToolGrad features four core modules that sequentially propose, execute, select, and update. API Proposer: In each iteration, this module narrows down a sampled set of APIs into a few promising candidates to extend the current workflow. API Executors: These test the selected APIs in parallel and generate detailed execution reports. API Selector: This module reviews the execution reports and selects the single best-performing API call — acting as a textual gradient that provides directional feedback for improvement — and appends it to the workflow.

中文翻译

ToolGrad 是一个数据生成框架,它反转了传统范式,先生成工具使用答案,再生成用户查询。我们表明,这种设计使大语言模型能够取得更好的工具使用表现。

AI 智能体在自动化现实世界任务方面展现出巨大潜力,例如执行 Google 搜索、读取本地计算机文件或执行生成的 Python 脚本。要实现这类智能体工作流,大语言模型需要学会正确且高效地使用工具。为了教会大语言模型使用工具,我们需要工具使用链及其对应用户查询的数据集。在我们此前发表于 InstructPipe 的工作中,我们手动标注了评估数据,但将人工标注扩展到用于高级大语言模型微调的工作流并不现实。

为简化数据工作流,此前的工作,例如 ToolBench 和 ToolACE,探索使用一个智能体通过试错自动搜索工具使用路径。这种代表性标注方法包括两个步骤:(1)从采样的 API 池生成一个假想的用户指令,(2)使用深度优先搜索(DFS)智能体找到其工具使用解决方案。这种方法本质上效率低下,因为其核心概念是从复杂的智能体探索中提炼有价值的轨迹,以用于训练大语言模型。

在发表于 ACL 2026 的“ToolGrad: Efficient Tool-use Dataset Generation with Textual ‘Gradients’”中,我们引入了一种替代的解决范式。ToolGrad 首先生成基准真值的工具使用链,然后标注其对应的用户提示。直观上,明确的工具使用解决方案比提示提供更无歧义的信息,使得从工具使用到用户查询的标注容易得多,并且只需要一步大语言模型调用。我们的结果表明,我们这种答案优先的方法能够以更低成本生成更复杂(长时程)的工具使用数据。使用我们生成的数据训练的大语言模型也优于那些使用基线方法训练的模型,甚至在具有未见工具的分布外(OOD)数据集上可与 SoTA 专有 LLM 相匹敌。

此前的方法通过搜索用户查询的解决方案来生成工具使用数据集,通过率低;而 ToolGrad 在生成提示之前先生成成功的工具使用链,从而获得高通过率。

标准的机器学习(ML)系统通过在小批量训练样本上计算数值损失梯度来改进,这些梯度随后被优化算法用于更新模型权重。最近,TextGrad 用大语言模型评审员以纯文本提供丰富的描述性反馈,从而将这一范式适配到提示工程中——这种反馈被称为“文本梯度”。这些文本梯度随后引导给定提示被改进为新的草稿,从而更好地解决目标任务。

ToolGrad 将文本梯度的概念从提示优化适配到合成数据集生成。ToolGrad 不是优化一段静态文本提示,而是使用这些梯度从庞大的工具库中迭代构建复杂、有效的 API 工作流。

对比 ToolGrad 与传统 ML 和 TextGrad 的优化组件。ToolGrad 具有四个顺序执行的核心模块:提案、执行、选择、更新。API Proposer:在每次迭代中,该模块将一组采样得到的 API 缩小为少数几个有前景的候选,用于扩展当前工作流。API Executors:它们并行测试所选 API 并生成详细的执行报告。API Selector:该模块审阅执行报告,并选出单个表现最好的 API 调用——它充当提供方向性改进反馈的文本梯度——并将其追加到工作流中。

核心信息

Google XR 团队在 ACL 2026 提出 ToolGrad,把传统“先生成用户问题、再用 DFS 智能体试错找解”的标注流程反转过来:首先生成正确的工具调用链,再反向标注用户指令,并用“文本梯度”式的提案—执行—选择—更新四模块迭代扩展工作流。结果是更低成本、更复杂的长链路工具使用数据,训练出的模型优于 ToolBench、ToolACE 等基线,并在未见工具的分布外数据集上追平 SoTA 闭源模型。

  • Google XR 团队在 ACL 2026 提出 ToolGrad,把传统“先生成用户问题、再用 DFS 智能体试错找解”的标注流程反转过来:首先生成正确的工具调用链,再反向标注用户指令,并用“文本梯度”式的提案—执行—选择—更新四模块迭代扩展工作流。结果是更低成本、更复杂的长链路工具使用数据,训练出的模型优于 ToolBench、ToolACE 等基线,并在未见工具的分布外数据集上追平 SoTA 闭源模型。
  • 原贴提到:Zhongyi Zhou, Research Scientist, and Ruofei Du, Interactive Perception
  • 来源:research.google

详细解读

这不是又一篇“让 Agent 更聪明”的模型论文,而是一篇关于“Agent 训练数据怎么造才划算”的工程论文。Google XR 团队(Zhongyi Zhou、Ruofei Du)在 ACL 2026 提出的 ToolGrad,把工具调用数据的标注方向整个翻了过来:旧做法是先假想一个用户问题,再用深度优先搜索智能体去试错找一个能跑通的工具链,通过率低、成本高;ToolGrad 反过来,先生成一条确定可行的工具调用链,再让模型补一个能对应这条链的用户指令。

为什么重要

工具调用能力的数据瓶颈,从来不是模型不够强,而是“高质量轨迹”太贵。人工标注不可扩展,DFS 搜索式合成又是在大量失败探索里捞少量成功轨迹,本质上是拿算力换数据,规模一大就不划算。ToolGrad 的判断是:一条明确的工具链本身就携带比一句模糊用户问题更无歧义的信息,所以“从工具使用反推用户查询”这一步只需要一次 LLM 调用,长链路数据的生成成本随之下降,而数据复杂度反而更高。对正在做 Agent 微调、合成数据流水线的团队来说,这是一个可以直接替换掉现有数据生产环节的范式选项。

方法上的关键设计

ToolGrad 借用了 TextGrad 提出的“文本梯度”概念,但用途从“优化一段提示词”变成了“从大工具库里逐步搭出一条有效的 API 工作流”。它的四个模块形成闭环:API Proposer 每轮从采样到的 API 中筛出少量有前景的候选;API Executors 并行试跑并产出执行报告;API Selector 审阅报告、挑出表现最好的那一次调用,这次选择本身就是带方向性的文本梯度;随后被追加进工作流,进入下一轮。相比一次性搜索,这是一种“逐步爬坡、每步有反馈”的构造方式。

对谁有价值

三类人最直接受益。第一类是做 Agent 产品或平台的人,需要大量带工具调用链的训练/评测数据,但又没有预算雇人标注。第二类是负责模型微调与数据合成的工程师,ToolGrad 提供的是一条成本更低、可控性更强的数据管线思路。第三类是做工具生态、API 平台的人——论文提到模型在“未见工具”的 OOD 数据集上仍能追平 SoTA 闭源模型,这意味着数据构造方式本身可能比工具覆盖广度更能决定泛化能力。

可以怎么行动

如果你的团队正在自建工具调用数据,最值得先试的一件事,是把流水线的顺序倒过来:先定义一条合法且可执行的工具链(或在沙箱里跑通),再让模型生成与之匹配的用户意图,而不是先写意图再搜解法。第二件事是把“选择哪一步最好”显式建模成一个独立模块,让每次迭代都产出可读的文本反馈,而不是只丢一个通过/失败信号。第三件事是准备一个可并行执行、能产出结构化报告的沙箱环境——ToolGrad 的效率高度依赖执行报告的质量,没有可靠执行层,这个方法退化成普通的提示迭代。

风险与限制

第一,这条路线强依赖执行环境:工具要能被真实调用、能返回可判读的结果,否则“执行报告 → 文本梯度”的链路断掉,这在中国境内很多封闭 API 场景下是现实约束。第二,文本梯度本质上是 LLM 评审员的判断,评审质量直接决定数据质量,存在系统性偏差被批量放大的风险。第三,先有答案再补问题,天然可能产出“技术可行但用户根本不会这么问”的伪需求数据,需要额外做指令自然度与分布校验。第四,论文给出的是相对基线和 OOD 基准上的结果,具体到自家工具集与业务场景的收益,仍要用小规模 A/B 验证,不能直接照搬。

信息差价值

这条内容的真正价值,不只是“有人发布了一个新功能”,而是它揭示了 research.google 背后的产品方向、工作流变化或竞争信号。对 OPC 来说,这种信息可以转化成持续追踪的栏目选题。

如果把《ToolGrad:用文本“梯度”高效生成工具使用数据集》放到你的内容系统里,它最大的价值在于帮助读者更快看懂“为什么值得关注”,而不是只看到一条碎片化动态。

参考来源

AI SUMMARY

这篇文章回答了什么

ToolGrad:用文本“梯度”高效生成工具使用数据集主要讲什么?

Google XR 团队在 ACL 2026 提出 ToolGrad,把传统“先生成用户问题、再用 DFS 智能体试错找解”的标注流程反转过来:首先生成正确的工具调用链,再反向标注用户指令,并用“文本梯度”式的提案—执行—选择—更新四模块迭代扩展工作流。结果是更低成本、更复杂的长链路工具使用数据,训练出的模型优于 ToolBench、ToolACE 等基线…

这篇文章最值得关注的要点是什么?

Google XR 团队在 ACL 2026 提出 ToolGrad,把传统“先生成用户问题、再用 DFS 智能体试错找解”的标注流程反转过来:首先生成正确的工具调用链,再反向标注用户指令,并用“文本梯度”式的提案—执行—选择—更新四模块…;原贴提到:Zhongyi Zhou, Research Scientist, and Ruofei Du, Interactive Perception;来源:research.google

这篇文章和哪些AI专题相关?

它适合放在Agent工作流、AI副业、AI工具专题里阅读。 关联原因:这篇内容命中「Agent、智能体、工作流」等主题信号。;这篇内容命中「项目、小生意、变现」等主题信号。;这篇内容命中「工具、自动化、模型」等主题信号。

阅读这篇文章建议先理解哪些关键词?

建议先理解AI工具、工具、自动化、模型、Cursor这些关键词,再结合正文判断工具、机会或风险是否值得进入自己的工作流。

上一篇 OpenAI 展示 GPT-Live-1:餐厅预订通话可以被打断、补充和改口 下一篇 Anthropic 报告指控阿里、月之暗面与 DeepSeek 对 Claude 发起蒸馏攻击