觉
AI觉醒星球
Awakening is here
Knowledge File / AI小生意项目库
2026-10-04 1 浏览 免费阅读

谷歌研究人员找到防止自我改进AI智能体死记测试的方法

Google Cloud AI Research与多所大学提出RRSI,通过约束递归自我改进流程,防止AI代理在测试任务上过拟合,同时在未见基准上提升表现并控制计算成本。

SOURCE / AI小生意项目库 MIN / 9 ACCESS / 免费阅读 POST / 2026-10-04 20:40:37

原贴

查看原文
作者:Jonathan Kemper 来源站点:the-decoder.com 原贴时间:

原文

AI agents that keep optimizing their own working environment quickly tend to overspecialize on their test tasks. A new method from Google Cloud AI Research and several universities aims to prevent that while also cutting compute costs. Modern AI agents wrap a fixed language model in a so-called harness , a framework of prompts, workflows, tools, memory, and logic that controls what the model sees at each step. The harness decides whether an agent reads the right file before changing it, whether it recovers from a mistake, and whether it delivers its results cleanly. According to a new research paper, much of the recent progress in agents comes from work on the harness, not from new models. Until recently, this was done by hand. People reviewed failed runs and patched the harness manually. Newer methods automate the loop by having a language model rewrite the harness itself, again and again, based on feedback from the test tasks. The researchers call this a practical form of recursive self-improvement. The system produces feedback that it uses to optimize the harness, which in turn controls the system's own behavior. The paper shows that this self-optimization comes with a catch. Because the agent keeps working on the same limited set of test tasks, it ends up memorizing them. Its scores on the training tasks go up, while gains on new, unseen tasks shrink or disappear entirely. The researchers say this happens in several ways. The search memorizes patterns that only fit one particular benchmark, favors candidates that score well purely by chance, and piles on unnecessary complexity that raises the test score without making the agent any better. Other methods mostly improve on the training tasks, but little of that carries over to unseen benchmarks. RRSI raises scores there in all three domains. | Image: Google RRSI (Regularized Recursive Self-Improvement of Agent Harnesses) works on both ends of the optimization loop while leaving the harness fully editable. When the system proposes new changes, a budget caps how many independent edits a candidate can bundle at once. That budget shrinks over time. Early rounds allow larger rewrites, while later rounds only permit small changes that can be clearly traced to a result. The system also keeps track of earlier attempts so it doesn't keep chasing the same failed ideas. When progress stalls, it deliberately experiments with parts of the harness it hasn't touched yet. RRSI reins in self-optimization at two points, when proposing new changes and when deciding which of them become a permanent part of the harness. | Image: Google When it comes to picking changes, a critic reviews every proposal and throws out any that hardcode task names, solutions, or other benchmark-specific tricks. Another rule only accepts higher compute costs if they come with a measurable performance gain. Components that no longer help get removed.

中文翻译

持续优化自身工作环境的AI代理,很快就会过度专门化于它们的测试任务。来自Google Cloud AI Research和几所大学的一种新方法,旨在防止这种情况,同时降低计算成本。

现代AI代理把固定的语言模型包裹在所谓的harness中,这是一个由提示、工作流、工具、记忆和逻辑组成的框架,控制模型在每一步看到什么。harness决定代理在修改文件前是否读取了正确的文件,是否能从错误中恢复,以及是否能干净地交付结果。根据一篇新研究论文,近来代理的许多进展来自对harness的工作,而不是来自新模型。

直到最近,这还是手工完成的。人们审查失败的运行,并手动修补harness。较新的方法通过让一个语言模型根据测试任务的反馈,反复重写harness本身,来自动化这一循环。研究人员称这是一种实用形式的递归自我改进。系统产生反馈,用它来优化harness,而harness反过来控制系统自身的行为。

论文表明,这种自我优化有一个陷阱。因为代理持续在同样有限的一组测试任务上工作,它最终会记住它们。它在训练任务上的分数上升,而在新的、未见过的任务上的收益缩小或完全消失。研究人员说,这以几种方式发生。搜索会记住只适合某一特定基准的模式,偏向纯粹靠运气得分高的候选者,并堆叠不必要的复杂性,提高测试分数却没有让代理变得更好。其他方法大多在训练任务上改进,但其中很少能迁移到未见过的基准。RRSI在三个领域的未见基准上都提高了分数。

| 图片:Google

RRSI(Agent Harnesses的正则化递归自我改进)在优化循环的两端起作用,同时让harness完全可编辑。当系统提出新变更时,一个预算限制一个候选者一次可以捆绑多少独立编辑。该预算随着时间缩小。早期轮次允许更大的重写,而后期轮次只允许能够清楚追溯到结果的小改动。系统还跟踪早先的尝试,以免不断追逐同样的失败想法。当进展停滞时,它会故意试验harness中尚未触及的部分。RRSI在两个点上约束自我优化:提出新变更时,以及决定哪些变更成为harness永久部分时。

| 图片:Google

在选择变更时,一个批评者审查每个提案,并丢弃任何硬编码任务名称、解决方案或其他基准特定技巧的内容。另一条规则只接受更高的计算成本,如果它们带来可测量的性能提升。不再有帮助的组件会被移除。

核心信息

Google Cloud AI Research与多所大学提出RRSI,通过约束递归自我改进流程,防止AI代理在测试任务上过拟合,同时在未见基准上提升表现并控制计算成本。

  • Google Cloud AI Research与多所大学提出RRSI,通过约束递归自我改进流程,防止AI代理在测试任务上过拟合,同时在未见基准上提升表现并控制计算成本。
  • 原贴提到:AI agents that keep optimizing their own working environment quickly ten
  • 来源:the-decoder.com

详细解读

这是什么信号

公开信号指向一个正在成形的技术拐点:AI代理的进步越来越依赖harness(提示、工作流、工具、记忆与逻辑组成的执行框架),而不是只靠替换更强的基础模型。Google Cloud AI Research与多所大学的新论文指出,当系统用语言模型反复重写harness、根据测试任务反馈做递归自我改进时,代理会迅速过拟合测试任务:训练任务分数上升,但新任务上的收益缩小甚至消失。

论文提出的RRSI试图在自我优化循环的两端加约束:提出变更时限制候选者一次捆绑的独立编辑数量,并让预算随时间递减;选择变更时由critic过滤硬编码任务名、答案或基准特定技巧,同时要求更高计算成本必须带来可测量的性能提升,并移除不再有用的组件。系统还记录过往尝试,避免重复追逐失败想法,并在进展停滞时主动探索尚未触及的harness部分。

为什么重要

这意味着“让代理自己优化自己”不是免费的。缺少约束时,递归自我改进可能把工程努力变成基准记忆:分数好看,但真实任务迁移能力下降,计算成本还可能上升。对依赖代理落地的团队来说,评估体系会被误导,产品在演示中表现好、上线后失效的风险会增加。

同时,这条信号把harness工程推到台前。既然大量代理能力来自harness,而不是模型本身,那么提示、工具调用、记忆、错误恢复和交付逻辑就是可积累、可优化、也可被自我改进循环侵蚀的核心资产。谁能把harness的优化做得既激进又不过拟合,谁就更容易获得可迁移的代理能力。

对谁有价值

直接相关的是AI Agent开发者、平台工程团队、评测与基准团队、AI产品负责人,以及做代理基础设施和工作流工具的创业者。对投资与战略团队也有参考意义:它提示agent赛道的竞争点不只在模型层,还在harness工程、评测防泄漏和成本-性能治理。

可以怎么行动

第一,审查现有自我优化循环是否在测试集上反复调参,是否出现硬编码任务名、答案或只对特定基准有效的技巧。第二,引入递减的变更预算:早期允许较大改写,后期只接受能追溯到明确结果的小改动。第三,建立critic规则,过滤基准特定技巧,并要求更高计算成本必须对应可测量收益。第四,记录失败尝试,避免重复搜索;当进展停滞时,定向探索尚未改动的harness部分。第五,把最终评估放到未见过的任务上,并清理不再有帮助的组件。

风险或限制

论文在三个领域显示RRSI提升了未见基准上的分数,但这不意味着它已解决全部泛化问题。约束过强可能抑制有价值的大改写;critic可能漏掉更隐蔽的基准泄漏;记录尝试、运行critic和额外评测也会带来工程与计算开销。更广泛地看,基准污染和评估集泄漏仍是代理自我改进中的长期风险,RRSI提供的是治理思路,不是万能保证。

信息差价值

这条内容的真正价值,不只是“有人发布了一个新功能”,而是它揭示了 the-decoder.com 背后的产品方向、工作流变化或竞争信号。对 OPC 来说,这种信息可以转化成持续追踪的栏目选题。

如果把《谷歌研究人员找到防止自我改进AI智能体死记测试的方法》放到你的内容系统里,它最大的价值在于帮助读者更快看懂“为什么值得关注”,而不是只看到一条碎片化动态。

参考来源

AI SUMMARY

这篇文章回答了什么

谷歌研究人员找到防止自我改进AI智能体死记测试的方法主要讲什么?

Google Cloud AI Research与多所大学提出RRSI,通过约束递归自我改进流程,防止AI代理在测试任务上过拟合,同时在未见基准上提升表现并控制计算成本。

这篇文章最值得关注的要点是什么?

Google Cloud AI Research与多所大学提出RRSI,通过约束递归自我改进流程,防止AI代理在测试任务上过拟合,同时在未见基准上提升表现并控制计算成本。;原贴提到:AI agents that keep optimizing their own working environment quickly ten;来源:the-decoder.com

这篇文章和哪些AI专题相关?

它适合放在Agent工作流、AI副业专题里阅读。 关联原因:这篇内容命中「Agent、智能体」等主题信号。;这篇内容命中「项目、小生意、变现」等主题信号。

阅读这篇文章建议先理解哪些关键词?

建议先理解工具、自动化、模型、Cursor、Agent这些关键词,再结合正文判断工具、机会或风险是否值得进入自己的工作流。

上一篇 “超级智能”与非约束性安全协议能解决AI的形象问题吗? 下一篇 美财长贝森特批评 Anthropic、OpenAI 等风险警告:危言耸听、光喊话不拿解决方案