你的智能体到底需要多少内存?
智能体记忆并非越多越好,而是需要根据模型能力校准剂量。Hugging Face研究显示,强模型适合完整规则集,弱模型适合精简核心加检索,且精选检索可同时提升准确率和降低成本。
原贴
查看原文原文
中文翻译
在我们之前的文章中,我们将ALTK-Evolve与ACE进行了比较,并展示了如何提供智能体自我提炼的指南——每个任务检索少数几条与注入整个集合——会同时影响准确性和成本。这篇文章退一步探讨之前的问题:你应该给它多少?为智能体配备智能体记忆听起来很简单:从过去的工作中提炼经验,放回上下文中,更多的经验应该意味着更好的表现。但事情并不总是如此。当我们将评估扩展到八个模型——从300亿参数的稠密模型到前沿专有系统——一个发现脱颖而出:智能体记忆不是你可以打开的开关。它是一种需要根据模型校准的剂量。智能体记忆不是你可以打开的开关。它是一种需要根据模型校准的剂量。
ALTK-Evolve让智能体从自己的过去轨迹中学习:提炼可复用的指南,并在推理时注入回去,无需更新权重,也无需人工标注。ALTK-Evolve让智能体从自己的过去轨迹中学习:提炼可复用的指南,并在推理时注入回去,无需更新权重,也无需人工标注。
正确的剂量因模型层级而异:有能力的强模型需要完整的指南集,较弱的模型最适合紧凑的核心加上按任务检索,而饱和的模型则没有可衡量的收益。正确的剂量因模型层级而异:有能力的强模型需要完整的指南集,较弱的模型最适合紧凑的核心加上按任务检索,而饱和的模型则没有可衡量的收益。
精选检索可以同时是最准确和最便宜的选择:gpt-oss-120b在仅增加5%令牌的情况下,任务完成率提高了16.1个百分点——提示缓存甚至让完整指南集在生产中保持可负担。精选检索可以同时是最准确和最便宜的选择:gpt-oss-120b在仅增加5%令牌的情况下,任务完成率提高了16.1个百分点——提示缓存甚至让完整指南集在生产中保持可负担。
并非每个模型都能从相同数量的记忆中受益。在跨越能力谱系的八个模型中,我们看到了三种反复出现的模式:有能力的强模型需要完整的指南集——包括罕见的边缘案例经验。它们有能力吸收并应用所有这些。DeepSeek-V3.2(671B MoE)在获得其完整的自我挖掘指南集时,任务完成率提升了9.5个百分点。
核心信息
智能体记忆并非越多越好,而是需要根据模型能力校准剂量。Hugging Face研究显示,强模型适合完整规则集,弱模型适合精简核心加检索,且精选检索可同时提升准确率和降低成本。
- 智能体记忆并非越多越好,而是需要根据模型能力校准剂量。Hugging Face研究显示,强模型适合完整规则集,弱模型适合精简核心加检索,且精选检索可同时提升准确率和降低成本。
- 原贴提到:In our previous post , we compared ALTK-Evolve with ACE and showed that
- 来源:huggingface.co
成为会员查看完整内容
你已经看到了这篇内容的前置整理,剩余深度部分仅对会员开放。