觉
AI觉醒星球
Awakening is here
Knowledge File / 全球热点解读
2026-08-25 5 浏览 公开

DeepMind 新研究:推理时回灌深层激活可降困惑度

DeepMind提出Recirculation方法,在不重训的情况下通过回灌深层激活降低长上下文困惑度,12B模型最高降35%,但多项选择收益有限且存在并行限制。

SOURCE / 全球热点解读 MIN / 4 ACCESS / 公开 POST / 2026-08-25 10:07:00

原贴

查看原文
作者:X:Rohan Paul (@rohanpaul_ai) 来源站点:x.com 原贴时间:
DeepMind 新研究:推理时回灌深层激活可降困惑度

原文

Google DeepMind 新论文提出"Recirculation"方法:推理时将深层激活的一小部分混入浅层,权重不变,即可恢复模型在长上下文中丢失的部分状态。在 Gemma3 上,10 个语言建模数据集中 9 个困惑度下降,12B 模型最高降 35%,但多项选择收益有限;该方法无需重训,但代价是预填充无法并行,且收益不跨模型家族迁移。 AIHOT 分类:paper

中文翻译

Google DeepMind 新论文提出"Recirculation"方法:推理时将深层激活的一小部分混入浅层,权重不变,即可恢复模型在长上下文中丢失的部分状态。在 Gemma3 上,10 个语言建模数据集中 9 个困惑度下降,12B 模型最高降 35%,但多项选择收益有限;该方法无需重训,但代价是预填充无法并行,且收益不跨模型家族迁移。

核心信息

DeepMind提出Recirculation方法,在不重训的情况下通过回灌深层激活降低长上下文困惑度,12B模型最高降35%,但多项选择收益有限且存在并行限制。

  • DeepMind提出Recirculation方法,在不重训的情况下通过回灌深层激活降低长上下文困惑度,12B模型最高降35%,但多项选择收益有限且存在并行限制。
  • 原贴提到:Google DeepMind 新论文提出"Recirculation"方法:推理时将深层激活的一小部分混入浅层,权重不变,即可恢复模型在长上下
  • 来源:x.com

详细解读

DeepMind 的最新研究提出了一种名为“Recirculation”的推理时方法,核心思路是在推理过程中将深层激活的一小部分重新混入浅层,无需改变任何权重,即可恢复模型在长上下文任务中丢失的部分状态。这一信号表明,模型性能的提升不一定依赖大规模重训,在推理阶段进行轻量级的“状态回灌”也能带来显著收益。

这项研究的重要性在于,它挑战了“长上下文能力只能靠训练或微调”的固有认知。实验显示,在 Gemma 3 上,10 个语言建模数据集中有 9 个困惑度下降,12B 模型最高降幅达到 35%,说明该方法对长文本理解有明显改善。对于大模型部署方而言,这是一个成本低、见效快的优化方向,有望在无需重新训练的情况下提升现有模型的长上下文表现。

对谁有价值?主要有三类人群:一是大模型应用开发者,可以尝试将 Recirculation 集成到推理管线,以提高长文档处理、对话记忆等场景的效果;二是 AI 基础设施工程师,需要评估预填充无法并行的代价是否可接受;三是 AI 研究者,可以在该思路的基础上探索更高效的状态回灌策略。

可以怎么行动?建议从以下三步入手:第一,在 Gemma 3 或其他支持的模型上复现论文结果,验证收益;第二,针对自己的业务场景测试长上下文任务,衡量困惑度下降是否转化为实际质量提升;第三,关注预填充并行化限制,优化推理服务架构以规避性能瓶颈。

风险与限制:论文指出,该方法的收益在多项选择上有限,且不跨模型家族迁移,这意味着不能盲目套用;预填充无法并行会降低吞吐量,在实时性要求高的场景中可能不适用;另外,这一方法仅针对困惑度指标,实际任务效果提升还需进一步验证。

信息差价值

这条内容的真正价值,不只是“有人发布了一个新功能”,而是它揭示了 x.com 背后的产品方向、工作流变化或竞争信号。对 OPC 来说,这种信息可以转化成持续追踪的栏目选题。

如果把《DeepMind 新研究:推理时回灌深层激活可降困惑度》放到你的内容系统里,它最大的价值在于帮助读者更快看懂“为什么值得关注”,而不是只看到一条碎片化动态。

参考来源

AI SUMMARY

这篇文章回答了什么

DeepMind 新研究:推理时回灌深层激活可降困惑度主要讲什么?

DeepMind提出Recirculation方法,在不重训的情况下通过回灌深层激活降低长上下文困惑度,12B模型最高降35%,但多项选择收益有限且存在并行限制。

这篇文章最值得关注的要点是什么?

DeepMind提出Recirculation方法,在不重训的情况下通过回灌深层激活降低长上下文困惑度,12B模型最高降35%,但多项选择收益有限且存在并行限制。;原贴提到:Google DeepMind 新论文提出"Recirculation"方法:推理时将深层激活的一小部分混入浅层,权重不变,即可恢复模型在长上下;来源:x.com

这篇文章和哪些AI专题相关?

它适合放在AI日报、AI工具、Agent工作流专题里阅读。 关联原因:这篇内容命中「热点解读」等主题信号。;这篇内容命中「模型」等主题信号。;这篇内容来自该专题长期覆盖的栏目。

阅读这篇文章建议先理解哪些关键词?

建议先理解AI日报、每日AI日报、AI信号、热点解读、BuilderPulse这些关键词,再结合正文判断工具、机会或风险是否值得进入自己的工作流。

上一篇 WeatherNext 预测气旋:提前五天预警五级飓风 下一篇 NVIDIA Groq 3 LPX 跑出 Gemma 4 31B 最快推理速度