AI觉醒星球
Awakening is here
Knowledge File / 全球热点解读
2026-07-09 5 浏览 公开

面向AI模型双重用途知识的"开关":Anthropic与AE Studio提出GRAM方法

Anthropic与AE Studio联合提出梯度路由辅助模块(GRAM)方法,通过可移除神经元模块控制双重用途知识,训练后删除模块可消除该能力,保留则供可信部署,效果与数据过滤相当且不降低通用性能。

SOURCE / 全球热点解读 MIN / 4 ACCESS / 公开 POST / 2026-07-09 07:27:03

原贴

查看原文
作者:Anthropic:Research(发表成果 · 网页) 来源站点:anthropic.com 原贴时间:

原文

Anthropic与AE Studio联合提出梯度路由辅助模块(GRAM)方法,通过在Transformer每层添加可移除的神经元模块,使模型在训练时将病毒学、网络安全、核物理、专业编程语言等双重用途知识仅路由到对应模块,而非扩散至全局。训练后删除模块即可消除该能力,保留则供可信部署使用。实验在合成数据、真实数据及50M到5B参数模型上测试,GRAM效果与数据过滤相当,移除模块不降低通用性能,且比事后"遗忘"技术更难恢复。该研究为平衡双重用途知识的安全访问与有益使用提供了更鲁棒的方案。 AIHOT 分类:paper

中文翻译

Anthropic与AE Studio联合提出梯度路由辅助模块(GRAM)方法,通过在Transformer每层添加可移除的神经元模块,使模型在训练时将病毒学、网络安全、核物理、专业编程语言等双重用途知识仅路由到对应模块,而非扩散至全局。训练后删除模块即可消除该能力,保留则供可信部署使用。实验在合成数据、真实数据及50M到5B参数模型上测试,GRAM效果与数据过滤相当,移除模块不降低通用性能,且比事后"遗忘"技术更难恢复。该研究为平衡双重用途知识的安全访问与有益使用提供了更鲁棒的方案。

核心信息

Anthropic与AE Studio联合提出梯度路由辅助模块(GRAM)方法,通过可移除神经元模块控制双重用途知识,训练后删除模块可消除该能力,保留则供可信部署,效果与数据过滤相当且不降低通用性能。

  • Anthropic与AE Studio联合提出梯度路由辅助模块(GRAM)方法,通过可移除神经元模块控制双重用途知识,训练后删除模块可消除该能力,保留则供可信部署,效果与数据过滤相当且不降低通用性能。
  • 原贴提到:Anthropic与AE Studio联合提出梯度路由辅助模块(GRAM)方法,通过在Transformer每层添加可移除的神经元模块,使模型在
  • 来源:anthropic.com

详细解读

这是什么信号:Anthropic与AE Studio联合提出的GRAM方法,是AI安全领域针对双重用途知识管控的一项技术突破。它通过在Transformer层中嵌入可移除的神经元模块,实现了对敏感知识的精确路由与隔离,使得模型在通用任务中不暴露这些知识,仅在需要时通过保留模块激活。

为什么重要:当前AI模型在训练过程中可能无意习得病毒学、网络安全等双重用途知识,且难以后期清除。GRAM提供了一种"事前预防"而非"事后补救"的机制,从根本上限制了敏感知识的扩散。其效果与数据过滤相当,但保留程度更高(数据过滤会彻底丢弃样本),且移除模块后能力几乎不可恢复,比现有遗忘技术更可靠。这对AI监管与安全部署具有里程碑意义。

对谁有价值:主要价值对AI开发公司(如Anthropic、OpenAI)、安全研究机构、政策制定者及部署高敏感场景(医疗、军事、金融)的企业。开发团队可借此在训练阶段嵌入安全控制,避免模型被滥用;监管机构可获得可审计的管控手段;终端用户则能获得更安全的AI服务。

可以怎么行动:AI开发团队可尝试将GRAM集成到预训练或微调流程中,优先在网络安全、生物安全等高风险领域试点。安全研究者可对比GRAM与数据过滤、遗忘技术的优劣,并探索模块大小与可移除性的平衡。政策层面,建议将此类可逆模块纳入AI安全标准,要求高风险模型必须内置知识隔离机制。

风险或限制:目前GRAM仅在50M至5B参数模型上验证,更大模型(如百亿参数)的扩展性未知。此外,攻击者可能通过逆向工程定位模块位置并强制激活,或利用模型蒸馏绕过隔离。模块的移除是否影响模型在关联任务(如一般编程)上的表现仍需长期评估。经济成本上,添加模块会增加训练计算量,中小企业可能负担较重。

信息差价值

这条内容的真正价值,不只是“有人发布了一个新功能”,而是它揭示了 anthropic.com 背后的产品方向、工作流变化或竞争信号。对 OPC 来说,这种信息可以转化成持续追踪的栏目选题。

如果把《面向AI模型双重用途知识的"开关":Anthropic与AE Studio提出GRAM方法》放到你的内容系统里,它最大的价值在于帮助读者更快看懂“为什么值得关注”,而不是只看到一条碎片化动态。

参考来源

上一篇 SpaceXAI 发布 Grok 4.5,与Cursor联合训练的编程与智能体模型 下一篇 GitHub 可用性报告:2026 年 6 月