新研究发现:AI 模型写在文字里的推理步骤,对应着不同的内部模式
韩国 KAIST 与 Naver AI Lab 的研究发现,推理模型在文本中展现的不同推理步骤(如提取、分解、公式回忆、演绎、计算),在模型内部数值表征中也能被可靠区分,且信号在中间层最强。这一区分无法用表层用词或解题路径位置解释,阻断前文注意力会削弱信号,解错的题也能识别步骤类型。研究在 Llama-3-8B 上复现,Qwen3-8B 的分类器可迁移到 GPQA-Diamond 与 MATH-500,但实验仅限数学任务和少数模型。
原贴
查看原文原文
中文翻译
语言模型在文本输出中展现出的不同推理步骤,是否也能在它的内部状态中找到?一项新研究对此做了检验。
当一个推理模型一步步解决任务时,它沿途在做不同的事:读取数据、拆解问题、调取公式、执行计算。韩国 KAIST 和 Naver AI Lab 的研究人员想知道,这些推理步骤能否也在模型的数值表征内部被彼此分开。可以,而且信号在中间层最强。
团队定义了八种反复出现的推理操作,包括提取、分解、公式回忆、演绎和计算。他们让三个模型(Qwen2.5-7B、Qwen3-8B 和 Gemma4-31B)解数学题,把解题路径切分成片段,然后用 GPT-5 给每个片段标注其中一种操作。
不同的推理操作在模型的内部表征中可以被可靠地区分开,这一点在所测试的三个模型上都成立。这种区分在中间层达到峰值。
研究人员检查了简单的用词是否就能解释这一效果。一个只看所用 token 的分类器,表现不如一个分析内部表征的分类器。在解题路径中的位置也无法解释它。这意味着内部状态携带了关于推理步骤类型的信息,而这些信息超出了表层用词。
像 “a”、“is” 或 “the” 这样的常见功能词会出现在非常不同的推理步骤中。在早期层,它们的表征仍然混在一起,但到了中间层和更后面的层,它们会依据周围的操作为分开。同一个词会因为属于哪个推理步骤而得到不同的内部表征。
研究人员还测试了一个推理步骤是否会孤立地形成。当他们通过一次有针对性的干预阻断对前 30 个 token 的注意力时,该操作的信号变弱了。推理步骤并非自行出现,而是建立在前文语境之上。
即使在解错的题目上,模型当时正在执行的步骤类型仍然可被识别,无论是计算、调取公式还是演绎。一个有缺陷的计算步骤在内部仍然看起来像一个计算步骤,即使结果是错的。
这种可分离性在额外测试中也成立。它在 Llama-3-8B 上得到复现,而对于 Qwen3-8B,训练出的分类器成功迁移到了 GPQA-Diamond 和 MATH-500。话虽如此,这些实验仅限于数学任务和少数几个模型。这些发现能否被用来捕捉错误,或在模型生成中途对其进行引导,仍是留给未来工作的开放问题。
文本输出与内部计算之间的关系对 AI 安全很重要。据 OpenAI 所说,阅读思维链是少数可用的监督工具之一,但 Anthropic 表明,模型只在 25% 到 39% 的情况下披露了它们所使用的线索。一种把模型内部向量翻译成可读文本的方法显示,Claude Opus 4.6 处理的内容比它输出推理中呈现的更多。而在 OpenAI 的 Astra 模型中,Recurrent Depth 技术把一部分推理转移到内部数值表征中,而这正是 KAIST 这项研究考察的空间。
核心信息
韩国 KAIST 与 Naver AI Lab 的研究发现,推理模型在文本中展现的不同推理步骤(如提取、分解、公式回忆、演绎、计算),在模型内部数值表征中也能被可靠区分,且信号在中间层最强。这一区分无法用表层用词或解题路径位置解释,阻断前文注意力会削弱信号,解错的题也能识别步骤类型。研究在 Llama-3-8B 上复现,Qwen3-8B 的分类器可迁移到 GPQA-Diamond 与 MATH-500,但实验仅限数学任务和少数模型。
- 韩国 KAIST 与 Naver AI Lab 的研究发现,推理模型在文本中展现的不同推理步骤(如提取、分解、公式回忆、演绎、计算),在模型内部数值表征中也能被可靠区分,且信号在中间层最强。这一区分无法用表层用词或解题路径位置解释,阻断前文注意力会削弱信号,解错的题也能识别步骤类型。研究在 Llama-3-8B 上复现,Qwen3-8B 的分类器可迁移到 GPQA-Diamond 与 MATH-500,但实验仅限数学任务和少数模型。
- 原贴提到:Can the distinct reasoning steps a language model shows in its text outp
- 来源:the-decoder.com
详细解读
这是什么信号
KAIST 与 Naver AI Lab 做的不是又一次“思维链看起来很像人”的观察,而是一次表征层面的对照实验:他们先定义八种反复出现的推理操作(提取、分解、公式回忆、演绎、计算等),再让 Qwen2.5-7B、Qwen3-8B、Gemma4-31B 解数学题,把解题路径切片,用 GPT-5 给每段打上操作标签,然后回到模型内部的数值表征里,看这些操作标签能否被稳定地区分出来。
结论有三层,且层层递进。第一,能区分,三个模型都成立,且信号在中间层最强。第二,这种区分不是表层用词造成的——只看 token 的分类器表现更差,解题路径中的位置也解释不了它;连 “a”“is”“the” 这类功能词,在早期层还是混在一起,到中后期层就会按所属操作分开,同一个词因所属步骤不同而获得不同表征。第三,推理步骤不是孤立生成的:定向阻断对前 30 个 token 的注意力后,该操作的信号明显减弱。研究还在 Llama-3-8B 上复现,Qwen3-8B 上训练出的分类器可迁移到 GPQA-Diamond 与 MATH-500。
为什么重要
因为它触及了当前 AI 监督体系里一个真实的漏洞。思维链是少数可用的监督工具之一,但 Anthropic 的数据显示,模型只在 25% 到 39% 的情况下披露了自己实际使用的线索;把内部向量翻译成文本的方法也显示,Claude Opus 4.6 处理的内容多于它输出推理中呈现的部分。也就是说,模型“写出来的推理”和“实际干的事”之间是有缝隙的。
这项研究指向的方向是:在文本之外,内部表征本身可能携带关于“当前在做什么类型的事”的可读信息。另外两个信号与之呼应——OpenAI Astra 模型的 Recurrent Depth 技术把一部分推理挪进了内部数值表征,而这正是 KAIST 研究的考察空间;而即使在解错的题上,计算步骤在内部仍像计算步骤。如果这两件事都成立,过程级监测的对象就不必只限于输出文字。
对谁有价值
一是做可解释性与 AI 安全研究的团队,这类工作给出了一个可复现的实验范式(定义操作标签、切片、分类器验证、注意力阻断做因果检验)。二是做推理模型与 agent 产品的工程团队,若未来能在生成中途判断“模型现在是在调公式还是在算数”,干预点就不再只有重试和终止。三是做模型评测的团队,过程级评测(每一步做对了什么)比只看最终答案更能区分失败模式。四是对合规、审计和红队工作关心“模型披露是否可信”的人。
可以怎么行动
短期最可行的动作,是把“步骤分类器”当作评测与调试工具来验证:在自己的模型上复现八类操作的标注流程,看中间层表征能否支撑一个稳定分类器;用注意力阻断这类定向干预做因果验证,而不是只做相关性观察;把错题按步骤类型归类,区分“公式记错”和“计算算错”这两类本质不同的失败。
同时,把“思维链不可完全信任”写进你们的评测假设里:不要因为模型给出了看似合理的推理链,就默认它披露了真实依据。对供应商的能力宣称,也应要求对方区分“输出层行为”和“内部表征证据”。
风险与限制
这项研究自身的边界很明确:只覆盖数学任务,只覆盖少数几个模型,标签来自 GPT-5 的自动化标注。它证明了内部表征与推理步骤类型相关,但没有证明这套方法能直接用于纠错或引导生成,作者也把这一点留作开放问题。不要把相关性当因果,更不要据此宣称“思维链已经被破解”或“可以实时监控模型在想什么”。
谨慎的读法是:这是一个方法论上的进展,说明内部表征值得被当作一类观测面来研究,而不是一个可以直接产品化的监控方案。
信息差价值
这条内容的真正价值,不只是“有人发布了一个新功能”,而是它揭示了 the-decoder.com 背后的产品方向、工作流变化或竞争信号。对 OPC 来说,这种信息可以转化成持续追踪的栏目选题。
如果把《新研究发现:AI 模型写在文字里的推理步骤,对应着不同的内部模式》放到你的内容系统里,它最大的价值在于帮助读者更快看懂“为什么值得关注”,而不是只看到一条碎片化动态。
参考来源
TOPIC HUBS
延伸专题
AI SUMMARY
这篇文章回答了什么
新研究发现:AI 模型写在文字里的推理步骤,对应着不同的内部模式主要讲什么?
韩国 KAIST 与 Naver AI Lab 的研究发现,推理模型在文本中展现的不同推理步骤(如提取、分解、公式回忆、演绎、计算),在模型内部数值表征中也能被可靠区分,且信号在中间层最强。这一区分无法用表层用词或解题路径位置解释,阻断前文注意力会削弱信号,解错的题也能识别步骤类型。研究在 Llama-3-8B 上复现,Qwen3-8B 的分类器可迁移到…
这篇文章最值得关注的要点是什么?
韩国 KAIST 与 Naver AI Lab 的研究发现,推理模型在文本中展现的不同推理步骤(如提取、分解、公式回忆、演绎、计算),在模型内部数值表征中也能被可靠区分,且信号在中间层最强。这一区分无法用表层用词或解题路径位置解释,阻断前…;原贴提到:Can the distinct reasoning steps a language model shows in its text outp;来源:the-decoder.com
这篇文章和哪些AI专题相关?
它适合放在AI日报、AI工具、Agent工作流专题里阅读。 关联原因:这篇内容命中「热点解读」等主题信号。;这篇内容命中「模型」等主题信号。;这篇内容来自该专题长期覆盖的栏目。
阅读这篇文章建议先理解哪些关键词?
建议先理解AI日报、每日AI日报、AI信号、热点解读、BuilderPulse这些关键词,再结合正文判断工具、机会或风险是否值得进入自己的工作流。