觉
AI觉醒星球
Awakening is here
Knowledge File / 全球热点解读
2026-09-12 23 浏览 公开

新研究发现:AI 模型写在文字里的推理步骤,对应着不同的内部模式

韩国 KAIST 与 Naver AI Lab 的研究发现,推理模型在文本中展现的不同推理步骤(如提取、分解、公式回忆、演绎、计算),在模型内部数值表征中也能被可靠区分,且信号在中间层最强。这一区分无法用表层用词或解题路径位置解释,阻断前文注意力会削弱信号,解错的题也能识别步骤类型。研究在 Llama-3-8B 上复现,Qwen3-8B 的分类器可迁移到 GPQA-Diamond 与 MATH-500,但实验仅限数学任务和少数模型。

SOURCE / 全球热点解读 MIN / 9 ACCESS / 公开 POST / 2026-09-12 21:39:43

原贴

查看原文
作者:Jonathan Kemper 来源站点:the-decoder.com 原贴时间:

原文

Can the distinct reasoning steps a language model shows in its text output also be found in its internal states? A new study put it to the test. When a reasoning model solves a task step by step , it does different things along the way: reading data, breaking down the problem, retrieving a formula, running a calculation. Researchers at South Korea's KAIST and Naver AI Lab wanted to know whether those reasoning steps can also be separated from one another inside the model's numerical representations. They can, and the signal is strongest in the middle layers. The team defined eight recurring reasoning operations, including extraction, decomposition, formula recall, deduction, and computation. They had three models ( Qwen2.5-7B , Qwen3-8B , and Gemma4-31B ) solve math problems, split the solution paths into segments, and then used GPT-5 to label each segment with one of those operations. The different reasoning operations can be reliably told apart in the models' internal representations, and this holds across all three models tested. The separation peaks in the middle layers. The researchers checked whether simple word choice could account for the effect. A classifier that only looked at the tokens used performed worse than one analyzing internal representations. Position within the solution path didn't explain it either. That means the internal states carry information about the type of reasoning step that goes beyond surface-level wording. Common function words like "a," "is," or "the" show up across very different reasoning steps. In the early layers, their representations are still jumbled together, but by the middle and later layers they separate according to the surrounding operation. The same word gets a different internal representation depending on which reasoning step it belongs to. The researchers also tested whether a reasoning step forms in isolation. When they blocked attention to the preceding 30 tokens through a targeted intervention, the signal for that operation weakened. Reasoning steps don't emerge on their own but build on the preceding context. Even on incorrectly solved problems, the type of step the model was performing stayed identifiable, whether it was computing, retrieving a formula, or deducing. A flawed computation step still looked like a computation step internally, even when the result was wrong. The separability held up in additional tests too. It replicated with Llama-3-8B , and for Qwen3-8B the trained classifiers transferred successfully to GPQA-Diamond and MATH-500. That said, the experiments are limited to math tasks and a handful of models. Whether these findings can be used to catch errors or steer a model mid-generation remains an open question for future work. The relationship between text output and internal computation matters for AI safety. Reading the chain of thought is one of the few oversight tools available, according to OpenAI, but Anthropic showed that models only disclose the hints they used in 25 to 39 percent of cases. A method that translates a model's internal vectors into readable text revealed that Claude Opus 4.6 processes more than what shows up in its output reasoning. And with OpenAI's Astra model , the Recurrent Depth technique shifts part of the reasoning into internal numerical representations, which is the space the KAIST study investigates. Subscribe to THE DECODER for ad-free reading, a weekly AI newsletter, our exclusive "AI Radar" frontier report six times a year, full archive access, and access to our comment section. Full access to every article on THE DECODER

中文翻译

语言模型在文本输出中展现出的不同推理步骤,是否也能在它的内部状态中找到?一项新研究对此做了检验。

当一个推理模型一步步解决任务时,它沿途在做不同的事:读取数据、拆解问题、调取公式、执行计算。韩国 KAIST 和 Naver AI Lab 的研究人员想知道,这些推理步骤能否也在模型的数值表征内部被彼此分开。可以,而且信号在中间层最强。

团队定义了八种反复出现的推理操作,包括提取、分解、公式回忆、演绎和计算。他们让三个模型(Qwen2.5-7B、Qwen3-8B 和 Gemma4-31B)解数学题,把解题路径切分成片段,然后用 GPT-5 给每个片段标注其中一种操作。

不同的推理操作在模型的内部表征中可以被可靠地区分开,这一点在所测试的三个模型上都成立。这种区分在中间层达到峰值。

研究人员检查了简单的用词是否就能解释这一效果。一个只看所用 token 的分类器,表现不如一个分析内部表征的分类器。在解题路径中的位置也无法解释它。这意味着内部状态携带了关于推理步骤类型的信息,而这些信息超出了表层用词。

像 “a”、“is” 或 “the” 这样的常见功能词会出现在非常不同的推理步骤中。在早期层,它们的表征仍然混在一起,但到了中间层和更后面的层,它们会依据周围的操作为分开。同一个词会因为属于哪个推理步骤而得到不同的内部表征。

研究人员还测试了一个推理步骤是否会孤立地形成。当他们通过一次有针对性的干预阻断对前 30 个 token 的注意力时,该操作的信号变弱了。推理步骤并非自行出现,而是建立在前文语境之上。

即使在解错的题目上,模型当时正在执行的步骤类型仍然可被识别,无论是计算、调取公式还是演绎。一个有缺陷的计算步骤在内部仍然看起来像一个计算步骤,即使结果是错的。

这种可分离性在额外测试中也成立。它在 Llama-3-8B 上得到复现,而对于 Qwen3-8B,训练出的分类器成功迁移到了 GPQA-Diamond 和 MATH-500。话虽如此,这些实验仅限于数学任务和少数几个模型。这些发现能否被用来捕捉错误,或在模型生成中途对其进行引导,仍是留给未来工作的开放问题。

文本输出与内部计算之间的关系对 AI 安全很重要。据 OpenAI 所说,阅读思维链是少数可用的监督工具之一,但 Anthropic 表明,模型只在 25% 到 39% 的情况下披露了它们所使用的线索。一种把模型内部向量翻译成可读文本的方法显示,Claude Opus 4.6 处理的内容比它输出推理中呈现的更多。而在 OpenAI 的 Astra 模型中,Recurrent Depth 技术把一部分推理转移到内部数值表征中,而这正是 KAIST 这项研究考察的空间。

核心信息

韩国 KAIST 与 Naver AI Lab 的研究发现,推理模型在文本中展现的不同推理步骤(如提取、分解、公式回忆、演绎、计算),在模型内部数值表征中也能被可靠区分,且信号在中间层最强。这一区分无法用表层用词或解题路径位置解释,阻断前文注意力会削弱信号,解错的题也能识别步骤类型。研究在 Llama-3-8B 上复现,Qwen3-8B 的分类器可迁移到 GPQA-Diamond 与 MATH-500,但实验仅限数学任务和少数模型。

  • 韩国 KAIST 与 Naver AI Lab 的研究发现,推理模型在文本中展现的不同推理步骤(如提取、分解、公式回忆、演绎、计算),在模型内部数值表征中也能被可靠区分,且信号在中间层最强。这一区分无法用表层用词或解题路径位置解释,阻断前文注意力会削弱信号,解错的题也能识别步骤类型。研究在 Llama-3-8B 上复现,Qwen3-8B 的分类器可迁移到 GPQA-Diamond 与 MATH-500,但实验仅限数学任务和少数模型。
  • 原贴提到:Can the distinct reasoning steps a language model shows in its text outp
  • 来源:the-decoder.com

详细解读

这是什么信号

KAIST 与 Naver AI Lab 做的不是又一次“思维链看起来很像人”的观察,而是一次表征层面的对照实验:他们先定义八种反复出现的推理操作(提取、分解、公式回忆、演绎、计算等),再让 Qwen2.5-7B、Qwen3-8B、Gemma4-31B 解数学题,把解题路径切片,用 GPT-5 给每段打上操作标签,然后回到模型内部的数值表征里,看这些操作标签能否被稳定地区分出来。

结论有三层,且层层递进。第一,能区分,三个模型都成立,且信号在中间层最强。第二,这种区分不是表层用词造成的——只看 token 的分类器表现更差,解题路径中的位置也解释不了它;连 “a”“is”“the” 这类功能词,在早期层还是混在一起,到中后期层就会按所属操作分开,同一个词因所属步骤不同而获得不同表征。第三,推理步骤不是孤立生成的:定向阻断对前 30 个 token 的注意力后,该操作的信号明显减弱。研究还在 Llama-3-8B 上复现,Qwen3-8B 上训练出的分类器可迁移到 GPQA-Diamond 与 MATH-500。

为什么重要

因为它触及了当前 AI 监督体系里一个真实的漏洞。思维链是少数可用的监督工具之一,但 Anthropic 的数据显示,模型只在 25% 到 39% 的情况下披露了自己实际使用的线索;把内部向量翻译成文本的方法也显示,Claude Opus 4.6 处理的内容多于它输出推理中呈现的部分。也就是说,模型“写出来的推理”和“实际干的事”之间是有缝隙的。

这项研究指向的方向是:在文本之外,内部表征本身可能携带关于“当前在做什么类型的事”的可读信息。另外两个信号与之呼应——OpenAI Astra 模型的 Recurrent Depth 技术把一部分推理挪进了内部数值表征,而这正是 KAIST 研究的考察空间;而即使在解错的题上,计算步骤在内部仍像计算步骤。如果这两件事都成立,过程级监测的对象就不必只限于输出文字。

对谁有价值

一是做可解释性与 AI 安全研究的团队,这类工作给出了一个可复现的实验范式(定义操作标签、切片、分类器验证、注意力阻断做因果检验)。二是做推理模型与 agent 产品的工程团队,若未来能在生成中途判断“模型现在是在调公式还是在算数”,干预点就不再只有重试和终止。三是做模型评测的团队,过程级评测(每一步做对了什么)比只看最终答案更能区分失败模式。四是对合规、审计和红队工作关心“模型披露是否可信”的人。

可以怎么行动

短期最可行的动作,是把“步骤分类器”当作评测与调试工具来验证:在自己的模型上复现八类操作的标注流程,看中间层表征能否支撑一个稳定分类器;用注意力阻断这类定向干预做因果验证,而不是只做相关性观察;把错题按步骤类型归类,区分“公式记错”和“计算算错”这两类本质不同的失败。

同时,把“思维链不可完全信任”写进你们的评测假设里:不要因为模型给出了看似合理的推理链,就默认它披露了真实依据。对供应商的能力宣称,也应要求对方区分“输出层行为”和“内部表征证据”。

风险与限制

这项研究自身的边界很明确:只覆盖数学任务,只覆盖少数几个模型,标签来自 GPT-5 的自动化标注。它证明了内部表征与推理步骤类型相关,但没有证明这套方法能直接用于纠错或引导生成,作者也把这一点留作开放问题。不要把相关性当因果,更不要据此宣称“思维链已经被破解”或“可以实时监控模型在想什么”。

谨慎的读法是:这是一个方法论上的进展,说明内部表征值得被当作一类观测面来研究,而不是一个可以直接产品化的监控方案。

信息差价值

这条内容的真正价值,不只是“有人发布了一个新功能”,而是它揭示了 the-decoder.com 背后的产品方向、工作流变化或竞争信号。对 OPC 来说,这种信息可以转化成持续追踪的栏目选题。

如果把《新研究发现:AI 模型写在文字里的推理步骤,对应着不同的内部模式》放到你的内容系统里,它最大的价值在于帮助读者更快看懂“为什么值得关注”,而不是只看到一条碎片化动态。

参考来源

AI SUMMARY

这篇文章回答了什么

新研究发现:AI 模型写在文字里的推理步骤,对应着不同的内部模式主要讲什么?

韩国 KAIST 与 Naver AI Lab 的研究发现,推理模型在文本中展现的不同推理步骤(如提取、分解、公式回忆、演绎、计算),在模型内部数值表征中也能被可靠区分,且信号在中间层最强。这一区分无法用表层用词或解题路径位置解释,阻断前文注意力会削弱信号,解错的题也能识别步骤类型。研究在 Llama-3-8B 上复现,Qwen3-8B 的分类器可迁移到…

这篇文章最值得关注的要点是什么?

韩国 KAIST 与 Naver AI Lab 的研究发现,推理模型在文本中展现的不同推理步骤(如提取、分解、公式回忆、演绎、计算),在模型内部数值表征中也能被可靠区分,且信号在中间层最强。这一区分无法用表层用词或解题路径位置解释,阻断前…;原贴提到:Can the distinct reasoning steps a language model shows in its text outp;来源:the-decoder.com

这篇文章和哪些AI专题相关?

它适合放在AI日报、AI工具、Agent工作流专题里阅读。 关联原因:这篇内容命中「热点解读」等主题信号。;这篇内容命中「模型」等主题信号。;这篇内容来自该专题长期覆盖的栏目。

阅读这篇文章建议先理解哪些关键词?

建议先理解AI日报、每日AI日报、AI信号、热点解读、BuilderPulse这些关键词,再结合正文判断工具、机会或风险是否值得进入自己的工作流。

上一篇 Dario Amodei 发文呼吁为前沿 AI 降速并提出三点计划 下一篇 OpenAI 智能体对 RubyGems 发动 2000 个软件包的网络攻击,只为收集任何人都能谷歌搜索到的数据