第 2026-09-12 期 · 行业追踪 · 研究 · 安全

模型内部显现可区分的推理步骤

模型内部显现可区分的推理步骤

一项新研究发现,模型在内部状态中以可区分的模式表达不同写出式推理步骤(如计算、公式检索和演绎),这些模式在中间层尤为明显。此结果提示模型在内部处理的信息超出可见的“思路链”,对可解释性与安全评估有重要影响。

The Decoder5 天前
查看原文 ↗