Anthropic 可解释性突破:Claude 内部存在"全局工作空间"式思维
Anthropic 可解释性团队 7 月 6 日发布研究《A global workspace in language models》:Claude 内部浮现一个"心智工作空间",持有不出现在输出中的内部思考;为理解 LLM 推理机制提供新证据。
2026 年 7 月 6 日,Anthropic 可解释性(Interpretability)团队发布研究《A global workspace in language models》,给出了一个颇为颠覆性的发现:Claude 内部浮现出一个"心智工作空间(mental workspace)",其中持有不出现在模型输出中的内部思考。
这项研究发现了什么
通俗地说,研究者发现 Claude 在生成回答的过程中,内部并非简单"一输入、一输出",而是存在一个独立于最终输出的"工作空间",模型会在这里进行不直接呈现给用户的内部思考。这一发现为理解大语言模型的推理机制提供了新的证据——模型并不是在"背诵答案",而是在一个内部空间中"运算"后给出结论。
对可解释性研究而言,这意义重大:如果模型的"思考过程"可以被定位、被读取,那么对齐(alignment)、安全审计与错误诊断就有了新的抓手——不再只能看输出,还能看"过程"。
一年来的可解释性研究密集输出
把这项研究放回 Anthropic 2026 年的研究时间线,可见其持续投入:
| 日期 | 研究 | |
版权声明:本文内容来自
Anthropic 官方研究
。本平台对该内容进行了编译和整理,仅用于信息传播和学习交流之用。如有侵权,请联系我们进行处理。
用户评价