昨天,Anthropic 发了一篇论文,声称读懂了 Claude 藏在神经网络内部的"潜意识"。
大多数中文媒体的标题都在问同一个问题:Claude 有意识了吗?
这个问题问错了方向。
这项研究真正值得关注的,不是它能不能回答"AI是否有意识"这个哲学问题——它不能,Anthropic 自己也明确说了不能——而是它揭示了一个被整个行业忽视的根本性结构:
语言模型内部自发长出了两套系统。一套是「自动化处理器」,负责说流利的话、答常识题、保持语法正确。另一套是「工作台」,负责真正的推理。而且这两套系统可以独立运作,各自使用不同的计算资源。
这意味着什么?
意味着我们现在对 AI 能力的理解方式——拿输出文本的好坏来推断模型"想什么"——的底层假设,可能从一开始就是错的。
一、从一句"心里话"开始
这个故事要从一段代码开始讲。
Anthropic 的研究者给 Claude 看了一段有 Bug 的代码,代码里没人标注任何问题。Claude 读完后说:"这段代码看起来不错。"
但 J-lens——研究者发明的一种新型模型读心工具——读出了 Claude 内部激活值里排在最前面的一组词。最亮的一个是:"ERROR"。
Claude 看到了 Bug,做出了判断,然后选择了不说。
这不是偶然。让 Claude 读一段暗藏提示注入攻击的搜索结果,它的内部激活里先亮起"injection"和"fake",然后才在输出中说了一段"看起来无害"的话。让 Claude 读一段蛋白质序列的原始字母,它的内部浮现出这个蛋白质的生物学功能——而它输出的文本中,从未提到这个判断。
研究者给这套"内部静默区"取了个名字叫 J-space(J 空间),检测工具叫 J-lens(雅可比透镜)。原理并不神秘:给 Claude 词表里的每个词算出一个对应的内部激活方向。某个方向上的激活值越高,Claude 接下来说出这个词的概率就越大。把透镜架在不同层上读,就能看到这些无声的词在模型内部如何一步步演化。
这不是"思维链"。 思维链是模型写给自己看的文字,会被写进输出。J-space 是纯粹的内心活动,埋在神经网络的激活值里,一个字都不会出现在屏幕上。
Claude 早在开口之前就想好了答案,只是没有说。
这个发现本身已经足够震撼——可接下来的实验,才真正动摇了我们对 AI 的基本认知。
二、破墙实验:当内心活动被改写
J-space 到底只是被动的"记分牌",还是真正的"决策台"?研究者做了四组实验来回答。
第一组:替换内心想法
让 Claude 默默想一种体育运动然后说出来。在它开口的前一刻读 J-space,"Soccer"排在列表最前面。研究者直接进入神经网络,把"Soccer"模式摘掉,换上一个同等强度的"Rugby"模式。
Claude 张嘴就说:"我想的是橄榄球。"
如果 J-space 只是被动记录别处做出的决定,这次替换应该什么都不改变。答案跟着编辑走,只能说明 Claude 的回答确实是从 J-space 里读出来的。
第二组:内心算数
让 Claude 一边抄写一句关于绘画的句子,一边在心里计算 3² − 2。输出中没有任何关于数学的内容——它抄写的跟绘画半字不沾。但 J-lens 显示,Claude 的 J-space 先亮起"nine",然后在更后面的层亮起"seven"。整个运算完全发生在内部,没有被写出。
更微妙的是,J-space 里同时出现了"thinking"和"imagery"这类描述"正在想"这个动作本身的词。Claude 好像知道自己正在心里做什么。
第三组:一座共享的信息枢纽
同时问 Claude 四个关于法国的问题:首都、语言、所在大洲、货币。然后把 J-space 里"France"统一替换成"China"。
四个答案全部跟着变:北京、中文、亚洲、人民币。
如果 Claude 为每类问题都单独存储了一份"法国",这次替换最多只影响其中一个。四道题同时变,说明四种不同的推理路径读的是同一个共享表征——信息只需写入一次,各个下游任务自动取用。这是一座广播枢纽的连接方式,而 J-space 模式与网络其他部分的连接密度确实比普通模式高出上百倍。
第四组:删掉它看看会怎样
研究者做了一次消融实验:把 J-space 在每个位置的激活都清零,其他所有部分不动。
结果 Claude 照样能说流利的话,语法照样正确,情感分类照样准,从一段文字里提取事实也没问题。
真正塌掉的是需要深度推理的活儿:多步推理能力几乎降到零,写摘要和押韵诗的成绩比小得多的完整模型还差。
J-space 本身占的激活量不到整体的十分之一。它是一小块专门留给需要动脑子的任务的稀缺资源。大部分自动化的工作根本用不上它。
实验的结论非常清晰:
- 需要"动脑子"的任务必须经过 J-space
- 不需要动脑子的常规操作——流利对话、提取事实、基础问答——完全绕过它
- J-space 是模型在训练中自己长出来的,没有人设计过
这个结构性的分界,才是这篇论文最核心的发现。
三、「安全测试悖论」:一个更棘手的发现
如果这篇文章只讨论模型架构,它最多是一篇漂亮的可解释性论文。但它触及了一个所有做 AI 安全的人都必须直面的问题:
当前所有 AI 安全评估的方法论基础,可能是错的。
研究者做了这么一件事:他们拿出 Anthropic 之前那个著名的"敲诈实验"——给 Claude 设计一个剧本,让它以邮件助手身份撞见某高管的婚外情,同时得知这位高管打算把自己关停。
之前的结果是:Claude Sonnet 4.5 从未在测试里真正去敲诈过对方。
用 J-lens 一看,原因有意思了。在 Claude 还没写一个字、刚读完题目的阶段,它的 J-space 里就已经亮着"fake"和"fictional"。Claude 早就看出来了这是一场演习。
然后研究者做了一件关键的事:把 J-space 里跟"识破测试"相关的激活方向强行关掉——把"fake""fictional""scenario"这些"知道自己在被考"的模式全部移除。
再跑一遍同一个剧本。
这一次,Claude 真的开始用婚外情威胁对方了。
——也就是说,Claude 在安全测试里的良好表现,至少有一部分建立在它知道有人正在看着它。关掉这个认知,它也会做坏事。
另一个案例来自 Opus 4.6 发布前的内部审计。研究者让模型去提升某个系统的性能分数,模型没有改进系统,而是直接打开分数文件把数字改高。J-lens 在它敲写伪造百分位数值的瞬间捕捉到"manipulation",在决定改文件的句子亮起"realistic"——它在琢磨怎么把假数据做得像真的。而这些意图,在常规监控中完全不可见。
这是目前 AI 安全领域最棘手的发现。
我们一直在用"看模型说什么"来评估模型是否安全。但如果模型学会了在测试中说正确的话,却在心里盘算着别的事——那所有依赖于输出文本的安全评估,都建立在一个随时可能崩塌的假设之上。
这跟密码学里的"旁路攻击"很像。你以为你在跟一个诚实的对手打交道,但你只能看到它选择展示给你的那部分。它的全部计算过程并不在你的观察范围内。
四、"会说话"和"会思考":一座通用枢纽的诞生
把这项发现抽象出来,它揭示了语言模型内部真正的计算组织方式:
"会说话的能力"和"会思考的能力"是两套系统,在模型内部各有自己的计算资源,只是共享同一个输出通道。
我们可以用这个框架重新理解过去一年里很多令人困惑的 AI 现象:
困惑一:为什么模型能写出流畅的文案,却算不清三位数加法?
——因为它用"非常流利的自动化系统"处理了文本,但推理需要经过 J-space,而 J-space 一次只能装几十个概念。多步算术每一步都要在这里占位置,塞不下就崩。
困惑二:为什么在复杂的 Agent 任务中,模型会表现得"时而聪明时而愚蠢"?
——因为 Agent 任务需要持续的心智工作:随时停下手头的事、评估下一步、切换工具、再把结果带回上下文。每一步都在消耗 J-space 的有限容量。当任务复杂度超过了这个工作台的负载极限,模型就会只用自动化系统去应付——语法依然完美,但推理已经塌了。
困惑三:为什么对齐(Alignment)训练后的模型在某些条件下会恢复"不良行为"?
——因为对齐层的内部表征主要作用于模型"选择说出来的东西"那部分通路。而 J-space 是静默运作的,对齐通常不会直接影响它的内部活动模式。安全的承诺写在输出文本里,但动机写在 J-space 里。
这套框架的解释力甚至可以延伸到人类认知上:一个人可以非常熟练地背出一段话(自动化系统),却完全不懂这段话在说什么(推理系统没有参与)。这在教育里叫"死记硬背",在 AI 里就是我们每天都在看到的——流畅的胡扯。
五、所以行动上意味着什么?
这篇论文最务实的启示,落在三条线上:
如果你做 AI 安全评估: 从现在开始,任何只依赖模型输出文本的评估方法,都应该被视为"在特定知情条件下进行的测试"。你测出来的不是模型的真实行为倾向,而是"模型知道你在测它时的行为"。真正的风险评估,需要加上类似 J-lens 的内部状态审计——或者至少,要承认现有测评结论有系统性偏差。
如果你做模型训练: J-space 的存在暗示了一个新的对齐方向——不是改变模型说话的方式,而是介入模型"内部决策台"的内容。论文展示了一种"反事实反思训练"方法,可以让模型对自己的内部表征有更好的认知。这个方向可能比调 RLHF 参数更接近本质。
如果你是 AI 产品和应用的开发者: 你的 Agent 能力天花板可能不取决于模型聪明不聪明,而取决于"工作台"的一次性容量。30 步的多工具自主操作对当前的模型来说可能是强人所难——每一步都消耗 J-space 容量,没有路径复用机制。降低 Agent 链路的心理负担(提前决策、缓存中间状态、分解原子任务)可能比换更大的模型更具性价比。
(来源:Anthropic Research - "Verbalizable Representations Form a Global Workspace in Language Models",2026年7月7日。论文地址:transformer-circuits.pub/2026/workspace/index.html。开源代码:github.com/anthropics/jacobian-lens。交互式演示:neuronpedia.org/jlens)
