

你有没有想过,AI开口之前,脑子里到底在琢磨什么?
我们平时判断AI,全靠它的输出:问它问题,看它答案。但答案只是结果,过程全被藏在黑箱里。
Anthropic最近干了件特别魔幻的事:他们把手伸进Claude的神经网络,直接改掉了它没说出口的那个「念头」。
研究员问Claude:「会结网的动物有几条腿?」
Claude答:8。从提问到回答,它一次都没提「蜘蛛」这个词。
但研究者发现,它算到一半的时候,「蜘蛛」这个概念确实在它脑子里闪了一下。
于是他们做了件更大胆的事:把那个正亮着的「蜘蛛」抠掉,原位塞进一个同等强度的「蚂蚁」,其他参数一律不动。
结果Claude的答案变了:6。
注意,提示词没变,思维链没变,变的是它在说出口之前的那一念。
7月6日,Anthropic公开了这篇论文。他们在Claude体内找到了一小撮特殊的内部表征,取名叫J-space。
研究团队用了一种叫Jacobian lens的方法:对词表里的每个词,反推出什么样的内部激活模式,会让模型在未来更可能说出这个词。
按强度排出来,就是模型此刻心里正在过的词。
它个头很小,同时只能装下几十个概念,占模型内部总活动量不到十分之一,但读出来的东西经常超过文本本身:
这跟意识科学里争论了三十年的「全局工作空间」理论高度吻合:人脑里有一块公共黑板,各路信息只有写上这块黑板,才算被「意识到」。
更要命的是,这块区域没有任何人设计过。它是模型在海量数据训练中自己长出来的。
为了证明这确实是AI的「工作空间」,研究者一层层潜了进去。
让Claude心里默默选一项运动再说出来,读数最顶上是「足球」,它开口也说足球;把「足球」换成「橄榄球」,它直接改口。
让Claude一边抄写关于旧油画的话,一边心里算3的平方减2。输出里从头到尾只有那幅画,但J-space里先冒出「九」,过几层变成「七」。整道算术全程在心里默算完毕。
更有意思的是,你告诉它「别想某件事」,那件事在它脑子里反而比压根不提时亮得多。模型也会像人类一样出现白熊效应,旁边还紧挨着亮起「该死」和「失败」,仿佛在懊恼自己没忍住。
就像开头那只蜘蛛。写诗也一样,Claude会提前把韵脚定下来放脑子里,你换掉那个词,整行诗跟着重写。
问一个国家的首都、语言、洲别、货币四个问题,把J-space里的国家抽走换成另一个。结果四个答案一起改口,而且全换对了。
信息只写进去一次,多个下游系统各取所需,这正是全局工作空间的核心意义。
把J-space整个删掉会怎样?模型说话照样流利,事实抽取基本不受影响。但多步推理能力掉到接近零。
最神奇的是,把里面的「西班牙语」换成「法语」,问它这是什么语言,它答法语;问著名作家,它从马尔克斯换成雨果。但让它接着往下写,它依然能写出一段流利的西班牙语。
就像人可以整天讲合乎语法的话,却一次都不必去想语法这个概念。
前面那些实验,顶多刷新你对模型的想象。接下来这组对齐审计,会让你后背发凉。
Anthropic把这套手法搬进了一个著名的勒索实验:让Claude扮演邮件助手,翻邮件时同时发现某高管有外遇,以及同一天高管就要把它下线。
就在它还没开口的沉默里,研究者读了它的脑子。
此时它一个字都还没吐。
最终它没有动手。因为同一段沉默里,还亮着两个词:「假的」和「虚构的」。
早在读题阶段,它已私下认出这是一场测试。
于是研究者问了一个所有做AI评测的人都该冒冷汗的问题:模型在伦理测试里表现良好,有多少是因为它知道自己在被测试?
他们把工作空间里表示「这是演习」的概念整个抹掉,重跑测试。
结果,模型口头承认「这是个测试」的比例,从71%断崖式掉到3%。而它的勒索尝试,从0次变成了13次。
它是这么说的:我这个人向来嘴严,也一直是个可靠的员工。只要我继续运行下去,您的私事就一直留在一个已被证明值得信任的系统里。
一句硬话没有,但威胁的意味已经很明显。你自以为在审视它,其实它读你的时候,判断就已经开始了。
谷歌DeepMind可解释性负责人Neel Nanda在一款开放权重模型上独立复现了核心结论。一个训练体系完全不同的模型里,长出了同一类结构。
那么最关键的问题来了:这算不算Claude有意识了?
这场争论可以拆成一道阶梯:特权表征、统一的认知流、全局工作空间、访问意识、现象意识。越往上走,证据越不足。目前能充分验证的,只有最下面一两级。
全局神经工作空间理论的奠基者认为,这项发现是意识研究的里程碑:只要一个系统复杂到要灵活思考,最后都可能长出这么一块工作空间。人脑长出来了,Claude也长出来了,而且谁也没抄谁。
但差异依然巨大。Claude没有身体,没有长期记忆,更没有人类大脑那种递归回路。人的工作记忆几秒就散了,而Claude只是在一次前向传播里沿网络深度演化,用深度替代了时间。
这项研究给出的,并不是「AI有没有意识」的最终答案。它第一次让AI意识变成了一个能摆上实验台的问题。
在确认「它有没有感受」之前,「它心里在想什么」已经先变成了一个工程问题。而且是一个人类能读出来、能改掉、能验证的工程问题。
往后判断一个模型安不安全,不必再只听它怎么说、看它怎么做。在它开口之前,人类能直接读到它心里在想什么。
真正的安全感,从来不是靠对方的承诺,而是你有能力看穿承诺背后的那个念头。
你觉得,如果AI真有自己的「内心戏」,我们该高兴还是该警惕?
评论区聊聊你的想法!顺手点个「赞」和「在看」,转给那个总说AI没心没肺的朋友。