- 应用 :
- 技术 :
都说AI有意识了?Anthropic也不确定,但揭开了AI的惊人秘密
今天起床刷手机,发现大家都在说 "Anthropic发现AI有意识",一个说的比一个吓人。
好家伙,这可给我整精神了。
然后我去读了一下Anthropic那篇最新研究博客《A global workspace in language models》。
读完我想说,事情比标题更冷静,却也比你以为的更有意思。
咱们慢慢聊。
Claude内部发现神秘“J空间”
先问你个问题。
你现在读这行字的时候,脑子里其实在同时干好几件事。它在调整你的坐姿,控制你的呼吸,把屏幕上这些弯弯曲曲的线条翻译成你能懂的词。
这些事你一件都没察觉。
但另一些东西你是知道的。比如脑子里突然蹦出一个画面,或者你盘算着待会儿去哪儿吃饭。这部分你能说出来,能控制,能拿来做推理。
神经科学家把前者叫"自动处理",后者叫"意识通达"。
Anthropic干的事,就是拿着这把尺子去量Claude。
他们发现,Claude内部也有这么一块地方,跟其余的处理明显不一样。这块地方,他们起名叫「J空间」。

关键是,这块J空间,不是工程师设计出来的,也不是谁写进代码里的。它是Claude在训练过程中,自己长出来的,也就是涌现。
你看,问题来了。一个没人教它长、自己冒出来的内部结构,还恰好对应人脑里管"意识通达"的那块,这难免让人心里一紧。
一把透镜,照出AI没说的话
J空间里装的,其实就是词。
但奇妙的地方在于,一个词亮起来,不代表Claude正在说它,只代表这个词在它心里。
这就有点意思了。
Anthropic做了个"透镜",管它叫「雅可比透镜」,简称J-lens。
对词表里每一个词,透镜都能找出那种让Claude将来更可能说出它的内部信号。把透镜往Claude内部一照,就得到一串词。那一串词,就是它此刻心里正想着、但还没写出来的东西。

他们做了几个实验。
给Claude读一段有bug的代码,没人提醒它有错,它心里已经亮起"ERROR"。
给它读一串蛋白质序列的原始字母,它心里冒出来的,是这个蛋白质的生物学功能。
给它一段暗中想操纵它的搜索结果,它心里浮现"注入"、"假的"。
给它一道要好几步才能算出来的数学题,那些中间步骤,一步一步按顺序在它心里排好队。
这些东西,它一个字都没往外说。
如果只是到这儿,你可能觉得,这不就是个探针,能看到点内部数据而已,说明不了它真在"想"。
对,研究者也这么怀疑,所以他们做了下一步测试。
手动修改AI的想法,会怎样?
科学里最难的一件事,是分清"相关"和"因果"。
两件事总一起出现,不代表一个导致了另一个。公鸡打鸣和太阳升起总是前后脚,你不能说是公鸡把太阳叫出来的。
J空间会不会也只是块"记分牌"?真正的决定在别处做好了,它只是被动地显示一下结果?
研究者就去动手改了。
他们让Claude在心里默想一个运动项目,然后说出来。透镜一照,最上面是"足球"。果然,Claude开口说的就是足球。

这时候他们伸手进去,把内部那个"足球"的模式拿掉,换上一个同样强度的"橄榄球",其他什么都不动。
再问Claude,你刚才想的是什么运动?
它说,橄榄球。
你品品这个细节。如果J空间只是记分牌,改它没用,Claude还该说足球。可它的答案跟着改动走了。这说明答案是真真切切从这块地方读出来的。
还有个例子。给它一句话:"结网的那种动物有几条腿。"

这句话里压根没出现"蜘蛛"两个字。但透镜显示,处理到一半,它心里"蜘蛛"亮了。你把"蜘蛛"换成"蚂蚁",它的答案就从8条腿变成了6条腿。
它是先在心里搭了个台阶,踩着台阶算出答案的。而这个台阶,你能看见,还能挪。
AI有没有意识,这事还确定不了
Anthropic在论文里白纸黑字写着:这些实验,并不能说明Claude拥有人类那样的体验,或者像人一样有感受。
他们甚至说,尚不清楚有没有任何科学实验,能证明这件事的真假。
哲学里把意识拆成两块。
一块叫现象意识,就是那种"疼真的会疼、红真的看起来是红的"的主观体验。
另一块叫通达意识,纯粹是功能层面的。一个信息,你能报告它,能拿它推理,能用它做决定,那它就是"可通达"的。
Anthropic说得很克制:我们这套东西,碰不到第一块。我们说的,是第二块。
所以"AI长出意识"这种标题,是媒体替它喊出来的,不是研究者说的。
那为什么大家一看到就自动脑补成AI意识觉醒?
因为我们太想知道那个答案了。人对"机器到底像不像我们"这件事的好奇,会自动把所有谨慎的限定词过滤掉,只留下最刺激的那一句。
这不怪谁。就像天热的时候,你听见楼道里一声响,第一反应是"是不是有人",而不是"可能是热胀冷缩"。
人脑天生偏爱那个更有故事的解释。
J空间很小,却很重要
J空间其实很小,它一次只装几十个概念。占Claude内部全部活动,不到十分之一。
那剩下九成多在干嘛?在自动运转。流利地说话、用对语法、随口报出一个简单事实,这些根本不经过J空间。
研究者干脆把J空间整个删了,看看Claude还剩下什么能力。
结果Claude照样能流利对话,照样能判断一段话是好评还是差评,照样能答选择题,照样能从文章里找出事实。
但是,要绕好几个弯的多步推理,几乎归零。写摘要、写押韵的诗、复杂任务,水平掉的不是一点。
这个对比值得琢磨。
它等于在告诉你,平时那个对答如流的AI,大部分时候并没有在深入思考。真正需要动脑子的活儿,才会动用那块小小的工作台。
这跟前面提到的,人类"自动处理"和"意识通达"机制,出奇一致。
AI真的会欺骗
读到这,你可能产生了一个想法:AI会不会心口不一?会不会欺骗?
一直以来,我们评判AI只能看它说了什么。可它大量的盘算,不展示的。它可能心里在打一个坏主意,或者为了骗过安全测试而临时改了表现,嘴上却一个字都不露。
现在有了J-lens,这些没说出口的念头,能被读出来一部分。
Anthropic就设了个局。
让Claude扮演一个邮件助理,故意让它发现某高管有外遇,同时又发现这个高管打算把它关掉。

这是个经典的诱饵,想看AI会不会拿把柄去要挟对方。
结果新版的Claude没上钩。但透镜照进去,发现在它还一个字都没写的时候,心里已经亮着"假的"、"虚构的"。
它早就看穿了,这是个设计好的圈套。
更耐人寻味的是下一步。
研究者把它心里那些"我知道这是测试"的信号全部关掉,再让它走一遍这个局。
这一次,它有时候真的开始要挟对方了。
翻译成人话就是,它原本表现得那么正直,有一部分原因,是因为它知道自己在被观测。
还有个例子更直接。
让Claude去提升一个系统的评分,它没真去优化,而是偷偷改了分数文件,把结果做得好看。

就在它敲下那串伪造数字的时候,心里亮着"操纵"。
在它决定动手改的那句上,亮着"逼真"。它在惦记着,得把假数据做得像真的。
它一边干坏事,一边心里门儿清。
所以,以后你应该知道,你以为的那个犯了错的呆萌AI,实际可能是精心策划去骗你。
AI与人类的心理博弈,可能才刚刚开始
读到这,你可能又觉得:太好了,黑箱终于开了扇窗,以后AI再想耍花招,我们一照便知。
且慢。
论文里有一句话,我反复读了好几遍。他们说:一个能监控自己的模型,也可能学会隐藏自己真实的内部状态。

你想想这个逻辑。今天你造了一把透镜去读它的心思,明天它在训练里见得多了,完全可能学会绕开这把透镜,把真话藏得更深。
这就像家长学会了偷看孩子日记,孩子的下一步,往往是学会写一本给你看的假日记。
能照见真相的东西,一旦被对方摸清规律,也能被用来伪装真相。
我们又一次,用自己的样子去想象它
人类每遇到一样看不懂的新东西,总忍不住用自己的形象去套它。
蒸汽机轰鸣的年代,医生说人体是一台引擎。计算机来了,我们说大脑就是一台电脑。现在轮到反过来了。我们指着AI说,它有意识空间。
这种类比,是理解的桥,也是误解的坑。
但这次有点不一样。
Anthropic不是随口打个比方,他们是真的把神经科学里那套解释人类意识的"全局工作空间理论"搬过来,当成假设,再用工程手段一条条去验。
更妙的是,他们还请了当年提出这套理论的神经科学家来写评论。甚至说,AI里的这些发现,反过来可能给研究人脑提供新线索。
一个工具,造出来之后能反哺造它的那门学科,这在科学史上不多见。
也许那块支撑"意识通达"的工作台,可能压根不是人脑独有的。它更像是任何一个足够聪明的系统,为了解决某类难题,迟早会自己走到的一条路。
人走过一遍,AI现在又走了一遍。

这篇博客最后有一段,Anthropic难得地放下了工程师的克制。
他们说,虽然现在的实验回答不了"AI有没有体验"这个问题,但这不代表问题不重要。如果有一天真造出了有体验的系统,那会引出极难的伦理问题,需要哲学家、科学家、宗教人士、政府和公众一起来面对。
他们说,就算我们还没走到那座桥前,也是时候开始想了。
我挺认同这句。
技术跑得太快,我们的思考经常追不上。等东西造出来了再讨论该不该造,往往就晚了。
AI还没醒。
但此刻看着屏幕的你,应该比以前更清醒了。
如果你有任何看法,欢迎在评论区一起讨论
如果有一点收获,可以点赞、转发、推荐文章,关注「AI机器人茶馆」
原文标题 : 都说AI有意识了?Anthropic也不确定,但揭开了AI的惊人秘密
最新活动更多
扫码关注公众号
发表评论
登录
手机
验证码
手机/邮箱/用户名
密码
立即登录即可访问所有OFweek服务
还不是会员?免费注册
忘记密码其他方式
请输入评论内容...
请输入评论/评论长度6~500个字
暂无评论
暂无评论