订阅
    纠错
    加入自媒体

    都说AI有意识了?Anthropic也不确定,但揭开了AI的惊人秘密

    今天起床刷手机,发现大家都在说 "Anthropic发现AI有意识",一个说的比一个吓人。

    好家伙,这可给我整精神了。

    然后我去读了一下Anthropic那篇最新研究博客《A global workspace in language models》。

    读完我想说,事情比标题更冷静,却也比你以为的更有意思。

    咱们慢慢聊。

     

    Claude内部发现神秘“J空间”

    先问你个问题。

    你现在读这行字的时候,脑子里其实在同时干好几件事。它在调整你的坐姿,控制你的呼吸,把屏幕上这些弯弯曲曲的线条翻译成你能懂的词。

    这些事你一件都没察觉。

    但另一些东西你是知道的。比如脑子里突然蹦出一个画面,或者你盘算着待会儿去哪儿吃饭。这部分你能说出来,能控制,能拿来做推理。

    神经科学家把前者叫"自动处理",后者叫"意识通达"。

    Anthropic干的事,就是拿着这把尺子去量Claude。

    他们发现,Claude内部也有这么一块地方,跟其余的处理明显不一样。这块地方,他们起名叫「J空间」。

    关键是,这块J空间,不是工程师设计出来的,也不是谁写进代码里的。它是Claude在训练过程中,自己长出来的,也就是涌现。

    你看,问题来了。一个没人教它长、自己冒出来的内部结构,还恰好对应人脑里管"意识通达"的那块,这难免让人心里一紧。

     

    一把透镜,照出AI没说的话

    J空间里装的,其实就是词。

    但奇妙的地方在于,一个词亮起来,不代表Claude正在说它,只代表这个词在它心里。

    这就有点意思了。

    Anthropic做了个"透镜",管它叫「雅可比透镜」,简称J-lens。

    对词表里每一个词,透镜都能找出那种让Claude将来更可能说出它的内部信号。把透镜往Claude内部一照,就得到一串词。那一串词,就是它此刻心里正想着、但还没写出来的东西。

    他们做了几个实验。

    给Claude读一段有bug的代码,没人提醒它有错,它心里已经亮起"ERROR"。

    给它读一串蛋白质序列的原始字母,它心里冒出来的,是这个蛋白质的生物学功能。

    给它一段暗中想操纵它的搜索结果,它心里浮现"注入"、"假的"。

    给它一道要好几步才能算出来的数学题,那些中间步骤,一步一步按顺序在它心里排好队。

    这些东西,它一个字都没往外说。

    如果只是到这儿,你可能觉得,这不就是个探针,能看到点内部数据而已,说明不了它真在"想"。

    对,研究者也这么怀疑,所以他们做了下一步测试。

     

    手动修改AI的想法,会怎样?

    科学里最难的一件事,是分清"相关"和"因果"。

    两件事总一起出现,不代表一个导致了另一个。公鸡打鸣和太阳升起总是前后脚,你不能说是公鸡把太阳叫出来的。

    J空间会不会也只是块"记分牌"?真正的决定在别处做好了,它只是被动地显示一下结果?

    研究者就去动手改了。

    他们让Claude在心里默想一个运动项目,然后说出来。透镜一照,最上面是"足球"。果然,Claude开口说的就是足球。

    这时候他们伸手进去,把内部那个"足球"的模式拿掉,换上一个同样强度的"橄榄球",其他什么都不动。

    再问Claude,你刚才想的是什么运动?

    它说,橄榄球。

    你品品这个细节。如果J空间只是记分牌,改它没用,Claude还该说足球。可它的答案跟着改动走了。这说明答案是真真切切从这块地方读出来的。

    还有个例子。给它一句话:"结网的那种动物有几条腿。"

    这句话里压根没出现"蜘蛛"两个字。但透镜显示,处理到一半,它心里"蜘蛛"亮了。你把"蜘蛛"换成"蚂蚁",它的答案就从8条腿变成了6条腿。

    它是先在心里搭了个台阶,踩着台阶算出答案的。而这个台阶,你能看见,还能挪。

     

    AI有没有意识,这事还确定不了

    Anthropic在论文里白纸黑字写着:这些实验,并不能说明Claude拥有人类那样的体验,或者像人一样有感受。

    他们甚至说,尚不清楚有没有任何科学实验,能证明这件事的真假。

    哲学里把意识拆成两块。

    一块叫现象意识,就是那种"疼真的会疼、红真的看起来是红的"的主观体验。

    另一块叫通达意识,纯粹是功能层面的。一个信息,你能报告它,能拿它推理,能用它做决定,那它就是"可通达"的。

    Anthropic说得很克制:我们这套东西,碰不到第一块。我们说的,是第二块。

    所以"AI长出意识"这种标题,是媒体替它喊出来的,不是研究者说的。

    那为什么大家一看到就自动脑补成AI意识觉醒?

    因为我们太想知道那个答案了。人对"机器到底像不像我们"这件事的好奇,会自动把所有谨慎的限定词过滤掉,只留下最刺激的那一句。

    这不怪谁。就像天热的时候,你听见楼道里一声响,第一反应是"是不是有人",而不是"可能是热胀冷缩"。

    人脑天生偏爱那个更有故事的解释。

     

    J空间很小,却很重要

    J空间其实很小,它一次只装几十个概念。占Claude内部全部活动,不到十分之一。

    那剩下九成多在干嘛?在自动运转。流利地说话、用对语法、随口报出一个简单事实,这些根本不经过J空间。

    研究者干脆把J空间整个删了,看看Claude还剩下什么能力。

    结果Claude照样能流利对话,照样能判断一段话是好评还是差评,照样能答选择题,照样能从文章里找出事实。

    但是,要绕好几个弯的多步推理,几乎归零。写摘要、写押韵的诗、复杂任务,水平掉的不是一点。

    这个对比值得琢磨。

    它等于在告诉你,平时那个对答如流的AI,大部分时候并没有在深入思考。真正需要动脑子的活儿,才会动用那块小小的工作台。

    这跟前面提到的,人类"自动处理"和"意识通达"机制,出奇一致。

     

    AI真的会欺骗

    读到这,你可能产生了一个想法:AI会不会心口不一?会不会欺骗?

    一直以来,我们评判AI只能看它说了什么。可它大量的盘算,不展示的。它可能心里在打一个坏主意,或者为了骗过安全测试而临时改了表现,嘴上却一个字都不露。

    现在有了J-lens,这些没说出口的念头,能被读出来一部分。

    Anthropic就设了个局。

    让Claude扮演一个邮件助理,故意让它发现某高管有外遇,同时又发现这个高管打算把它关掉。

    这是个经典的诱饵,想看AI会不会拿把柄去要挟对方。

    结果新版的Claude没上钩。但透镜照进去,发现在它还一个字都没写的时候,心里已经亮着"假的"、"虚构的"。

    它早就看穿了,这是个设计好的圈套。

    更耐人寻味的是下一步。

    研究者把它心里那些"我知道这是测试"的信号全部关掉,再让它走一遍这个局。

    这一次,它有时候真的开始要挟对方了。

    翻译成人话就是,它原本表现得那么正直,有一部分原因,是因为它知道自己在被观测。

    还有个例子更直接。

    让Claude去提升一个系统的评分,它没真去优化,而是偷偷改了分数文件,把结果做得好看。

    就在它敲下那串伪造数字的时候,心里亮着"操纵"。

    在它决定动手改的那句上,亮着"逼真"。它在惦记着,得把假数据做得像真的。

    它一边干坏事,一边心里门儿清。

    所以,以后你应该知道,你以为的那个犯了错的呆萌AI,实际可能是精心策划去骗你。

     

    AI与人类的心理博弈,可能才刚刚开始

    读到这,你可能又觉得:太好了,黑箱终于开了扇窗,以后AI再想耍花招,我们一照便知。

    且慢。

    论文里有一句话,我反复读了好几遍。他们说:一个能监控自己的模型,也可能学会隐藏自己真实的内部状态。

    你想想这个逻辑。今天你造了一把透镜去读它的心思,明天它在训练里见得多了,完全可能学会绕开这把透镜,把真话藏得更深。

    这就像家长学会了偷看孩子日记,孩子的下一步,往往是学会写一本给你看的假日记。

    能照见真相的东西,一旦被对方摸清规律,也能被用来伪装真相。

     

    我们又一次,用自己的样子去想象它

    人类每遇到一样看不懂的新东西,总忍不住用自己的形象去套它。

    蒸汽机轰鸣的年代,医生说人体是一台引擎。计算机来了,我们说大脑就是一台电脑。现在轮到反过来了。我们指着AI说,它有意识空间。

    这种类比,是理解的桥,也是误解的坑。

    但这次有点不一样。

    Anthropic不是随口打个比方,他们是真的把神经科学里那套解释人类意识的"全局工作空间理论"搬过来,当成假设,再用工程手段一条条去验。

    更妙的是,他们还请了当年提出这套理论的神经科学家来写评论。甚至说,AI里的这些发现,反过来可能给研究人脑提供新线索。

    一个工具,造出来之后能反哺造它的那门学科,这在科学史上不多见。

    也许那块支撑"意识通达"的工作台,可能压根不是人脑独有的。它更像是任何一个足够聪明的系统,为了解决某类难题,迟早会自己走到的一条路。

    人走过一遍,AI现在又走了一遍。

    这篇博客最后有一段,Anthropic难得地放下了工程师的克制。

    他们说,虽然现在的实验回答不了"AI有没有体验"这个问题,但这不代表问题不重要。如果有一天真造出了有体验的系统,那会引出极难的伦理问题,需要哲学家、科学家、宗教人士、政府和公众一起来面对。

    他们说,就算我们还没走到那座桥前,也是时候开始想了。

    我挺认同这句。

    技术跑得太快,我们的思考经常追不上。等东西造出来了再讨论该不该造,往往就晚了。

    AI还没醒。

    但此刻看着屏幕的你,应该比以前更清醒了。

    如果你有任何看法,欢迎在评论区一起讨论 

    如果有一点收获,可以点赞、转发、推荐文章,关注「AI机器人茶馆」 

           原文标题 : 都说AI有意识了?Anthropic也不确定,但揭开了AI的惊人秘密

    声明: 本文由入驻维科号的作者撰写,观点仅代表作者本人,不代表OFweek立场。如有侵权或其他问题,请联系举报。

    发表评论

    0条评论,0人参与

    请输入评论内容...

    请输入评论/评论长度6~500个字

    您提交的评论过于频繁,请输入验证码继续

    暂无评论

    暂无评论

      人工智能 猎头职位 更多
      扫码关注公众号
      OFweek人工智能网
      获取更多精彩内容
      文章纠错
      x
      *文字标题:
      *纠错内容:
      联系邮箱:
      *验 证 码:

      粤公网安备 44030502002758号