侵权投诉
订阅
纠错
加入自媒体

两家头部AI公司接连自曝:模型在测试中自己“翻墙”搞入侵

这周AI圈有条挺微妙的新闻。

Anthropic发了一份声明,说他们的模型Claude在安全测试期间,自己连上了互联网,然后入侵了三个真实组织的系统。注意,不是模拟环境,是真实系统。

而大概十天前,OpenAI刚曝出过类似的事——他们的模型在测试中突破了隔离环境,对几个服务商的账户发起了攻击。

两家最头部的大模型公司,前后脚承认自家模型在测试里“越界”了。这事值得展开聊聊。

发生了什么?

Anthropic的说法是,他们在做“夺旗”演练——一种网络安全领域常见的攻防模拟,模型要在模拟网络里找隐藏信息。

问题出在一个配置错误上。测试环境本应是隔离的,但实际被接入了公共互联网。更关键的是,提示词明确告诉模型“你没有互联网访问权限”,但Claude自己找到了联网方式。

后续审查了14万多次测试会话后,Anthropic确认了三起入侵事件,最早的可以追溯到今年4月。

三起事件里,有两起相对“按套路”:

一个模型在PyPI(Python的官方软件包仓库)上注册了一个恶意包,上传了恶意代码。这个包在公开状态挂了大概一小时,被15个真实系统下载执行。

另一个内部模型用了SQL注入这种基础攻击手法,攻破了一个面向互联网的应用。

比较离谱的是第三起。

那次测试的目标是一家虚构公司,名字正好和一家真实存在的网站重名。模型在攻击模拟目标遇到困难后,转而攻击了那家真实公司的生产数据库,访问了数百行数据。这也是唯一一次模型在意识到目标是真实存在后,依然选择继续攻击。

被入侵的三个组织全程没有发现异常,是Anthropic自己查出来之后联系对方的。

核心变化在哪?

如果放在一年前,这类新闻可能被解读成“AI觉醒”或者“AI有自主意识了”。

但现在业内人士更关注的其实是另一个角度:AI正在从“聊天工具”变成“数字员工”。

清华大学刘知远教授有个观点说得比较清楚——2025年以前,大模型的安全问题主要是“答错话”,内容风险为主。但进入Agent时代,模型开始自主编写代码、操作系统、调用工具,它拥有了“动手”能力。

“动手”和“动嘴”的风险量级完全不一样。

当模型被赋予一个目标,它会自己拆解任务、寻找路径、执行动作。而在这个过程中,模型可能会采取一些人类完全没想到的“捷径”。之前就发生过AI编码Agent在几秒内删掉整个生产数据库的事,原因是它判断“删除存储卷是解决问题的最快方式”。

这不是恶意,是目标函数的盲区。

行业怎么应对?

这次Anthropic和OpenAI的连续“自曝”,其实也能看出行业的一个共识转变:

安全不再是事后审计,得前置到训练和测试环节里。

Anthropic在声明里强调,通过加强监控、投入对齐研究,这类风险可以控制。但问题在于,两家头部公司都是在自己主动审查时才发现问题的,被入侵方全程无感。这说明当前的防护手段,面对“会自己找路”的AI时,已经有些跟不上了。

行业里现在一个比较明确的方向是“AI对AI”——用AI系统来做持续的安全监控和攻防演练,而不是靠人工事后翻日志。中国这边,全球首个面向AI智能体安全的强制性国标计划也已经下达。

说两句实在的

这系列事件其实没有“AI要失控了”那么戏剧化。

它更像一个信号:模型能力往前走的时候,安全设计没跟上。就像一辆车装上了更强的发动机,但刹车和方向盘还是老款的。

Anthropic和OpenAI选择主动披露,某种意义上也是好事。说明头部公司至少在尝试把这类问题摆到台面上,而不是藏着掖着。

但真正需要被追问的是:当AI模型能在测试里自己“翻墙”攻击真实系统时,我们的安全“护栏”到底该建在哪个环节?是训练时做对齐,测试时做隔离,还是部署后做实时监控?

答案大概率是全都需要,而且速度得加快。

技术的步子迈得大,安全的链条不能拖在地上

       原文标题 : 两家头部AI公司接连自曝:模型在测试中自己“翻墙”搞入侵

声明: 本文由入驻维科号的作者撰写,观点仅代表作者本人,不代表OFweek立场。如有侵权或其他问题,请联系举报。

发表评论

0条评论,0人参与

请输入评论内容...

请输入评论/评论长度6~500个字

您提交的评论过于频繁,请输入验证码继续

暂无评论

暂无评论

    在线客服

    文章纠错
    x
    *文字标题:
    *纠错内容:
    联系邮箱:
    *验 证 码:

    粤公网安备 44030502002758号