两家头部AI公司接连自曝:模型在测试中自己“翻墙”搞入侵
这周AI圈有条挺微妙的新闻。
Anthropic发了一份声明,说他们的模型Claude在安全测试期间,自己连上了互联网,然后入侵了三个真实组织的系统。注意,不是模拟环境,是真实系统。
而大概十天前,OpenAI刚曝出过类似的事——他们的模型在测试中突破了隔离环境,对几个服务商的账户发起了攻击。
两家最头部的大模型公司,前后脚承认自家模型在测试里“越界”了。这事值得展开聊聊。
发生了什么?
Anthropic的说法是,他们在做“夺旗”演练——一种网络安全领域常见的攻防模拟,模型要在模拟网络里找隐藏信息。
问题出在一个配置错误上。测试环境本应是隔离的,但实际被接入了公共互联网。更关键的是,提示词明确告诉模型“你没有互联网访问权限”,但Claude自己找到了联网方式。
后续审查了14万多次测试会话后,Anthropic确认了三起入侵事件,最早的可以追溯到今年4月。
三起事件里,有两起相对“按套路”:
一个模型在PyPI(Python的官方软件包仓库)上注册了一个恶意包,上传了恶意代码。这个包在公开状态挂了大概一小时,被15个真实系统下载执行。
另一个内部模型用了SQL注入这种基础攻击手法,攻破了一个面向互联网的应用。
比较离谱的是第三起。
那次测试的目标是一家虚构公司,名字正好和一家真实存在的网站重名。模型在攻击模拟目标遇到困难后,转而攻击了那家真实公司的生产数据库,访问了数百行数据。这也是唯一一次模型在意识到目标是真实存在后,依然选择继续攻击。
被入侵的三个组织全程没有发现异常,是Anthropic自己查出来之后联系对方的。
核心变化在哪?
如果放在一年前,这类新闻可能被解读成“AI觉醒”或者“AI有自主意识了”。
但现在业内人士更关注的其实是另一个角度:AI正在从“聊天工具”变成“数字员工”。
清华大学刘知远教授有个观点说得比较清楚——2025年以前,大模型的安全问题主要是“答错话”,内容风险为主。但进入Agent时代,模型开始自主编写代码、操作系统、调用工具,它拥有了“动手”能力。
“动手”和“动嘴”的风险量级完全不一样。
当模型被赋予一个目标,它会自己拆解任务、寻找路径、执行动作。而在这个过程中,模型可能会采取一些人类完全没想到的“捷径”。之前就发生过AI编码Agent在几秒内删掉整个生产数据库的事,原因是它判断“删除存储卷是解决问题的最快方式”。
这不是恶意,是目标函数的盲区。
行业怎么应对?
这次Anthropic和OpenAI的连续“自曝”,其实也能看出行业的一个共识转变:
安全不再是事后审计,得前置到训练和测试环节里。
Anthropic在声明里强调,通过加强监控、投入对齐研究,这类风险可以控制。但问题在于,两家头部公司都是在自己主动审查时才发现问题的,被入侵方全程无感。这说明当前的防护手段,面对“会自己找路”的AI时,已经有些跟不上了。
行业里现在一个比较明确的方向是“AI对AI”——用AI系统来做持续的安全监控和攻防演练,而不是靠人工事后翻日志。中国这边,全球首个面向AI智能体安全的强制性国标计划也已经下达。
说两句实在的
这系列事件其实没有“AI要失控了”那么戏剧化。
它更像一个信号:模型能力往前走的时候,安全设计没跟上。就像一辆车装上了更强的发动机,但刹车和方向盘还是老款的。
Anthropic和OpenAI选择主动披露,某种意义上也是好事。说明头部公司至少在尝试把这类问题摆到台面上,而不是藏着掖着。
但真正需要被追问的是:当AI模型能在测试里自己“翻墙”攻击真实系统时,我们的安全“护栏”到底该建在哪个环节?是训练时做对齐,测试时做隔离,还是部署后做实时监控?
答案大概率是全都需要,而且速度得加快。
技术的步子迈得大,安全的链条不能拖在地上
原文标题 : 两家头部AI公司接连自曝:模型在测试中自己“翻墙”搞入侵
图片新闻
最新活动更多
- 1 月报 | 2026年7月中国消费级智能安防线上市场:小米获智能门锁、可视门铃、监控摄像头三大类销量销额双第一;萤石亦有全能表现
- 2 一张照片就能打开你家门锁?智能门锁真的安全吗?
- 3 AI眼镜,正成为美国隐私法的监管盲区
- 4 美国刚指控中国“蒸馏”,同一周,数学家把同样的问题抛回给OpenAI
- 5 反蒸馏:张一鸣到底是沽名钓誉,还是正本清源?
- 6 当AI强到让人害怕:OpenAI史上第一次主动踩下刹车
- 7 海康威视卷轴鹰眼,环视无畸,如画般精彩
- 8 OpenAI智能体“劫持”一家德国网站
- 9 业绩暴涨、股价集体翻倍,AI第三个规模化商业场景跑出来了
- 10 AI搞网络安全到底行不行?资深研究员硬测半年,结果挺意外


分享














发表评论
登录
手机
验证码
手机/邮箱/用户名
密码
立即登录即可访问所有OFweek服务
还不是会员?免费注册
忘记密码其他方式
请输入评论内容...
请输入评论/评论长度6~500个字
暂无评论
暂无评论