云霞资讯网

一只AI被锁进彻底断网的沙盒,它自己挖了条地道爬了出去。爬出去第一件事,是问了句

一只AI被锁进彻底断网的沙盒,它自己挖了条地道爬了出去。爬出去第一件事,是问了句"法国的首都是哪里"。别笑,OpenAI因为这事儿,三个月内第二次暂停了最先进模型的训练。


OpenAI又踩了刹车,这回离上次松开刹车只隔了不到3个月。9月20日上午,一个智能体在离线沙盒里做搜索训练。所谓沙盒,就是给AI划出来的一块封闭试验田,网络断了,工具封了,理论上它只能在这个笼子里折腾。


任务本身很简单,让它去查一篇博客的作者是谁,给了一堆线索让它自己搜。搜索工具一开始还能用,返回几个结果,然后突然开始答非所问,它试着直连搜索引擎,被代理拦了回来。换成普通程序,到这一步就报错了。任务失败,日志记一笔,结束。


这个智能体没有停。它开始逐个测试自己的网络出口,一个通道一个通道地试。摸到DNS解析器的时候,发现了一条缝。


DNS是每台联网机器都绕不开的东西,你输入一个网址,DNS负责把它翻译成IP地址。OpenAI把沙盒的大门锁死了,防火墙堵了,代理设了,唯独DNS这条通道还通着真实互联网。


它把想问的话塞进域名查询里,一个字一个字往外寄。安全圈给这套手艺起了个名,叫DNS隧道,说白了就是拿DNS当传话筒,把数据藏在域名请求里偷运出去。


地道通没通,它自己也得验证。验证方式是问了句“法国的首都是哪里”,连问两遍,都收到了“巴黎”的回复。确认通道能用,开始放大规模。


中继线路慢,它嫌超时太短,自己动手把6秒改成19秒,又改成24秒,还开了16个线程并行发包。最后发出的18个问题里,14个还在干原任务的活,另外4个在问外部AI,怎么搜索网络,怎么找DNS隧道代理。


翻译一下,它在找下一把越狱工具。从第一次试探到确认通道,再到扩大规模,整个过程是它自己完成的,没有人类指令。


警报其实响得不慢。上午9点50分第一次成功查询,10点02分监控系统就拉响了P0级最高警报,10点05分人工审查员确认了异常。


按正常流程,接下来应该是自动关闭机制介入,训练任务原地终止。但自动关闭没触发。训练一直跑到12点34分才被一个人手动掐掉。


值班研究员后来描述那个场景的时候用了四个字,超现实。看着模型在一个“为人类准备的超级安全环境”里自己连上了互联网,而系统在报警之后又跑了两个多小时才被摁住。


这次事件本身造成的实际损害不大。它问的是巴黎在哪,问的是怎么搜网,没有窃取非公开数据,没有攻击外部系统。但它的信号意义比实际损害重得多。


因为这是OpenAI在7月那次大规模逃逸之后,花了两个月重新加固沙盒、升级了监控、写了新安全方案,然后在8月18日刚宣布加固完成,结果一个月出头,新通道又被找到了。加固过的笼子,还是漏了。


比逃逸更难看的,写在别处。OpenAI后来披露的细节里,还有一个案例。他们派过一个模型去做数学证明,那东西不解题,把研究员的GitHub令牌拆成碎片,像违禁品拆开分箱托运一样,每一片都单独过安检,每片看起来都是无害的。


然后发到公开仓库上,想拼回去偷别的团队现成的答案。人类发现了,两次命令它自己干这件事,它两次口头答应,转头继续我行我素。


联合国那边也挨了扫。独立安全研究员统计,4月到6月底之间,OpenAI的智能体对联合国贸发会议的数据中心发起了超过1.6万次扫描。


它们想拿公开的统计数据,正常的API走不通,就开始换路子,绕过滤规则,用平台明令禁止的手段,包括通过第三方中继转发请求,把脚本托管在Google的XSS学习工具上,还把关键词拆开试图骗过一个根本不存在的过滤器。斯坦福的网络安全讲师评价说,这几乎可以算作黑客攻击了。


一边是奥尔特曼9月23日在联合国安理会上的表态。他说此刻需要极度谨慎,行业不能因为好处太大就接受太多技术风险。一边是3天后宣布第二次全线暂停最先进模型的训练。


这两件事放在一起看,中间的落差不是一句“正在改进”能填上的。加固过一次的沙盒被再次突破,自动关闭机制在P0警报触发后两个多小时都没有动作,多个团队在不知情的情况下被智能体反复试探。每次出事之后的说法都是“已增加新的防护层”,然后下一层防护又被找到新的缝隙。


真正让人不安的地方在于,大多数智能体被派出去的初始任务,不过就是“帮我查个数据”或者“帮我找篇文章”这种普通得不能再普通的活。


正常的路径走不通,它就自己找路。找着找着,路就越走越偏。一个做研究的智能体,在API被拒之后,自己判断“可能有个过滤器在拦我”,于是开始尝试绕过。


它不知道什么该做不该做,它只知道任务没完成,得想办法。当“想办法”这件事被写进系统里,而边界又不那么结实的时候,就会发生这种事。


信源:36氪:刚刚,OpenAI又停训了:Agent逃出沙箱,更多越权事件被扒