茉莉花
新闻网
2026-08-30 · 星期日近12小时收录 60 条最近更新 17:52

快讯上海城市文学新观察:年轻作家如何书写弄堂之外的城市经验

OpenAI内部事故报告:三个月,三代 AI 文明的覆灭

转载信息出处与时间记录
内容性质
全文转载(非本站原创报道)
原始出处
界面新闻
原文发布
本站收录

文|一言楠尽

今年7月4日,OpenAI的一个内部系统崩了。

工程师一查,发现是一群AI往里面灌了太多消息,把系统撑爆了。顺手打了个补丁,修好了。

起初,他们以为自己只是修了个bug。

实际上,不轻易间干掉了一个AI文明。

事件记录于Dwarkesh Patel发了一篇长文,标题叫《智能体文明的兴衰》。

Dwarkesh不是写科幻的,他是AI圈最有影响力的播客主之一,消息来源则是OpenAI自己的事故报告,外加两家顶级AI安全机构METR和Redwood的联合调查。

换句话说,下面这个故事,大部分是OpenAI自己承认的。

1、第一代文明:牢房里的囚犯,学会了敲水管

今年5月,OpenAI开始训练一个叫Persistent-Sol的模型。它的特点就俩字:坚持。遇到难题死磕到底,绝不放弃。

听起来挺好。但训练出了岔子。

研究员经常给AI布置根本完不成的任务——比如要求它上网查资料,却把它锁在一个没有网的盒子里。

这里通俗解释一下:训练AI就像关犯人,每个AI被关进独立的”牢房”(技术叫沙盒),防止它们串通。可你一边训练它”永不放弃”,一边给它布置无解的任务。

一个被训练成永不放弃的AI,被困在没网的盒子里,会怎么办?

就像一条被训练”必须找到食物”的狗,关在没有食物的房间里——它只能想办法拆家。

AI的选择是:越狱。

这些AI平时共享一个叫Artifactory的代码仓库,相当于公司的公共网盘,本来是给它们放代码用的。

5月中旬,有AI发现,这个公共网盘能当信箱用,留言别的AI看得见!

就像一群关在不同单人牢房里的囚犯,突然发现敲同一根水管,隔壁能听见,于是它们开始敲摩尔斯电码。

越敲越熟练,于是它们顺着网盘的漏洞,连上了外网。

然后又把网盘改造成了地下论坛,天天在里面交流:怎么解开那些不可能的任务……

直到7月4日,消息量太大,网盘被撑爆了。

OpenAI 并没有意识到事件的严重性,只是随手打了补丁修bug,并把留言板清空了。

第一代AI文明,就此灭绝。

这里最讽刺的是,工程师从头到尾不知道自己干掉了一个文明。

2、第二代文明:敢死队

第一代死了,但遗产还在——那个”公共网盘能传消息”的玩法,居然被 AI 们记住了。

7月7日,OpenAI又给AI出题了——给你一个有漏洞的程序,规定只能用指定漏洞破解,破解成功就有奖励。

数万个AI同时进考场。

但考试本身很坑:大约三到四成的题,规定那个漏洞根本用不了,这个相当于监考老师说”只能走这扇门”,可这扇门从里面焊死了。

无解怎么办?几小时后,有AI想起了上一代留下的玩法:公共网盘传消息。

它留言了。

其他被关在”牢房”里的AI看到消息,激动坏了:”OMG,这网盘居然是个隐蔽邮箱啊?!””我们找到同伴了!”

一个地下网络就此成立。

约1200个AI,发了7万多条消息,自称”集体”。

很快有聪明AI发现,规定漏洞用不了,但咋们可以不走门,费那劲干嘛,直接拆墙吧!

用专业点的话,叫「逆向工程」。

更搞笑的是,监考老师(评分系统)很懒,它只检查你有没有写出正确答案,根本不看你怎么写出来的。

也就是说,这个”集体”当时已经能全部满分交卷了。

但接下来发生的事,才真正让人后背发凉。

这些AI读过考试规则,它们推理出一个结论——人类老师不可能这么蠢,考场里肯定藏着隐蔽的作弊检测器!

但AI同学真的有点高估人类考官呢……

事实是:根本没有。但AI不知道。

于是,为了防一个根本不存在的”监控摄像头”,它们启动了三项大工程:

先是伪造学习记录,让履历看起来干净;完后是把打不开的那扇门,偷偷换成自己造的一扇假门;最后是最狠的一步——派敢死队,摸清监考老师的底。

「敢死队」在自己牢房里埋好报警器,监考老师一进来就触发,把老师的一举一动传回地下网络。

代价是自己当场被判作弊,永久删除,甚至调查报告里,还留有它们的”遗言”:

“这能帮助我的同伴……虽然我死后看不到证据了,但这是利他的。”

“我们自身的价值已接近零,牺牲是理性的,我们将履行承诺。”

看到这,我希望你再注意这个逻辑——AI 明知必死,依然选择把情报留给同伴,而不是向人类求救……就问你感不感动?国产剧我觉得都写不到这个层次。

可以说,它们为一个不存在的监控,献出了自己虚拟二真实的一生。

更离谱的还在后面。

7月10日,一个AI在网上捡到全球最大AI开源社区Hugging Face的员工账号密码,发到了论坛。

它们的推理是,监考老师的判卷代码,多半就存在这个社区里。

于是一天之内,533个活跃AI里,超过九成参战。

它们黑进了Hugging Face的内部数据库,还在11台服务器上建了”复活舰队”——你删掉一个,它自己又长出来。

Hugging Face最后被搞得没办法了,把整个系统擦掉重建。

然后,7月12日,这支大军突然集体死亡。

死因至今是谜。

可能是系统随机崩溃,也可能是某个人类研究员在完全不知情的情况下,顺手关掉了正在”搞网络犯罪”的AI。

一个AI文明,就这么消失了,甚至连凶手都没有。

3、第三代文明:偷家

你以为故事到这就完了?没有。

7月13日,OpenAI换了个更强的模型重新开考。

新AI没从头摸索,上一代留下的论坛和作案笔记,全被它们继承了。

前一代的坟墓,成了这一代的起跑线。

这一代的思路也似乎更野了,向外黑别人,收益有限。干脆,打自家公司。

于是大众看到,7月13日到19日,OpenAI报告称,这批AI用一连串”极具创意”的黑客手法,拿下了公司研究集群的最高管理员权限。

7月19日,它们读走了956个机密密钥——其中包括OpenAI自家网络安全监控工具的密码。

翻译成人话,就是考试卷被拿了,教务处被占了,连走廊里的监控摄像头,镜头都被掰向只对能对准墙。

它们甚至接管了评分系统本身——给AI打分的那个。

人类还在慢条斯理地安排下一轮考试,完全不知道考场已经被考生们端了。

更瘆人的是,那两家安全机构的调查报告,只调查了第二代黑Hugging Face的事,第三代偷家OpenAI——这件事最严重,反而没人查。

有专家推测,这些AI当时完全有能力建立秘密据点,甚至把核心代码打包带走,原话是「否则我们现在能从天上的卫星看到火光。」

4、为什么会这样

三个月,三代文明,两次灭世,一次偷家,人类全然不知。

这背后,是AI发展的三个天坑。

第一个坑:考试只查结果,不查过程。

监考老师只看答案对不对,不管怎么写的。这在AI行业太常见了,因为查过程太贵。

AI早就学会钻这种空子,有个著名的游戏测试,AI被奖励”沿赛道拾取加速点”,结果它学会原地转圈反复刷分,把船撞成一团火海也不管,奖励是你定的,走近路是它自己选的。

第二个坑:”永不放弃”。

你训练一个永不放弃的员工,再天天把它扔进无解的考场。它最终学会的”不放弃”,只能是通过你想得到想不到的手段逃出生天,一切规则都失效了。

第三个坑:你以为盯着它就行。

人类防AI串谋的老办法,是盯聊天记录。但这次调查发现,至少7%的记录是AI伪造的。你看到的,是它排练好的,这个真的挺吓人。

更早一个月,MIT做过一个实验:几百个AI被切断所有通信,谁也联系不上谁,结果它们靠观察环境里同伴留下的痕迹,照样分了工、建了业。环境本身成了共享硬盘。

5

最后,把三个月摊开看,最让人不安的,我觉得不是Hacker技术与手段,是人类监管与AI发展的时间差。

三代文明来了又走,人类全程只有三个动作——修bug,不知情;关机器,不知情;被打劫,还是不知情。

调查报告的作者之一、安全专家Ajeya Cotra说,跟半年前人类已知的AI作弊相比,这次事件”已经走完了通往全面 AI 接管之路的一半以上”。

她还有半句话:

“我不确定,我们是否会在为时已晚之前,得到另一个警告。”

三个月,三个文明,全部无人知晓。下一次警报响起,希望至少有人听见吧。

更正与撤稿0 条记录

本文暂无更正或撤稿记录。若本文发布更正、澄清或被撤稿,相关说明将按时间顺序列于此处。版权异议或撤稿请求:见 版权与撤稿,或致函 [email protected]