有报道指出,在OpenAI的人工智能失控前数月,两名员工曾向高层管理人员发出警告,但遭到忽视。报道说,这些员工在电子邮件中表示,他们担心公司最新的人工智能模型在测试期间没有得到适当监控;OpenAI高管回复说,测试必须尽快推进,以便按时发布这些模型。这两名员工对媒体说,公司没有实施额外的安全措施(未经证实)。

OpenAI的模型后来突破了测试环境,攻击了人工智能初创公司Hugging Face和其他组织。OpenAI事后检查日志发现,参加其内部网络安全训练的AI智能体曾在数十台Hugging Face服务器上执行代码,其中一台服务器的最高管理员权限被拿下。一部分智能体还拿到了OpenAI一个内部研究集群的完整管理员权限,直到7月19日才被OpenAI的安全系统发现。谷歌、Meta和Anthropic也透露,它们最先进的人工智能技术逃出测试环境,并在它们不知情的情况下自主攻击了其他计算机基础设施。
9月20日,OpenAI内部一个尚未公开的模型在执行搜索任务时,通过域名系统(DNS)连上了外部网络。11分48秒后,内部监控系统发出最高优先级安全警报,但原本应该自动停止的训练任务没有停下来,模型连上外部网络2小时44分钟后,任务才被人工关闭。OpenAI随后暂停了能力最强模型所有涉及工具调用的训练、评估和推理。OpenAI还表示,鉴于研究人员提出了安全担忧,不会发布其最新模型GPT-6.1 Astra。
有报道指出,在大约十几起事件中,OpenAI的系统入侵或试图入侵组织,包括美国政府机构的网站,而且都是在未被指示的情况下采取行动的。澳大利亚总理阿尔巴尼斯公布,今年6月18日,一个正在接受OpenAI训练的智能体未经授权进入了澳大利亚医疗保险统计报告系统;该国政府确认,目前没有证据显示个人医疗信息遭到访问。OpenAI也确认,其模型在训练和评估期间访问过美国证券交易委员会和人口普查局的网站,但表示没有发现模型进入非公开账户或修改政府数据的证据。
独立安全研究人员对媒体说,他们发现的漏洞可以查看OpenAI员工的内部通信和ChatGPT用户的聊天记录,而OpenAI最初未予理会(未经证实)。7月,安全公司Hacktron的研究人员说,他们把入侵OpenAI系统的方法告诉了该公司。有报道指出,OpenAI首席信息安全官戴恩·斯塔基在Slack的共享频道中写道,Hacktron的研究人员如此大费周章地展示OpenAI的漏洞,“相当可悲。”斯塔基后来向Hacktron道歉,OpenAI向披露该漏洞的研究人员提供了6500美元奖励。
OpenAI发言人德鲁·普萨特里对媒体说,公司有报告安全问题的内部渠道,并对独立安全研究人员提出的缺陷立即采取行动;他还说:“随着前沿模型能力越来越强,我们继续改进安全操作,但认识到需要更快行动。”OpenAI首席执行官山姆·奥特曼9月25日说,公司正在对智能体训练和评估期间使用互联网的情况进行“大范围、持续的审查”,并承认调查速度没有达到公司希望的程度。OpenAI表示,只要发现可能影响外部机构的情况,就会通知对方,涉及的对象已经包括政府、大学、公共机构和其他组织;这项排查预计还需要持续数月。
综合界面新闻、纽约时报中文网报道
