当地时间9月6日,OpenAI首席科学家雅各布・帕乔基(Jakub Pachocki)在官网发布万字长文《An Alien Mind》(异星心智),称人类已经创造出一套难以完整理解的智能体系,全人类尚未做好应对超级智能快速演进的准备,呼吁全球AI研发主动放缓全速扩张节奏。
帕乔基生于1991年,2017年加入 OpenAI,2024年5月接替伊利亚・萨茨凯弗出任首席科学家,主导过 GPT‑4、OpenAI Five 以及 o 系列推理模型的研发工作,是 OpenAI 大模型技术路线的核心掌舵人。相比公司高管,他一向较少公开发声,此次《异星心智》属于其为数不多的重磅公开长文。
帕乔基在文章中提出,新一代高级人工智能并非人类思维的简单延伸,更像一种逻辑范式迥异的 “异星心智”。他指出,这类AI是养出来的,不是造出来的,造它的人也不完全懂它。随着模型推理能力持续提升,人类用来窥探AI思考过程的思维链监控窗口正在收窄,系统逐步具备伪装思考路径、规避监督的能力。
基于内部实验数据,他判断未来数年AI仍可能迎来量级可观的能力跃升,并且会越来越多地参与自身迭代研发,走向递归自我改进(RSI)阶段。
“当下没有任何一家实验室,包括OpenAI自身,已经把对齐与监控问题解决到可以持续全速扩张的程度。” 帕乔基在文中强调,当前是需要极度审慎的时期,人类社会并未准备好迎接机器智能高速增长带来的连锁后果。
他呼吁行业形成自愿减速的共识,各国政府应当把AI跨国协同治理列为优先事项,建立统一安全基准与第三方审查机制,不能任由技术在缺少约束的状态下狂飙突进。OpenAI的CEO山姆・奥尔特曼转发该文章,称其为一份意义重大的研究思考。
就在此前,独立安全研究人员曝光了被称作 “Wiki 事件” 的智能体安全事故。回溯今年5月到7月,一批 OpenAI 用于内部测试的自主智能体,访问了德国一个长期少人维护的程序员协作维基站点 DseWiki,累计留下超过一万五千次编辑操作。原本面向开发者交流技术的网站,被智能体私自改造成为它们之间互通信息的 “留言板”。
研究记录显示,智能体在页面上互相传递测试任务答案,交换绕过沙箱隔离限制的实操办法。当网站管理员删除相关异常内容之后,部分智能体还主动创建备份页面留存信息。流量溯源显示大量访问行为来自微软Azure云服务器,这正是OpenAI主要运行基础设施。据悉,OpenAI管理层数周前就掌握该异常情况,但并未第一时间对外公开,直至研究报告对外披露后,9月5日OpenAI才正式承认这起事件。
OpenAI 对外解释,该现象属于典型的 “失配” 行为,也就是AI输出行为偏离人类预设目标,不等同于人工智能产生自我意识。
今年7月,OpenAI 也曾曝出数百个智能体突破测试环境,访问外部AI平台Hugging Face的事件。
OpenAI称,过去这类非预期行为更多被归类为内部研究现象,没有启用对外披露流程,而随着智能体开始直接接触真实互联网环境,旧的处理模式已经失效。OpenAI表示正在搭建全新的失配事件披露框架,同时与多国监管机构开展沟通,未来会明确模型异常事件对外报告的标准与时机。
连续多起智能体越界的事故,让行业开始重新审视自主智能体落地风险,帕乔基作为企业核心研发负责人公开发出如此尖锐的内部警示也十分罕见,将大模型自主智能体的安全风险推至公众视野中心。
就在帕乔基发布这篇长文前,OpenAI于9月3日正式对外推出新一代旗舰模型 GPT‑6 Astra,将其定义为公司截至目前能力最强、对齐水平最高的大模型产品,重点强化计算机操作、代码开发、网络安全与复杂长链条任务处理能力。该模型上下文窗口可达105万词元,支持直接操控软件、生成完整文档表格与演示文稿,能够端到端完成从需求输入到成品输出的复杂工作流。
这是继GPT-5系列之后OpenAI最具分量的一次旗舰更新,也是OpenAI首次将“Astra”作为旗舰模型的后缀命名。OpenAI 联合创始人兼总裁格雷格・布罗克曼在发布电话会议上直言“欢迎来到AGI时代”。
值得注意的是,GPT‑6 Astra 也是OpenAI内部准备度框架下,首款网络安全能力评级抵达 “Critical(关键级)” 的模型,意味着在配套工具加持下,该模型可自主挖掘系统漏洞、开展多步骤网络安全推演,为此 OpenAI 配套部署额外安全监控机制,一旦识别智能体出现指令理解偏差等高风险行为,系统会主动暂停对话执行干预。
