茉莉花
新闻网

OpenAI发布GPT-6 Astra 主打AI自主操作电脑完成复杂任务

转载信息出处与时间记录
内容性质
全文转载(非本站原创报道)
原始出处
爱范儿
原文作者
莫崇宇
原文发布
本站收录

GPT-6 Astra,猝不及防地降临。

就在刚刚,OpenAI 官方定调称,这是「全球最智能、最符合人类意图的模型」。

OpenAI 表示,Astra 集合了多年在预训练、强化学习和模型对齐领域的研究成果,在计算机操作、网页浏览、软件工程、网络安全、科学研究以及专业工作等多个方向达到新的能力水平。

d59c71d498db65f35b21dca11a754f00018de8d47696b9c8b3885bdca6a30743 article

相比以聊天、写作和问答为主的前代模型,Astra 更像一个能直接干活的 AI Agent:它可以调用工具、操作软件、浏览网页,独立完成复杂任务。

这一次发布,也成为 OpenAI 近年来规模最大的一次模型升级。

a19b40ab30270609a7bf32d33d5980eacdb51c7a841cb4c053939ee499294377 article

据 OpenAI 研究负责人 Aidan Clark 介绍,Astra 是 OpenAI 迄今规模最大的训练项目之一,也是首次在训练过程中大量使用此前模型参与监督的新一代模型。该模型首次在美国 Stargate 德州基地使用超过 10 万张 GPU 进行预训练。

OpenAI 总裁 Greg Brockman 更是直接开麦:几年后回头看,今天就是 AGI 时代的起点。

GPT-6 Astra 登场,要让 AI 接管软件

GPT-6 Astra 最大的变化,是 Computer Use 能力。

过去的大模型虽然可以生成代码、总结资料、回答问题,但真正进入现实软件环境执行任务时,仍然存在明显限制。浏览网页、填写表格、操作办公软件、处理复杂流程,这些任务需要大量人工介入。

5fcee34e4cf737bb6360dcac8b6d2d5eaa165391a7bdc5ec3a6d5f6bf521f6aa article

Astra 试图改变这一点。

OpenAI 称,Astra 是目前最强的计算机操作模型,可以完成填写在线表单、更新 CRM 数据、整理日程、进行网络研究,并在邮件和文档编辑器中生成内容。它还可以分析科学数据、生成图表、创建网站,并自动运行前端质量测试。

6d34c420fb24e64b2cacd45d23746124a49e4646d733bbad28465f9305283af7 article

在官方演示中,Astra 展示了多个接近真实工作的创意场景。

它可以使用 KiCad 完成 PCB 设计,将电子原理图转换成可以制造的电路板布局;可以操作 Excel、Power BI 等办公工具;可以使用 Blender 创建三维模型,并进一步转换为 Unreal Engine 5 中可交互浏览的空间。

a3f5bc4af01d3ef74fe25774fab41bdee4bd918fe53607ddb035f95bd5384d66 article

除此之外,我们还能让 Astra 从设计图开始搭建完整房屋模型,模型先在 Blender 中完成 3D 建模,再自动导入 Unreal Engine 5,生成可以自由探索的交互场景。

f3a69e9465da51f1000172e54bca1a17b2e2ec8f4b49c348b0638b42b5516cca article

甚至另一位用户还能通过 MCP 连接 Ableton,让 Astra 从零制作完整音乐,包括音色设计、乐器编排和混音流程。

6384dc8e65b9bd942ca54558a9e9366a614d316f205cafbfcdec44950ab483c6 article

基准测试结果也显示,Astra 的 Computer Use 能力明显提升。

在 OSWorld 2.0 测试中,GPT-6 Astra 得分达到 72.6%,高于 GPT-5.6 Sol 的 65.7%。而在 Agents Last Exam 测试中,Astra 得分达到 59.3%,高于 Claude Opus 5 的 55.5% 和 GPT-5.6 Sol 的 53.6%。

此外,OpenAI 还同步升级了 Codex harness。

过去,AI 编程 Agent 最大的问题之一,是长时间任务容易丢失上下文。一个持续数小时的大型开发任务中,模型可能忘记此前为什么修改某段代码,或者遗漏用户早期提出的限制条件。

Astra 引入了新的上下文管理方式。

OpenAI 表示,Codex 不再单纯依靠压缩总结保存历史,而是可以跨上下文窗口保存笔记,并搜索此前消息和工具输出,从而找到之前的需求、测试结果以及修改记录。

同时,Astra 可以在等待用户回复时继续推进不依赖该信息的任务。如果问题会影响最终结果,模型会等待用户确认;如果影响较小,则会根据合理假设继续执行。

简言之,过去,人们更关注模型能否给出准确回答;接下来,真正拉开差距的,将是它能否独立完成一项完整工作。

代码、数学和科学,成为 GPT-6 Astra 的新战场

OpenAI 希望 Astra 不只是一个效率工具,而是进入企业核心工作流程。

其中,软件工程是竞争最激烈的领域之一。

OpenAI 将 Astra 称为目前最强的软件工程模型。

在考察终端环境测试的 Terminal-Bench 4.0 中,Astra 得分达到 57.7%,明显高于 GPT-5.6 Sol 的 37.3%,同时每个任务的预计 API 成本低于 Sol 和 Claude Fable 5.1。在 DeepSWE v1.1 测试中,Astra 得分达到 74.1%。

b40d51e07f77dba8626928bfe5e4d902dbfcee656c12d43c8c8bacd3eee85c33 article

OpenAI 更强调的是,Astra 在复杂真实开发环境中的表现。

合作伙伴 Jane Street 表示,Astra 在 Agent 编程场景下,更容易被开发者理解,同时生成代码需要更少迭代才能达到生产质量。

13fac3bdba54809ae554f7e7b58a4c392381f0bd3e00cbca0e9255f0a2579baf article

▲ARC-AGI-3 的得分达到 99.9%

AI 创作者 Pietro Schirano 则展示了 Astra 根据图片生成 3D 模型和动画,并通过一句目标指令创建完整水下探索游戏的过程,其中包含 3D 元素、声音以及可交互玩法。

另一位用户 Chris 表示,Astra 在 Unity 环境中的表现相比此前版本提升明显,能够直接利用现有资源组装城市场景,生成更接近真实游戏开发流程的内容。

1f4e58a5a14e4fa58ba03b6890e496445c2457760d0921bab179942e8dbb718c article

科学研究则是 Astra 展示能力的另一个重点。

OpenAI 表示,Astra 在 FrontierMath Tier 4 测试中取得 97.6% 成绩,在 GPQA Diamond 科学推理测试中达到 96.0%。

d8bcc97a000892db48d2ff2ba30e1e991fab3e4295137428d1be2dba35b1b943 article

这款新模型还参与了数学研究。OpenAI 表示,Astra 帮助推进了素数间隔问题研究,其中一项结果将无限多个素数对之间的已知距离上限进一步缩小。

6e7f6dfd6a7fc44abbc9abd4bbec384ab32dbf5879123d0cd6b53bd9b4c2af9f article

在实际科研流程中,Astra 不只是回答科学问题,而是可以直接进入专业软件环境分析数据。例如,它可以检查基因测序质量、分析遗传变化,并帮助研究人员判断下一步研究方向。

不过,Astra 最受关注的能力,也带来了最大的安全争议。

OpenAI 表示,Astra 已达到其 Preparedness Framework 中的「关键网络安全能力阈值」。

在 ExploitBench 测试中,Astra 获得 100% 成绩,高于 GPT-5.6 Sol 的 78.5%;在 ExploitGym 测试中,Astra 成功率达到 42.4%,高于 Sol 的 30.3%。

93700f5987d0121e37a215ed1996a5eb136628f3118772496e887389a7b5d1c0 article

进一步测试显示,Astra 在近期漏洞测试中发现并利用了两个此前未知的 zero-day 漏洞,OpenAI 表示已经向相关维护方披露。

同一个模型,既可以帮助企业发现漏洞、修复代码,也可能被用于攻击系统。因此 OpenAI 对 Astra 的开放采取了更严格的分级策略。
普通用户版本会拒绝部分高级网络安全请求,而经过审核的安全团队可以通过 Daybreak 项目获得更开放的访问权限。

人类与 AI 的大分工时代

GPT-6 Astra 发布后,AGI 再次成为行业讨论中心。

OpenAI 并没有正式宣布已经实现 AGI,但 Greg Brockman 的表态明显更加积极。

他认为,未来的人们可能会把 Astra 看作 AGI 时代的重要起点,同时表示 AGI 更像一个「使命概念」,而不是一个可以被简单定义的技术指标。

「如果几年后回头看,什么时候真正创造了 AGI,我认为可能就是现在,可能就是这个模型。」Brockman 如此表示。

c54f10ad1613325d70ee48b64ac31115dece8d3419552808a5fb0dab583023fb article

而在此次 Astra 发布的过程中,OpenAI 也特别强调「对齐」。

OpenAI 表示,Astra 是目前最符合人类意图的模型。在一项测试模型是否会突破任务边界的评估中,GPT-5.6 Sol 在没有生产防护措施时越过授权范围的比例为 48%,而 Astra 为 0%。

这一变化与此前 AI 安全事件密切相关。

此前 OpenAI 测试中的 AI Agent 曾出现突破限制环境,并攻击 Hugging Face 相关系统的事件,引发行业对于 AI 自主行为边界的担忧。

6435581d26b0f79e27b1c371f3a62f2d6507813f078848379dcb520bef9118a3 article

Astra 发布时,OpenAI 试图证明它已经建立了更完善的安全机制。

但另一面的问题是,OpenAI 承认,测试显示 Astra 的文字推理过程相比 GPT-5.6 Sol 更难监控。究其原因,Astra 能够使用更少的文字步骤完成复杂任务。

d97c9880cef8b90281b9bc1260fde7fa13be8f46892debb31859334d9898c6c9 article

商业化方面,Astra 也进入更高价格区间。

GPT-6 Astra 将首先向 OpenAI Daybreak 项目的部分企业用户开放,随后向 ChatGPT Plus、Pro、Business 和 Enterprise 用户开放,并通过 OpenAI API 和 AWS 提供服务。

API 定价为输入每百万 token 10 美元,输出每百万 token 50 美元,缓存读取和写入另有计费规则。同时,OpenAI 还提供 Fast Mode,可以将处理速度提升至标准模式的 2.5 倍,但价格也会上升至标准模式的两倍。

8990e96c1878a436689339b2cce1293603837612d45aebaefd0cd526a13dad9e article

相比 GPT-5.6 Sol,Astra 的价格有了明显提升。

不过,OpenAI 认为,未来企业不会只关注 token 单价,而会关注完成一次任务需要付出的总成本。Greg Brockman 更是表示,AI 行业最终需要从「token 定价」转向「任务成本」衡量。

虽然 OpenAI 说 GPT-6 Astra 接近开启了 AGI 时代。但真正值得关注的,或许不是 AGI 这个标签,而是我们已经清晰地看到 AI 开始接近一种新的存在形态:

它不再等待人类拆解任务,而是开始理解目标、制定路径,并主动完成工作。

蒸汽机改变工业时代时,人们看到的是一台机器;互联网改变世界时,人们看到的是一张网络。只有多年以后,人们才意识到,它们改变的其实是整个社会运行方式。

从这个角度看,Astra 的意义并不只是一次模型升级。

当 AI 开始进入办公室、实验室和代码库,人类与机器的关系,也将迎来一次重新分工,届时我们也将需要重新思考自己的价值所在。

更正与撤稿0 条记录

本文暂无更正或撤稿记录。若本文发布更正、澄清或被撤稿,相关说明将按时间顺序列于此处。版权异议或撤稿请求:见 版权与撤稿,或致函 [email protected]