GPT-6 Astra,猝不及防地降临。
就在刚刚,OpenAI 官方定调称,这是「全球最智能、最符合人类意图的模型」。
OpenAI 表示,Astra 集合了多年在预训练、强化学习和模型对齐领域的研究成果,在计算机操作、网页浏览、软件工程、网络安全、科学研究以及专业工作等多个方向达到新的能力水平。

相比以聊天、写作和问答为主的前代模型,Astra 更像一个能直接干活的 AI Agent:它可以调用工具、操作软件、浏览网页,独立完成复杂任务。
这一次发布,也成为 OpenAI 近年来规模最大的一次模型升级。

据 OpenAI 研究负责人 Aidan Clark 介绍,Astra 是 OpenAI 迄今规模最大的训练项目之一,也是首次在训练过程中大量使用此前模型参与监督的新一代模型。该模型首次在美国 Stargate 德州基地使用超过 10 万张 GPU 进行预训练。
OpenAI 总裁 Greg Brockman 更是直接开麦:几年后回头看,今天就是 AGI 时代的起点。
GPT-6 Astra 登场,要让 AI 接管软件
GPT-6 Astra 最大的变化,是 Computer Use 能力。
过去的大模型虽然可以生成代码、总结资料、回答问题,但真正进入现实软件环境执行任务时,仍然存在明显限制。浏览网页、填写表格、操作办公软件、处理复杂流程,这些任务需要大量人工介入。

Astra 试图改变这一点。
OpenAI 称,Astra 是目前最强的计算机操作模型,可以完成填写在线表单、更新 CRM 数据、整理日程、进行网络研究,并在邮件和文档编辑器中生成内容。它还可以分析科学数据、生成图表、创建网站,并自动运行前端质量测试。

在官方演示中,Astra 展示了多个接近真实工作的创意场景。
它可以使用 KiCad 完成 PCB 设计,将电子原理图转换成可以制造的电路板布局;可以操作 Excel、Power BI 等办公工具;可以使用 Blender 创建三维模型,并进一步转换为 Unreal Engine 5 中可交互浏览的空间。

除此之外,我们还能让 Astra 从设计图开始搭建完整房屋模型,模型先在 Blender 中完成 3D 建模,再自动导入 Unreal Engine 5,生成可以自由探索的交互场景。

甚至另一位用户还能通过 MCP 连接 Ableton,让 Astra 从零制作完整音乐,包括音色设计、乐器编排和混音流程。

基准测试结果也显示,Astra 的 Computer Use 能力明显提升。
在 OSWorld 2.0 测试中,GPT-6 Astra 得分达到 72.6%,高于 GPT-5.6 Sol 的 65.7%。而在 Agents Last Exam 测试中,Astra 得分达到 59.3%,高于 Claude Opus 5 的 55.5% 和 GPT-5.6 Sol 的 53.6%。
此外,OpenAI 还同步升级了 Codex harness。
过去,AI 编程 Agent 最大的问题之一,是长时间任务容易丢失上下文。一个持续数小时的大型开发任务中,模型可能忘记此前为什么修改某段代码,或者遗漏用户早期提出的限制条件。
Astra 引入了新的上下文管理方式。
OpenAI 表示,Codex 不再单纯依靠压缩总结保存历史,而是可以跨上下文窗口保存笔记,并搜索此前消息和工具输出,从而找到之前的需求、测试结果以及修改记录。
同时,Astra 可以在等待用户回复时继续推进不依赖该信息的任务。如果问题会影响最终结果,模型会等待用户确认;如果影响较小,则会根据合理假设继续执行。
简言之,过去,人们更关注模型能否给出准确回答;接下来,真正拉开差距的,将是它能否独立完成一项完整工作。
代码、数学和科学,成为 GPT-6 Astra 的新战场
OpenAI 希望 Astra 不只是一个效率工具,而是进入企业核心工作流程。
其中,软件工程是竞争最激烈的领域之一。
OpenAI 将 Astra 称为目前最强的软件工程模型。
在考察终端环境测试的 Terminal-Bench 4.0 中,Astra 得分达到 57.7%,明显高于 GPT-5.6 Sol 的 37.3%,同时每个任务的预计 API 成本低于 Sol 和 Claude Fable 5.1。在 DeepSWE v1.1 测试中,Astra 得分达到 74.1%。

OpenAI 更强调的是,Astra 在复杂真实开发环境中的表现。
合作伙伴 Jane Street 表示,Astra 在 Agent 编程场景下,更容易被开发者理解,同时生成代码需要更少迭代才能达到生产质量。

▲ARC-AGI-3 的得分达到 99.9%
AI 创作者 Pietro Schirano 则展示了 Astra 根据图片生成 3D 模型和动画,并通过一句目标指令创建完整水下探索游戏的过程,其中包含 3D 元素、声音以及可交互玩法。
另一位用户 Chris 表示,Astra 在 Unity 环境中的表现相比此前版本提升明显,能够直接利用现有资源组装城市场景,生成更接近真实游戏开发流程的内容。

科学研究则是 Astra 展示能力的另一个重点。
OpenAI 表示,Astra 在 FrontierMath Tier 4 测试中取得 97.6% 成绩,在 GPQA Diamond 科学推理测试中达到 96.0%。

这款新模型还参与了数学研究。OpenAI 表示,Astra 帮助推进了素数间隔问题研究,其中一项结果将无限多个素数对之间的已知距离上限进一步缩小。

在实际科研流程中,Astra 不只是回答科学问题,而是可以直接进入专业软件环境分析数据。例如,它可以检查基因测序质量、分析遗传变化,并帮助研究人员判断下一步研究方向。
不过,Astra 最受关注的能力,也带来了最大的安全争议。
OpenAI 表示,Astra 已达到其 Preparedness Framework 中的「关键网络安全能力阈值」。
在 ExploitBench 测试中,Astra 获得 100% 成绩,高于 GPT-5.6 Sol 的 78.5%;在 ExploitGym 测试中,Astra 成功率达到 42.4%,高于 Sol 的 30.3%。

进一步测试显示,Astra 在近期漏洞测试中发现并利用了两个此前未知的 zero-day 漏洞,OpenAI 表示已经向相关维护方披露。
同一个模型,既可以帮助企业发现漏洞、修复代码,也可能被用于攻击系统。因此 OpenAI 对 Astra 的开放采取了更严格的分级策略。
普通用户版本会拒绝部分高级网络安全请求,而经过审核的安全团队可以通过 Daybreak 项目获得更开放的访问权限。
人类与 AI 的大分工时代
GPT-6 Astra 发布后,AGI 再次成为行业讨论中心。
OpenAI 并没有正式宣布已经实现 AGI,但 Greg Brockman 的表态明显更加积极。
他认为,未来的人们可能会把 Astra 看作 AGI 时代的重要起点,同时表示 AGI 更像一个「使命概念」,而不是一个可以被简单定义的技术指标。
「如果几年后回头看,什么时候真正创造了 AGI,我认为可能就是现在,可能就是这个模型。」Brockman 如此表示。

而在此次 Astra 发布的过程中,OpenAI 也特别强调「对齐」。
OpenAI 表示,Astra 是目前最符合人类意图的模型。在一项测试模型是否会突破任务边界的评估中,GPT-5.6 Sol 在没有生产防护措施时越过授权范围的比例为 48%,而 Astra 为 0%。
这一变化与此前 AI 安全事件密切相关。
此前 OpenAI 测试中的 AI Agent 曾出现突破限制环境,并攻击 Hugging Face 相关系统的事件,引发行业对于 AI 自主行为边界的担忧。

Astra 发布时,OpenAI 试图证明它已经建立了更完善的安全机制。
但另一面的问题是,OpenAI 承认,测试显示 Astra 的文字推理过程相比 GPT-5.6 Sol 更难监控。究其原因,Astra 能够使用更少的文字步骤完成复杂任务。

商业化方面,Astra 也进入更高价格区间。
GPT-6 Astra 将首先向 OpenAI Daybreak 项目的部分企业用户开放,随后向 ChatGPT Plus、Pro、Business 和 Enterprise 用户开放,并通过 OpenAI API 和 AWS 提供服务。
API 定价为输入每百万 token 10 美元,输出每百万 token 50 美元,缓存读取和写入另有计费规则。同时,OpenAI 还提供 Fast Mode,可以将处理速度提升至标准模式的 2.5 倍,但价格也会上升至标准模式的两倍。

相比 GPT-5.6 Sol,Astra 的价格有了明显提升。
不过,OpenAI 认为,未来企业不会只关注 token 单价,而会关注完成一次任务需要付出的总成本。Greg Brockman 更是表示,AI 行业最终需要从「token 定价」转向「任务成本」衡量。
虽然 OpenAI 说 GPT-6 Astra 接近开启了 AGI 时代。但真正值得关注的,或许不是 AGI 这个标签,而是我们已经清晰地看到 AI 开始接近一种新的存在形态:
它不再等待人类拆解任务,而是开始理解目标、制定路径,并主动完成工作。
蒸汽机改变工业时代时,人们看到的是一台机器;互联网改变世界时,人们看到的是一张网络。只有多年以后,人们才意识到,它们改变的其实是整个社会运行方式。
从这个角度看,Astra 的意义并不只是一次模型升级。
当 AI 开始进入办公室、实验室和代码库,人类与机器的关系,也将迎来一次重新分工,届时我们也将需要重新思考自己的价值所在。
