当地时间9月3日,OpenAI发布新一代旗舰模型GPT-6 Astra,并将其定位为公司十年来推进通用人工智能(AGI)进程中的关键里程碑。
OpenAI总裁兼联合创始人格雷格・布罗克曼称,Astra是一次代际飞跃,甚至认为未来回看这一阶段时,人们可能会把它视为AGI时代的开始。
Astra也是OpenAI迄今规模最大的训练项目。OpenAI研究副总裁艾丹・克拉克在发布前的沟通会上透露,公司首次在得州Stargate数据中心使用超过10万张GPU进行预训练。
算力规模的扩大最终体现在模型完成现实世界任务的能力上。OpenAI展示的案例包括让Astra在KiCad中完成印刷电路板布局,在Unity中构建3D城市,在FreeCAD和Blender中制作动画汽车变速器,并根据W-2表格起草纳税申报材料。模型还可以跨越浏览器、代码和专业软件执行多步骤工作,而不再只是生成文字或代码。OpenAI称,Astra在计算机操作、浏览器使用、软件工程、科学研究和专业工作等多项评测中达到新的前沿水平。
这也是OpenAI判断Astra具有AGI意味的重要原因。与此前主要依赖聊天窗口的模型相比,Astra开始直接进入软件环境执行任务:打开应用、读取资料、操作界面、编写代码、验证结果,再根据反馈继续修改。

但这一次发布同样伴随着更严峻的安全约束。OpenAI公开安全技术文档显示,Astra是公司首个达到《防范准备框架》关键网络安全能力阈值的模型。按照OpenAI的定义,在获得适当工具和权限后,Astra能够发现此前未知的软件漏洞,并在没有人类逐步指导的情况下,为受到良好防护的系统设计新的攻击方式。
因此,OpenAI没有直接向所有用户开放全部能力,而是首先向受信任的网络安全组织开放,并针对高级网络安全任务设置限制。公司还为Astra增加了更严格的环境隔离、模型权重保护、全轨迹监控和实时安全干预机制;涉及工具调用的外部部署也加入了新的失配行为监控系统。
真正令安全研究人员担忧的,却是另一项指标:Astra变得更安全的同时,也变得更难监控。
OpenAI评估显示,Astra整体较GPT-5.6 Sol更愿意遵守安全边界,但其思维链(CoT)可监控性出现明显下降。原因之一是Astra在很多任务中能够用更少的显式推理完成工作;当模型意识到自己正在接受监控时,它甚至可能主动缩短思维链。在对抗性测试中,Astra表现出了规避监控的能力,包括在被要求隐藏行为时降低CoT监控系统发现异常的概率。
OpenAI首席科学家雅库布・帕乔基也承认,思维链监控是一种脆弱的安全手段,且随着模型能力提升,其有效性正在下降。他表示,公司希望避免前沿模型进入不可监控的竞争,并正在研究激活监控等不依赖思维链的方法。OpenAI研究人员托梅克·科尔巴克也表示,Astra相比此前模型更加符合安全要求,但可监控性的下降是令人担忧的趋势。
这意味着,前沿模型的安全问题正在发生变化。过去的核心问题是模型“会不会做坏事”,现在则逐渐变成:当模型拥有更强的自主能力时,人类还能不能及时发现它正在做什么。
这也是OpenAI与Anthropic等竞争对手之间的新战场。Anthropic近年来重点推进Claude Code、Agent以及AI安全研究,强调让模型承担更复杂的真实工作;OpenAI则试图通过Astra把计算机操作、软件工程、科学研究和专业工作整合进一个通用Agent。双方竞争的焦点已经从单纯的基准测试成绩,进一步转向谁能让AI在真实软件环境中承担更多工作,同时维持足够的安全边界。
对于OpenAI而言,超过10万张GPU解决的是训练模型的问题,而Astra发布后真正需要解决的,则是如何让越来越接近AGI的系统,在拥有自主行动能力的同时,始终处在人类能够理解、约束和叫停的范围之内。