OpenAI正式发布新一代多模态智能体模型GPT-6 Astra,聚焦编程、专业工作流与图形界面交互任务,支持跨上下文状态保留与屏幕级问题诊断。该模型最初仅向部分组织开放,目前正逐步向ChatGPT Plus、Pro、Business和Enterprise用户,以及OpenAI API、Microsoft Azure和AWS Bedrock用户推出。

Astra将OpenAI的模型能力从生成响应扩展到直接在软件中执行多步骤任务,能够与图形界面交互,完成填写表单、更新CRM记录、开展研究、创建网站、分析数据、安装测试软件以及排查屏幕可见问题等操作。在OSWorld 2.0测试中,OpenAI报告其得分达72.6%,高于GPT-5.6 Sol的65.7%。

编程是本次发布的另一重点。Astra在Terminal-Bench 4.0上得分57.9%,在DeepSWE v1.1上得分74.1%。该模型还在Codex中引入实验性上下文机制,使智能体可在不同上下文窗口之间保留笔记,此前窗口仍可搜索,便于长时间编程任务中检索早期需求、测试结果与工具输出。在MRCR评估中,其支持长达100万令牌上下文,512K至1M区间得分96.3%。

安全方面,按OpenAI Preparedness Framework,Astra成为首个被归类为“关键网络安全能力”级的模型。OpenAI称,在未启用生产环境防护的测试中,该模型发现并利用了此前未知的漏洞。生产版本已限制高级攻击任务,并计划通过Daybreak计划提供更广泛的防御能力。此外,Astra内部评估幻觉率为4.2%,低于GPT-5.6 Sol的12.2%。

英伟达首席执行官黄仁勋在评论中表示,GPT-6 Astra在10万多块NVIDIA Grace Blackwell NVLink72上完成训练,从ChatGPT到o1再到Astra仅用4年,接下来将有40万块GPU投入使用。Astra的竞争对手包括Anthropic Claude Fable 5.1和谷歌Gemini 3.8 Flash等模型,各方在不同任务中表现互有领先。