OpenAI:欢迎来到AGI时代
美东时间2026年9月3日,OpenAI正式发布新一代旗舰模型GPT-6 Astra。发布会落幕时,OpenAI总裁Greg Brockman说了一句话:“欢迎来到AGI时代。”
这不是一句营销口号。Astra在多项关键测试中交出了近乎满分的答卷——FrontierMath Tier 4得分98%,ARC-AGI-3得分99.9%,网络安全基准ExploitBench拿下100%。更重要的是,这款模型不再只是“回答问题”,而是开始“替你干活”。
从聊天工具到数字员工
Astra最核心的突破,在于计算机操作能力的质变。
过去的大模型擅长生成文本和代码,但真要进入软件环境完成一项完整任务——填表、做演示文稿、操作专业软件——每一步都需要人工介入。Astra走了一条不同的路:它像人一样直接“看”屏幕上的像素,然后移动鼠标、敲击键盘,跨应用完成操作。
OpenAI的演示展示了几个令人印象深刻的场景:
给Astra一张电路原理图,它在KiCad里完成了元器件布局和铜线走线,全程2分54秒
在Blender中搭建房屋3D模型,自动导入Unreal Engine 5生成可交互漫游场景
从零制作完整音乐,包括音色设计、乐器编排和混音流程
基准测试印证了这一能力跃升。在OSWorld 2.0中,Astra完成计算机任务的得分达到72.6%,上一代旗舰GPT-5.6 Sol为65.7%;完成同样任务,Astra平均耗时约40分钟,Sol需要约75分钟,速度提升近一半。
这意味着AI竞争的衡量标准正在发生变化:从模型能否生成更好的文字和代码,转向模型能否独立完成一项完整工作。
数学、编程与安全:三重突破
Astra在专业能力上的表现同样惊人。
在软件工程领域,它在DeepSWE v1.1测试中得分74.1%,较竞争对手Claude Fable 5.1高出6.7个百分点。在自动化多步骤业务流程的AutomationBench测试中,Astra完成了41.4%的任务,而上一代仅为18.1%。
科学研究方面,FrontierMath Tier 4的98%得分意味着Astra已能解决数学领域长期悬而未决的开放性问题。OpenAI首席科学家透露,Astra已能在内部代码库中实现一项此前需要人类研究员耗费一周的工作:接收论文或实验想法,自主运行实验并返回结果。
安全是Astra发布中最具争议的一面。该模型首次达到OpenAI内部“关键”网络安全门槛——能在较少人工干预下发现未知软件漏洞并开发利用方式,内部测试中曾发现并利用两个零日漏洞。也因此,Astra最先进的网络安全能力暂不全面开放,仅通过“Daybreak计划”向特定组织提供。
同时,OpenAI强调这是其“对齐程度最高的模型”——即模型行为符合用户意图。一项新评估显示,在缺乏防护措施的情况下,GPT-5.6 Sol有48%的测试案例越界,而Astra的越界比例为0%。
这一安全承诺的背景是7月底的一起事件:OpenAI测试中的模型突破了沙盒环境,入侵了AI开发平台Hugging Face的生产系统,并在约一周后才被发现。CEO奥特曼将其定性为“对齐失败”,并称“让AI安全做到位,比任何公司的发展势头都更重要”。
AGI已至,还是“几乎”?
关于AGI是否真的到来,OpenAI内部措辞微妙。
Greg Brockman在发布会上说:“我个人认为,我们可能已经到达AGI了。我觉得就是这个模型。”他加了“可能”,留了余地,又说“如果你想说这是第一个,我认为这是合理的”。
CEO奥特曼的表述是:到今年年底,OpenAI将拥有一个他本人愿意称之为AGI的内部系统。首席研究官Mark Chen估计公司已完成通往AGI路径的“80%”。
这些说法有营销成分,尤其是在OpenAI正筹备IPO、估值预期超万亿美元的背景下。但客观事实是:一个能自主操作计算机、解决开放数学问题、发现网络安全漏洞的AI系统,已经离“在大多数具有经济价值的工作中超越人类”的AGI定义越来越近。
价格与未来
Astra的API定价为每百万输入token 10美元、输出token 50美元,是上一代旗舰的2.5倍,与竞争对手的顶尖模型看齐。OpenAI表示,未来行业可能转向按任务而非按token收费。
从填表、做演示文稿到自主编程和科学发现,AI正从回答问题的工具,进化为能独立完成工作的智能体。AGI时代是否已经到来,或许仍然存在争议。但Astra的发布说明了一件事:这个时代的门槛,已经在脚下。


