独立站Jason
行业资讯

“AGI时代真的来了?”GPT-6 Astra正式发布,全面解析和使用指南来了!

2026年9月4日 Jason0127
今天凌晨,GPT-6 Astra正式发布了。

说实话,现在大模型更新实在太快,我一开始也没太当回事。无非又是跑分涨一点、代码强一点、上下文再长一点,然后各家轮流坐几天世界第一的椅子。
图片
结果把OpenAI这次放出来的资料看了一遍,我发现不太对。
ARC-AGI-3:99.9%。
ExploitBench:100%。
操作电脑、办公、编程、科研、安全能力几乎一起往前拱了一截。OpenAI自己给它的评价也非常简单:目前最智能、最对齐的模型。
更狠的是,这次已经不只是“回答问题更聪明”。
它开始越来越像一个真的能把活接过去的人了。

01 GPT-6 Astra基本信息

先把基本信息过一遍。
GPT-6 Astra在API里的型号就是gpt-6-astra,上下文窗口达到105万Token,最大输出128K。API标准价格是每百万Token输入10美元、输出50美元。
目前也不是所有人打开ChatGPT就能看到。OpenAI先给部分机构开放,接下来几天会陆续推送给Plus、Pro、Business、Enterprise用户,同时进入API、Azure和AWS Bedrock。Pro、Business和Enterprise还会拿到Astra Pro。
参数看完其实还好。
真正离谱的东西,都在后面。

02 目前最强的操作电脑模型

这次OpenAI直接把Astra叫做:
“The world’s best computer use model。”
以前AI想替你干活,最好软件先有API、MCP,大家把接口接好,它在底下跑。
现在Astra开始走另外一条路:没有接口?那我直接看屏幕自己点。
图片
填网页表单、改CRM、整理日历、网上查资料、做Excel、写文档、测试网站,甚至安装软件以后自己排查问题,它都已经开始能做。OSWorld 2.0做到72.6%,上一代GPT-5.6 Sol是65.7%,而且完成同类任务的模拟时间从75分钟压到了40分钟左右。
这个变化说白了特别简单。
以前你问AI:
“这个东西怎么弄?”
它给你写一篇教程。
以后你可能直接说:
“这个东西你帮我弄完。”
然后它自己动手。
我觉得这才是这代模型真正开始变味的地方。

03 ARC-AGI-3到了99.9分

然后就是这次最炸裂的数字:
99.9%。
上一代GPT-5.6 Sol在ARC-AGI-3上的成绩只有7.8%,Astra直接干到接近满分。ARC Prize Foundation甚至表示,Astra在96%的关卡上超过了他们的人类行动效率基线,在这项测试上基本达到人类水平。
图片
ARC-AGI比较特别,它不是问AI几个知道答案的问题,而是把它扔进一个陌生环境,不给说明书,让它自己试错、找规律,再想办法把任务完成。
所以99.9%不能简单理解成“AI已经有99.9%的人类智力”,这么说肯定扯远了。
但从7.8%直接蹦到99.9%,还是让我看了好几眼。
这多少有点不讲武德。
以前AI最让人着急的地方之一,就是换个没见过的场景突然开始犯傻。现在这一块,也正在被快速补上。

04 审美和判断力都变强了

这部分我反而觉得可能是大家以后天天能用到的。
以前GPT做PPT、文档、网站,内容可以,审美嘛……很多时候确实一言难尽。
Astra这次专门加强了所谓的视觉判断力。OpenAI强调,它能按照你原来的模板去做PPT、表格和文档,尽量保持原有版式、写作风格和视觉体系,而不是每次给你重新整一套“AI风”。
另外一个变化更有意思:它开始知道什么时候应该自己决定,什么时候应该回来问你。
现实里老板给员工派活,哪有谁写2000字Prompt?通常就一句:“明天开会的东西帮我准备一下。”
太笨的Agent会屁大点事都问你,另一种则是什么都不问,埋头干半天最后给你整一坨大的。
Astra现在会自己补普通信息,但碰到真的会影响结果的决定,它才回来问你;在Codex里,甚至可以一边等你回复,一边把不受影响的部分继续干。
说人话就是:
小事自己处理,大事知道找老板。
这个能力看起来不起眼,但真当过老板的人应该知道,这种员工其实挺贵的。
图片

05 第一个达到Critical网络安全等级的模型

最后一个能力,就开始有点吓人了。
GPT-6 Astra是OpenAI第一个达到Critical网络安全能力等级的模型。ExploitBench直接做到100%,而GPT-5.6 Sol是78.5%。更夸张的是,OpenAI说在评测过程中,Astra还发现并利用了两个此前未知的零日漏洞,目前已经向维护方披露。
这时候问题就来了。
一个只会聊天的AI胡说八道,最多把你气一下。
但一个会操作电脑、会写代码、会找漏洞、还能自己连续推进任务的Agent,如果跑偏了,那就是另外一个故事了。
所以OpenAI这次也在拼命给它加护栏。在这个专门测试模型会不会越过授权范围的评测里,GPT-5.6 Sol在48.2%的测试中越过了授权目标,
而Astra是0%。
有点像请了一个武功越来越高的高手回来。
以前你担心他能不能打。
现在你更关心:
这哥们到底听不听话。
图片

写在最后

所以,GPT-6 Astra是不是AGI?
我现在还不敢直接拍桌子说:就是它了。
但这次看完以后,我确实有一种很明显的感觉:我们以前衡量AI,总是在问“这个问题它会不会回答”。
现在正在慢慢变成:
“这件事情,我能不能直接交给它?”
这两个问题,看起来只差几个字,背后其实完全不是一个时代。
也许AGI根本不会像电影里那样,某天凌晨突然出现,然后全世界收到通知:
“各位,AGI今天正式到了。”
#GPT6 #GPT6Astra #ChatGPT #OpenAI #AGI
#人工智能 #AI #AIAgent #大模型 #科技