说实话,现在大模型更新实在太快,我一开始也没太当回事。无非又是跑分涨一点、代码强一点、上下文再长一点,然后各家轮流坐几天世界第一的椅子。
结果把OpenAI这次放出来的资料看了一遍,我发现不太对。
操作电脑、办公、编程、科研、安全能力几乎一起往前拱了一截。OpenAI自己给它的评价也非常简单:目前最智能、最对齐的模型。
01 GPT-6 Astra基本信息
GPT-6 Astra在API里的型号就是gpt-6-astra,上下文窗口达到105万Token,最大输出128K。API标准价格是每百万Token输入10美元、输出50美元。
目前也不是所有人打开ChatGPT就能看到。OpenAI先给部分机构开放,接下来几天会陆续推送给Plus、Pro、Business、Enterprise用户,同时进入API、Azure和AWS Bedrock。Pro、Business和Enterprise还会拿到Astra Pro。
02 目前最强的操作电脑模型
“The world’s best computer use model。”
以前AI想替你干活,最好软件先有API、MCP,大家把接口接好,它在底下跑。
现在Astra开始走另外一条路:没有接口?那我直接看屏幕自己点。
填网页表单、改CRM、整理日历、网上查资料、做Excel、写文档、测试网站,甚至安装软件以后自己排查问题,它都已经开始能做。OSWorld 2.0做到72.6%,上一代GPT-5.6 Sol是65.7%,而且完成同类任务的模拟时间从75分钟压到了40分钟左右。
03 ARC-AGI-3到了99.9分
上一代GPT-5.6 Sol在ARC-AGI-3上的成绩只有7.8%,Astra直接干到接近满分。ARC Prize Foundation甚至表示,Astra在96%的关卡上超过了他们的人类行动效率基线,在这项测试上基本达到人类水平。
ARC-AGI比较特别,它不是问AI几个知道答案的问题,而是把它扔进一个陌生环境,不给说明书,让它自己试错、找规律,再想办法把任务完成。
所以99.9%不能简单理解成“AI已经有99.9%的人类智力”,这么说肯定扯远了。
但从7.8%直接蹦到99.9%,还是让我看了好几眼。
以前AI最让人着急的地方之一,就是换个没见过的场景突然开始犯傻。现在这一块,也正在被快速补上。
04 审美和判断力都变强了
以前GPT做PPT、文档、网站,内容可以,审美嘛……很多时候确实一言难尽。
Astra这次专门加强了所谓的视觉判断力。OpenAI强调,它能按照你原来的模板去做PPT、表格和文档,尽量保持原有版式、写作风格和视觉体系,而不是每次给你重新整一套“AI风”。
另外一个变化更有意思:它开始知道什么时候应该自己决定,什么时候应该回来问你。
现实里老板给员工派活,哪有谁写2000字Prompt?通常就一句:“明天开会的东西帮我准备一下。”
太笨的Agent会屁大点事都问你,另一种则是什么都不问,埋头干半天最后给你整一坨大的。
Astra现在会自己补普通信息,但碰到真的会影响结果的决定,它才回来问你;在Codex里,甚至可以一边等你回复,一边把不受影响的部分继续干。
这个能力看起来不起眼,但真当过老板的人应该知道,这种员工其实挺贵的。
05 第一个达到Critical网络安全等级的模型
GPT-6 Astra是OpenAI第一个达到Critical网络安全能力等级的模型。ExploitBench直接做到100%,而GPT-5.6 Sol是78.5%。更夸张的是,OpenAI说在评测过程中,Astra还发现并利用了两个此前未知的零日漏洞,目前已经向维护方披露。
但一个会操作电脑、会写代码、会找漏洞、还能自己连续推进任务的Agent,如果跑偏了,那就是另外一个故事了。
所以OpenAI这次也在拼命给它加护栏。在这个专门测试模型会不会越过授权范围的评测里,GPT-5.6 Sol在48.2%的测试中越过了授权目标,
写在最后
但这次看完以后,我确实有一种很明显的感觉:我们以前衡量AI,总是在问“这个问题它会不会回答”。
这两个问题,看起来只差几个字,背后其实完全不是一个时代。
也许AGI根本不会像电影里那样,某天凌晨突然出现,然后全世界收到通知: