GPT-6 Astra震撼发布,AGI评测基准或被误读
9月3日,OpenAI正式揭晓了新一代模型GPT-6 Astra及相关演示视频。该模型名称寓意为「星辰」,官方将其誉为「全球最聪明、最对齐的AI系统」。
本次发布采取分批推送策略,最初仅向特定机构开放,随后数日陆续覆盖ChatGPT Plus、Pro、企业及商务用户,并同步登陆OpenAI API与Amazon Bedrock平台。
价格调整成为本次更新的焦点。Astra API的输入端定价为每百万token 10美元,输出端则为50美元,较上一代GPT-5.6 Sol涨幅显著。系统还提供Fast模式,最快可达标准模式的2.5倍速度,相应价格也翻倍。据披露,全新模型Astra的训练依托位于德克萨斯州的Stargate设施,动用了逾10万块GPU,是OpenAI迄今规模最大的一次训练工程。
毫无疑问,Astra交出了一份耀眼的成绩单。抽象推理层面,ARC-AGI-3指标高达98.6%,通用任务表现优势突出。学术与数学维度,FrontierMath Tier 4取得97.6%,GPQA Diamond达96.0%,Humanity's Last Exam在工具辅助下为57.2%。电脑操作方面,OSWorld 2.0斩获72.6%,每个任务平均耗时约40分钟,比GPT-5.6 Sol少约47%。在Mind2Web测试中,GPT-6的任务完成速度是Sol的1.9倍。长上下文处理方面,在256K至512K区间的八针检索测试中获得满分。
此外,模型的应用场景进一步拓展。除游戏设计、科学研究之外,Astra已支持自主设计电路元器件,将电子原理图转化为可量产的PCB,加速硬件工程进程。其工作过程仿佛跳动的神经网络。
卓越的能力水平体现了OpenAI对新一代模型的倾力投入。OpenAI总裁Greg Brockman将Astra视为「通向AGI时代的一次代际跨越」。
人工智能的安全性同样值得关注。作为首款被OpenAI标注为关键级别的模型,新发布的系统已具备网络安全能力。测试中,Astra在无人引导的情况下自主识别出两个此前未公开的零日漏洞,涵盖浏览器与操作系统领域。经人类专家验证,其任意代码执行率约为39%,在ExploitBench上获得满分,SRE-Bench一次通过率达88.0%。
部分开发者与技术专家对OpenAI新模型的透明度表达了忧虑。对此,OpenAI首席科学家Jakub Pachocki回应称,尽管该模型的可监控性有所降低,但未来公司将借助延长思维链分析与激活监控等手段,强化模型思考过程的可解释性。
就在两天前,Anthropic刚发布了Claude Fable 5.1,其基础定价与Astra完全一致,同样为输入端每百万token 10美元、输出端50美元,与前代Fable 5持平。两大巨头正展开正面较量。
然而,真正的变革体现在缓存价格上。Fable 5.1的缓存读取由每百万token 1美元降至0.25美元,降幅达75%;五分钟缓存写入12.5美元,一小时缓存写入20美元;批处理再享五折优惠。综合计算,Anthropic估计典型负载较Fable 5便宜约25%,agentic场景最高可节省约45%。ARC Prize的独立测试也佐证了这一判断,主要原因在于token效率的提升。
Anthropic对本次发布的定位同样是「全球最先进的编程与知识工作模型」,并声称其研究能力「为AI如何助力科学进步提供了早期视角」。同样,OpenAI新模型Astra的部分强大能力也体现在科学研究场景中。
Anthropic与OpenAI的新模型发布均集中于9月初,两大AI巨头在数学、物理学、生命科学等科学研究领域也展开了激烈角逐。
斯坦福大学联合Terminal-Bench团队、Laude Institute及Harbor Framework推出了模型基准Terminal-Bench-Science 0.1。在这一面向真实科研场景的评测基准上,Astra相较于Fable 5.1表现领先。
两家公司的最新模型在AI4Science方向上均有所突破。
Astra据称优化了素数间隙(prime gaps)问题的一个数学结果,并在多个学科评测上刷新纪录,其电脑操作能力也可直接嵌入科研流程,包括数据处理、图表生成、软件安装与测试、质量检查等环节均可自动完成。
Anthropic的叙事则聚焦于「让科学家工作更高效」。6月30日发布的科研人员工作台Claude Science将文献分析到论文撰写的完整流程整合于同一环境,内置60余项预设技能与工具包,支持本地笔记本运行或按需调用GPU。
实际上,科研场景对可靠性的要求更为严苛。评测发现,Fable 5.1在与幻觉相关的指标上出现退步,在答错时更倾向于强行作答。同时,Fable 5.1在最高档位下较前代多消耗约1.7倍的输出token。
当前来看,若需要模型自主完成科研计算或推导任务,Astra在多数公开指标上领先;若需要嵌入实验室日常流程、可审计、可复现的工具链,Anthropic确实提供了更为完善的科研生态。
本次模型发布中,最广为流传的无疑要属「Welcome to AGI Era」(欢迎来到AGI时代)这一标语。该标语迅速与Astra在ARC-AGI-3测试中高达98.6%的表现关联起来。毕竟,上一代模型GPT-5.6在同类测试中的成功率仅为7.8%,与Claude Opus 5也拉开了显著差距。ARC-AGI-3究竟为何物?它能否决定性地证明我们已经步入通用人工智能时代?
ARC-AGI Evaluation是一种通过人类参与构建的模型测试基准,已经历两次迭代。ARC-AGI-1与ARC-AGI-2为静态题目,测试中给出彩色网格的输入与输出,模型直接预测答案。ARC Prize的评测政策明确规定,模型须作为「直接的输入到输出预测器」接受测试,不允许使用agent框架,禁止调用客户端工具,也不开放网络搜索以防题目泄露。这种严格的测试标准能有效衡量模型本身的基础能力。
ARC-AGI-3则更进一步。
它是一组交互式小游戏环境,考察模型在未知环境中的推理与适应能力。其预览版最早于2025年7月17日发布,逾1200名参与者游玩了3900余局。预览版发布期间,ARC Prize曾举办竞赛,12份参赛作品中,冠军agent StochasticGoose的效率仅为12.58%,其余介于2.24%至8.04%之间。彼时,预览版甚至存在设计缺陷,团队承认部分游戏「对随机搜索过于友好」,可被暴力破解。因此,正式版本采用200人以上的受控人类研究建立基线。ARC Prize招募约500名普通公众参与,按每90分钟115美元加每通关一局5美元的标准计酬。测试时不提供代码解释器与草稿纸,所有环境均经难度校准。
正式版本中,ARC-AGI-3主要考察模型四项能力:探索,即主动获取信息;建模,即把观察转化为可泛化的预测;目标获取,即在稀疏奖励下自主识别目标;规划与执行,即找到路径并在过程中持续纠偏。
测试中,模型被置于一个前所未见的环境,无说明、不告知目标,也不告知哪些操作对完成目标有效。于是,模型只能不断执行动作、观察反馈,理解游戏的类型与通关机制。ARC Prize将其定义为「首个衡量AI agent类人智能的交互式推理基准」。
它的价值在于填补了此前基准难以测量的能力缺口——模型首次接触陌生环境时的学习效率。传统基准衡量知识储备与推理能力,而ARC-AGI-3在设计上刻意规避可被暴力搜索或记忆覆盖的模式,使分数无法依靠扩充训练数据来刷高。
有一处机制容易被大众误解。ARC-AGI-3的计算不仅包含正确率,也涵盖动作效率。模型通过每一关的步数将对照人类基线进行衡量。因此Astra在ARC-AGI-3测试中取得98.6%的含义并非「全部正确」,而是每一局均通关,且效率不低于人类。
既然如此,Astra击穿ARC-AGI-3测试究竟意味着什么?
回溯ARC-AGI-3的三项成绩,不难发现Astra在不同环境中的成绩存在差异。
OpenAI官方引用的是其最高成绩,多数媒体则引用其在max推理档位的成绩。在更高推理档位中,模型成绩降低,但总成本也随之降低。至于标准harness测试中的62.7%,则在传播中基本被忽略。
Provider Adapter采用的是OpenAI的Responses API通道,相较标准harness改动了两处设置:retained reasoning与compaction。Retained reasoning指跨请求保留模型的私有推理状态,模型推理时上一步的思路可延续至下一步。当上下文超过约17.5万字符时,模型可对其进行压缩形成摘要。两者共同构成模型思考任务时的连贯思绪。
将上述因素综合考量,GPT-6 Astra的高分至少包含三层含义。
首先,能力的提升确实显著。Astra在harness与效率测试中使用的动作数低于人类基线。在Provider Adapter条件下,Astra在96.0%的关卡中使用的动作数少于人类基线,平均每关少用51.7%的动作。据ARC Prize评价,该模型「构建出了我们见过的对新环境最精确的模型」。
其次,分数不再单纯代表模型本身。从这一代基准开始,ARC-AGI-3的成绩是「模型加外层框架」的联合产物。虽然专门为获取高分而定制的harness不被允许,但一般用户可使用的API设置均可接受。也就是说,该测试更考验模型的基础性能与集成能力。
最关键的是,该分数不足以支撑「AGI时代已经到来」的论断。ARC Prize在分析Astra的文章中明确指出,基准测评成绩达到99.9%甚至100%「并不代表证明达成了AGI」,但肯定了Astra代表着大模型在泛化能力上取得了实质性进展。并且,无法用单一测评基准衡量人工智能的整体表现,Astra在其他评测基准上仍有提升空间。
此外,将该指标解读为「Astra在ARC-AGI-3上大幅领先Claude Fable 5.1」也不准确,Fable 5.1在该基准上其实没有成绩。至于Fable系列缺席的原因,在于Anthropic对Mythos级模型采用的数据留存条款,使得当时无法在保证测试数据不外泄的前提下进行成绩核验。截至目前,除GPT-6 Astra、GPT-5.6 Sol、Claude Opus 5的测试成绩外,尚未见到其他模型在ARC-AGI-3测试中的表现。
模型越来越强,但AGI真的来了吗?
可以肯定的是,Astra是一次大模型的明显飞跃,也向我们展示了未来的想象空间。人类坐在大屏幕前,言语之间,任务便下达给大模型。当自动执行取代人类的脑力劳动、解放双手,或许我们能更好地利用时间去从事科学研究、打网球、设计游戏...... 随着OpenAI和Anthropic大模型的竞相发布,迈向AGI的时代或许真的不再遥远。