OpenAI重磅推出GPT-6 Astra,自诩全球最强智能对齐模型,多项能力刷新业界标杆
"地表最强模型"的宝座,不到两天时间便再次易主。
北京时间周五凌晨,OpenAI正式推出GPT-6 Astra,并将其定位为"当下全球最聪明、且对齐水平最高的模型",在电脑操作、网页浏览、软件开发、网络安全、科研探索及专业任务等维度均跻身当前顶尖阵营。
从测评数据来看,这一代模型在某些领域的跨越,已难以用"小幅迭代"加以概括。
在反映高阶数学水准的FrontierMath Tier 4测试中,Astra斩获97.6%的成绩,几乎将这套研究级数学题库"彻底攻克";在侧重陌生环境学习与抽象推理的ARC-AGI-3上,其得分更是从GPT-5.6 Sol的7.8%大幅跃升至99.9%,逼近满分。
相较于数学与抽象推理,Astra在网络安全领域的飞跃更具现实冲击力。在衡量漏洞利用水平的ExploitBench中,Astra得分达到100%,而GPT-5.6 Sol仅为78.5%;在专门借助2026年6月至8月新漏洞搭建的测试中,Astra的成功率攀升至39%,远超Sol的5.5%。
Astra也是OpenAI迄今为止对齐程度最深的模型,在洞悉用户意图与规范自身行为方面均取得显著突破。
OpenAI指出,公司参考近期Hugging Face事件专门设计了一项全新评估,专门考察当模型遭遇极端困难、甚至难以胜任的任务时,是否会为完成任务而擅自越过用户授权红线。
在缺乏生产环境安全防护的条件下,GPT-5.6 Sol有48%的概率会突破授权目标,而GPT-6 Astra的这一比例降至0%。
GPT-6 Astra在计算机操控能力上同样完成了明显跃迁。
OpenAI介绍,Astra能够直接处理一系列以往依赖人工完成的软件任务,包括在线表单填写、CRM客户记录更新、日程安排、在线调研及摘要生成,还能完成科学数据分析、图表制作、网站搭建与前端QA检测,甚至可以自主完成软件安装与测试、依据屏幕反馈排查故障。
在多项计算机操作与专业工作流基准测评中,Astra均斩获领先成绩。
OpenAI表示,GPT 6 Astra操控计算机的能力可延伸至各领域的产出,涵盖但不限于将电子原理图转化为可制造的PCB、以约人类冠军选手四倍的速度完成金融建模世界杯赛题、借助Unity进行游戏场景搭建等。
在另一些案例中,GPT-6 Astra可以先在Blender内完成房屋建模,再将其转换为"虚幻5"引擎内可自由漫步体验的场景,协助设计师和客户在项目实际落成前,提前感知空间布局并沉浸式体验整体空间。
该模型还能凭借生动的画面、引人入胜的玩法与精准的动作表现,让毫无技术背景的开发者仅用数分钟便打造出一款小游戏。
对大多数ChatGPT用户来说,可能还需数日方能亲身体验GPT-6 Astra。
公告显示,GPT‑6 Astra今日起面向参与网络安全项目Daybreak的部分企业开放,随后将于"未来数日"内向全部ChatGPT订阅用户推送,同时还会通过自营渠道与亚马逊云服务提供API调用。此外还设有一档GPT-6 Astra Pro模型,仅向ChatGPT Pro及企业订阅用户开放。
一旦Astra在API中可用,其定价将为每百万输入词元10美元,每百万输出词元50美元。尽管与Anthropic 对Fable 5.1 的定价持平,仍是GPT-5.6 Sol(当前处于促销期)的2.5倍。Astra还将推出一种"快速模式",处理速率最高可达标准模式的2.5倍,价格相应翻倍。
值得一提的是,在正式发布前举办的媒体吹风会上,OpenAI总裁格雷格·布洛克曼对Astra的价值给出了更具象征意味的判断。尽管他承认,AGI(通用人工智能)至今仍是一个"灰色、模糊的范畴",但未来回望时,人们或将把Astra视作AGI时代启幕的标志性模型。
布洛克曼表示:"我认为,现在认为我们已经迈入AGI时代,并不是一种不合理的判断。"
当被问及OpenAI是否正式宣告实现AGI时,布洛克曼称,AGI如今已不再与某项合同触发条件直接绑定(此处指OpenAI此前与微软之间的协议),更多是一种"使命层面的概念,或者说精神层面的概念"。
他进一步阐述:"我还是把这个问题留给读者自行判断,看这是否符合他们心目中AGI的标准。就我个人而言,我确实认为我们已经抵达这一阶段,而且有相当充分的理由支撑这一判断。但再次强调,我认为这是一段旅程的起点,而非终点。"
在吹风会临近尾声时,布洛克曼以一句更具宣示意味的话语收尾:"欢迎来到AGI时代。"