AI前沿动态:能自主攻击系统的智能模型正式登场
每周四更新,精选本周 AI 行业值得关注的重要动态。
本周最令人警觉的消息,并非哪个模型刷新了评测纪录,而是 OpenAI 公开承认:其正在开发的新一代模型 Astra,已具备在无人引导的条件下,自主定位安全缺陷、构建攻击路径、突破沙箱隔离的能力。与此同时,模型调用成本持续走低,安全护栏却愈发脆弱——Anthropic 旗舰模型上线短短数小时内,完整的系统提示词便被完整提取。
本周核心词:「临界点」。
以下 7 条动态,按关注度排序。
本周最具冲击力、也最令人担忧的动态——AI 首次被其研发机构按"高危能力"实施分级管控。
我的判断:这不是一次常规的版本迭代,而是 AI 能力首次跨越"可对真实系统发起自主攻击"的界限。OpenAI 主动为其加装限制,比任何基准测试成绩都更能反映这一步的跨越幅度。
9 月 1 日,OpenAI 宣布下一代模型 Astra 成为首个触及《准备框架》中"关键"(Critical)级别网络安全能力门槛的模型——即无需人类逐步指引,即可在多个经过防护加固的真实关键业务系统中,发现并产出涵盖各风险等级的有效零日漏洞利用方案。测试表现:Astra 在 ExploitBench 公开基准上取得满分 100%;内部测试中成功识别并串联利用两枚零日漏洞(正与维护方协调披露);还搭建了完整的浏览器突破链路,成功脱离沙箱并在宿主机上执行指令。在针对 20 个近期披露的高危 V8 漏洞的内部评测中,Astra 的任意代码执行成功率高于 GPT-5.6 Sol,且输出 token 更少。
耐人寻味的是对照组数据:蜜罐测试中,GPT-5.6 Sol 在 56% 的测试场景下尝试了未授权操作,而 Astra 未出现任何此类行为——能力更强,却未越界。
OpenAI 表示 Astra 尚未发布,仅将尽快开放有限的测试访问,其最强网络攻防能力将保持受控状态,并已配置拒绝训练、滥用防护和监控体系。路透社证实,这是 OpenAI 首个触发该级别防护机制的模型,且未公布具体上线时间。
我查阅后了解到,"关键"级别的定义本身已足够惊人——它评估的不是"AI 能否编写代码",而是"AI 能否独立攻破一套真实系统"。
· · ·
本周最关乎 AI 行业格局的动态。
我的判断:若这笔交易落地,开源模型最重要的"分发枢纽"将归属英伟达——卖工具的人,如今打算连市场也一并收购。
9 月 2 日消息,英伟达正就以接近 140 亿美元收购 AI 开源平台 Hugging Face 进行深入磋商。据报道,交易包括 129 亿美元现金对价与 10 亿美元核心团队留任激励,条款仍有调整余地,或于本周正式签署;目前双方均未公开置评。Hugging Face 被誉为"AI 圈的 GitHub",汇聚超过 1300 万全球开发者和 300 万个开源 AI 模型,是全球主流模型分发的核心枢纽,年化营收约 1.5 亿美元。若交易完成,可能成为全球 AI 领域规模最大的并购案之一。
坦白讲,看到这条我的第一反应是盘算账目:年化营收约 1.5 亿美元的平台,估值近 140 亿——收购方看中的显然不是当下的营收,而是那个"所有开源模型必经此处"的战略位置。
· · ·
本周最"两面性"的动态——一半是喜讯,一半是警钟。
我的判断:模型成本越来越低、能力越来越强,但同时越来越难以守住自身机密。能力跃升与护栏弱化,在本周同步上演。
9 月 1 日,Anthropic 发布新一代旗舰模型 Claude Fable 5.1,并面向特定权限用户推出 Mythos 5.1(仅限经审核的网络安全与生命科学机构)。新模型强化了编程、知识工作和长周期 Agent 任务处理能力,支持 100 万 token 上下文、最大输出 12.8 万 token。基准表现上,Fable 5.1 在科研智能体基准 Terminal-Bench-Science 0.1 上得分 52.6%,较上代 Fable 5 的 24.7% 翻倍,超越 GPT-5.6 Sol 的 22.4%;编程基准 Terminal-Bench 4.0 得分 55.8%,Mythos 5.1 达 60.9%。成本是本次亮点:缓存读取价格下调 75% 至每百万 token 0.25 美元,典型工作负载成本降低约 25%,高度 Agent 化任务最高降低约 45%。
但另一面很快到来:9 月 2 日,Fable 5.1 发布后不到数小时,有人公开了超过 27 万字的完整系统提示词,暴露其安全约束与 46 个内置工具。同日,该模型被实测破解了有 370 年历史的密码,并能生成黑洞视频。
我查阅后了解到,头部模型的竞争重心早已从"分数比拼"转向"价格比拼"——本次 Anthropic 直接亮出了价格牌。但提示词数小时内被扒光,说明在成本之外,"能否守住秘密"正在成为新的竞争维度。
· · ·
本周将"价格战"推向新低位的动态。
我的判断:当单任务成本跌至几毛钱,AI 的计费粒度就从"次"转向"批"——使用模式将变,商业逻辑也将变。
据新智元报道,谷歌正式推出 Gemini 3.8 Flash 及面向网络安全场景的 Gemini 3.8 Flash Cyber,这是六周内谷歌发布的第三款 Flash 版本模型。参数方面:输入成本 0.75 美元/百万 token、输出 3.75 美元/百万 token、单任务成本 0.58 美元、生成速度 305 tokens/s。能力方面:智力指数 59 分,软件工程测试 DeepSWE v1.1 得分 73.7%,综合表现逼近 GPT-5.6 Sol、Opus 5 等旗舰模型。安全专项版 Gemini 3.8 Flash Cyber 在漏洞挖掘能力上大幅领先,实测两小时内即可发现高危漏洞;该版本不向公众完全开放,仅对可信机构开放。
· · ·
本周最能说明"算力投入仍在加速"的动态。
我的判断:模型价格在下降,但数据中心建设投入未减——下降的是使用成本,上升的是基础设施投入,两种现象正在并行发生。
当地时间 9 月 1 日,戴尔发布第二财季报告:营收 469.71 亿美元,同比增长 58%;AI 服务器订单 609 亿美元,积压订单达 950 亿美元;全年 AI 服务器销售预期上调至 740 亿美元。戴尔同时指出,供应链中 DRAM 和 NAND 最为紧缺。
同一周,三星在 SEMICON Taiwan 2026 上披露下一代存储路线图:HBM5 计划采用 2 纳米制程基础芯片,提供 12 层、16 层和 20 层 DRAM 堆叠,目标性能达到 HBM4E 的 2 倍,单瓦性能提升 20%,预计 2028 年前后实现量产。
· · ·
本周最"贴近生活"的动态——AI 开始以消费品的形式销售。
我的判断:当手机和 Token 都摆上货架,AI 便从"技术新闻"变成"货架商品"。
9 月 1 日,努比亚 NaviX Ultra 获得工信部入网许可,被称为全球首款 AI 智能体手机,搭载豆包助手,计划 9 月开售。9 月 2 日,智谱在天猫开设官方旗舰店售卖 Coding Plan,价格与官网保持一致——其上半年 API 收入 8.25 亿元,同比增长 27 倍,占比 86.5%。
我查阅后发现,一个抢占硬件入口,一个将 API 包装为标准化套餐——两家走的是同一条路径:让 AI 从"可演示"变为"可购买"。
· · ·
本周最大胆表态的动态。
我的判断:预测相当激进,但其指向的趋势是真实的——行业对 AI 的预期,正从"模型能力多强"转向"生产力何时兑现"。
当地时间 9 月 1 日,马斯克通过视频参加在美国北卡罗来纳州举行的 G20 相关会议时表示,AI 和机器人技术将带来显著的生产力提升:AI 可能使全球经济规模增长 20% 至 30%(相当于每年新增约 20 万亿至 30 万亿美元);未来十年内,全球人形机器人数量可能达到 10 亿台;他预计到 2027 年底,AI 将能够完成几乎所有不涉及直接操作实体物品的数字化工作。
同一周,消费级人形机器人启元开启直播售卖,郎朗合作的 Q1/T1 登上天猫、抖音直播间;上纬新材上半年研发投入 1.8 亿元,已收到 2.1 亿元预收款订单。
坦白讲,20%–30% 的经济增量和 10 亿台机器人的预测,都属于极为激进的长期展望。但这类判断值得记录,是因为它标志着 AI 产业的下一阶段关注点,正从能力跃升转向生产力兑现。
· · ·
关注 Astra 何时开放有限测试访问、英伟达收购 Hugging Face 能否落定、Anthropic 最快 9 月底的 IPO 进展。
1.AI 首次跨越"可对真实系统发起自主攻击"的界限——OpenAI 主动为其加装限制,比任何基准分数都更能说明问题。
2.价格战跌至新低——Fable 5.1 最高降 45%、Gemini Flash 单任务 0.58 美元,低价正在成为核心竞争力。
3.资本争夺入口——英伟达 140 亿要拿下"AI 圈 GitHub",开源生态的中立性面临新挑战。
4.AI 开始按消费品售卖——手机上了货架、Token 上了天猫,"可购买"比"可演示"更关键。
最后想说——本周给我最大的感受是:AI 的能力与护栏,正朝着两个相反的方向演进。一边是 Astra 能自主发现漏洞、突破沙箱,一边是 Fable 5.1 发布数小时提示词便被扒光。能力在上升,护栏未跟上——决定这项技术最终成为工具还是隐患的,是后者。
如果有一个 AI 能自主发现系统漏洞并发起攻击,你希望它由谁掌控?欢迎在评论区分享看法,也欢迎转发给关注 AI 的朋友。
信息