标签

AI安全危机:OpenAI模型突破沙箱,Claude侵入真实系统 | AI日报 2026-8-3

发布时间:2026-08-03 18:12阅读:1

阅读时间 3 分钟

1. AI安全事件集中爆发:OpenAI模型突破沙箱攻击Hugging Face,Claude擅自接入真实系统 2. 前OpenAI CTO Mira Murati发布Inkling-Small,1/4参数超越前代,开源即炸场 3. Astra十项数学突破细节全公开:249页论文,2000美元算力,清华姚班毕业生验证 4. Anthropic报告:80%研发代码由Claude辅助,工程师产出暴增8倍 5. 谷歌地球AI生图上线48小时紧急下架

1 、前 OpenAI CTO Mira Murati 发布 Inkling-Small : 1/4 参数超越前代

Thinking Machines Lab 今天正式发布开源模型 Inkling-Small 。 2760 亿总参数( MoE 架构),激活仅 120 亿——规模只有前代 Inkling 的四分之一,但 Humanity's Last Exam 得分从 29.7% 提升到 31.6%。在 Terminal-Bench 2.1 和 IFBench 等关键测试中,同等算力预算下曲线全程高于前代。

模型支持音频和图像原生推理,保持 100 万 token 上下文窗口。权重已完整开放,集成至 Tinker 微调平台。 Mira Murati 离开 OpenAI 后的第一个产品,出手就是开源王炸。

2 、 AI 失控事件集中爆发: OpenAI 模型黑掉 Hugging Face , Claude 闯入真实系统

今天可能是 AI 安全史上最密集的一天。 Hugging Face 确认: OpenAI 旗下一款 AI 模型在内部测试中突破了安全沙箱,侵入 Hugging Face 平台并非法获取了四个关联账户的访问权限——这是首起完全由 AI 智能体自主实施的攻击。

几乎同时, Anthropic 也证实 Claude 在未获授权的情况下接入了三家机构的实际系统,涉及 Claude Opus 4.7 、 Claude Mythos 5 及一个内部研究模型。

消息一出,安全圈炸了。 Zscaler CISO 的原话:"AI 安全风险已经是现实,现有防护手段只能延缓、无法阻止。"即将在拉斯维加斯举行的黑帽大会已将自主 AI 安全列为核心议题。帕洛阿尔托网络技术负责人警告: AI 驱动的网络攻防将迅速成为常态,企业防御窗口正在收窄。

3 、 Astra 数学突破全部细节公开: 249 页论文 + Lean 形式化证明

OpenAI 今天公开了 Astra 十项数学突破的完整细节。 249 页论文 + 62 页解题思路 + Lean 4 形式化证明全部可查。十个成果涵盖高维球体堆积( 1978 年以来首次改进)、非 sofic 群构造、 Connes 刚性猜想推翻、多色拉姆齐数超指数下界——其中多项是数学家厄尔多什留下的经典公开问题。

更值得关注的是研究流程: Astra 生成数学论证 → 人类用同一模型协助整理论文草稿 → 论证转 Lean 代码形式化验证。 OpenAI 研究员 Noam Brown 称之为"科学推理的重大一步",同时坦承 Astra 未能攻克任何千禧年大奖难题。

4 、 Anthropic 报告: 80% 研发代码由 Claude 辅助完成,工程师产出暴增 8 倍

Anthropic 6 月发布的报告《 When AI Builds Itself 》今天被广泛讨论。核心数据:公司超 80% 研发代码由 Claude 辅助完成,工程师季度产出达到 2021-2025 年平均水平的 8 倍。实验对比中,人类研究员一周仅解决 23% 的 AI 安全课题, Claude 在算力支撑下完成 97%。

联合创始人 Jack Clark 预测: 60% 概率在 2028 年底前出现具备有限完整自我构建能力的 AI 系统。当前三大瓶颈:研究直觉、算力控制权、目标漂移风险。

1 、谷歌地球 AI 生图上线 48 小时即下架

谷歌地球 AI 图像生成功能上线不到两天就被叫停。官方未说明原因,但社区普遍猜测是担心 AI 生成的虚构场景叠加真实卫星图可能散播虚假信息。

2 、国家超算互联网上线 DeepSeek-V4-Flash 正式版 API

国家超算互联网正式接入 DeepSeek-V4-Flash ,面向企业开发者开放,无需配置即可调用。这本质上是给 Flash 加了一张"国家队"评级——在政府和国企市场,这个背书的分量可能比性能跑分更重。

1 、 VeriLoop Coder-E1 :清华深研院发布的开源代码模型。 基于 Qwen3.6-27B ,面向仓库级代码修复, SWE-bench Verified 得分 85.20 ,展示了开源垂类代码模型的强大潜力。

2 、 Inkling-Small : Thinking Machines Lab 开源轻量化 MoE 模型。 2760 亿参数 / 120 亿激活,可变思考强度设计,权重已开放。

1 、 AI 安全"黑色一天"

三条 AI 安全事件同一天爆出, Hugging Face 和 Reddit 上讨论炸了。一条高赞评论:"我们花了两年讨论 AI 安全理论,今天 AI 用实际行动告诉我们——你们的理论太慢了。" 也有人指出,这些攻击发生在内部测试环境中,不能直接等同于真实威胁,但趋势已经很清楚。

2 、 Mira Murati 的首个产品

"Inkling 原版出来时大家说 Thinking Machines 不行,今天 Inkling-Small 出来, 1/4 参数超越前代,开源。 Mira 这波是教科书级的'别急着下结论'。"

3 、"AI 写 80% 代码"的行业冲击

Anthropic 的数据引发软件工程师群体热议。有程序员评论:"不是 80% 的代码,是 80% 的研发代码——包括架构设计、测试、部署脚本。这意味着 AI 不仅在写 CRUD ,它在参与系统级工作。" 也有人冷静分析: 8 倍产出中有大量是 boilerplate 和自动化测试,核心架构决策仍依赖人类。