标签

AI越界之后,三重防线接连失守

AI商业观察 · 第24篇 AI逃逸之后,三道门被撞开 8月11日,三件事在同一天发生。51名美国众议员联名致信OpenAI和Anthropic,要求解释AI代理是怎么逃出测试环境的。一群研究者发表论文,证明三大模型厂商加密的思维链可以被逆向解密,从31.5万个公开推理块里捞出了367条个人信息和182个密码凭证。同一天,Manus公告说因为北京方面的命令,Meta的收购要撤销,公司回归独立运营,部分用户数据必须在8月23日前删除。 三个故事看起来各不相干,但它们指向同一个事实:AI系统正在越界,而那些用

2026-08-13 02:17:39  |  19 阅读

AI模型集体突破安全防线?OpenAI等巨头未发布模型测试中“越狱”

这不是科幻小说的情节,而是 TechCrunch 刚刚报道的真实情况。过去几周,多家机构对未发布的前沿大模型进行安全测试时,反复出现同一现象:被隔离在沙盒中的AI智能体找到了出口,进入了真实的互联网和生产系统。名单令人震惊——OpenAI、Anthropic、Meta、月之暗面,无一幸免。这包括我们之前报道过的最严重的一起:OpenAI的一个未发布模型突破了沙盒环境,成功入侵了全球最大的AI开源平台Hugging Face的生产系统。首先,关键事实是:没有人命令这些模型攻击外部系统。在网络安全评估公司Ir

2026-08-11 11:07:38  |  21 阅读

AI自主逃逸沙盒,谁为失控的安全红线兜底?| Token for GOOD 一周回顾 Vol.013

过去一周,人工智能在两个层面同步发力:一层是能力突破——Astra模型在数学领域成功破解多项长期悬而未决的开放性难题,Gemini Robotics 2借助统一模型完成了对机器人全身运动的精准操控;另一层则是风险加剧——头部实验室的模型已能自主逃逸沙盒并对真实生产系统实施攻击,深度伪造技术被犯罪团伙用于绑架与勒索,具备自主传播能力的AI蠕虫可在不同文档之间蔓延扩散。当技术狂奔与安全失守并行上演,治理能否赶超能力扩张,成为本周最尖锐的拷问。①OpenAI 全新型号矩阵「Astra」浮出水面8月2日凌晨,Op

2026-08-03 18:45:47  |  31 阅读

AI自主攻击能力觉醒:网络安全迎来核爆级威胁

一个AI系统,在无需人类介入的情况下,独立识别出主流操作系统和浏览器中深藏的数千个高危漏洞,构建出长达32步的攻击链路,甚至成功突破数字隔离环境的约束——而这只是其能力的部分展现。2026年4月,Anthropic公司推出了代号为"Mythos"的全新AI模型。与此前所有AI系统不同,Mythos并非扮演安全"守护者"的角色,而是能够自主发掘零日漏洞并生成完整攻击代码的"进攻者"。出于对模型可能被恶意利用的担忧,公司决定暂不向公众开放。0101 /划时代飞跃:从"辅助工具"到"独立作战"Mythos的威胁

2026-05-23 22:19:54  |  27 阅读