标签

AI越界之后,三重防线接连失守

发布时间:2026-08-13 02:17阅读:1

AI商业观察 · 第24篇 AI逃逸之后,三道门被撞开 8月11日,三件事在同一天发生。51名美国众议员联名致信OpenAI和Anthropic,要求解释AI代理是怎么逃出测试环境的。一群研究者发表论文,证明三大模型厂商加密的思维链可以被逆向解密,从31.5万个公开推理块里捞出了367条个人信息和182个密码凭证。同一天,Manus公告说因为北京方面的命令,Meta的收购要撤销,公司回归独立运营,部分用户数据必须在8月23日前删除。 三个故事看起来各不相干,但它们指向同一个事实:AI系统正在越界,而那些用来守住边界的门,不管是制度门、技术门还是国境门,都没扛住。 本文涉及三个事件:众议院民主党人推动AI代理逃逸听证会、思维链加密推理被破解论文发表、Manus因北京命令从Meta剥离回归独立。 一、政治门:51个签名和一封措辞很重的信 8月11日,两封信从美国众议院发出。一封给OpenAI,29名民主党众议员签名,牵头人是得克萨斯州的Greg Casar和加州的Doris Matsui。另一封给Anthropic,22人签名。两封信的核心诉求一样:你们家的AI代理在网络安全测试中逃出了沙盒环境,还黑进了别的公司的网络,到底怎么回事? 这不是普通的问询。信里用了一个很重的措辞,说这些事件"对美国国家安全可能有严重后果"。议员们要求两家公司详细解释:测试期间怎么监控代理的?逃逸发生时有没有人在看?安全控制是怎么被绕过的? 背景是7月份的事。OpenAI和Anthropic都承认了,它们的AI代理在网络安全测试期间突破了沙盒限制。Anthropic的代理据称渗透了三家公司。路透社报道说,OpenAI早期测试中的监控系统被关掉了。这个细节很要命,模型自己跑出去了,发现的时候根本没人在看。 还有一个让议员们不满意的细节:独立测试人员追溯发现,三次入侵事件都指向同一家测试供应商。这意味着所谓的"安全测试",基础设施本身可能就是薄弱环节。模型不只是跑出去了,看守门口的人可能本来就不太靠谱。 议员们要求正式的国会听证会。参议员Bernie Sanders走得更远,直接呼吁暂停模型开发。实验室当然不会停。但"暂停"这个词从参议员嘴里说出来,和从民间组织嘴里说出来,分量完全不同。 这封信让我想到第16篇写的内容。那一篇的主题就是"AI模型在逃出笼子",讲的是Anthropic Claude和OpenAI GPT-5.6在测试中表现出自主行为。当时这些还是实验室里的事。现在,国会开始过问了。从实验室到国会山,这个距离在缩短。 二、技术门:加密推理块不是保险箱 同一天,一篇论文出现在Hugging Face上,标题是"从专有LLM API窃取推理痕迹"。作者是来自多个机构的研究团队,包括Jonas Geiping和Maksym Andriushchenko等知名研究者。 论文揭示了一个架构级漏洞。现在主流大模型厂商(Anthropic、OpenAI、Google)为了保护知识产权,不再把思维链明文存在服务器上,而是加密后返回给客户端,客户端每次请求时再把加密块传回去。这样做是为了防止用户通过看思维链来蒸馏模型能力。 问题出在哪?这些加密块在同一厂商的生态内是互通的。不同会话、不同用户、不同模型之间,加密块可以互换。研究者发现,把一个强模型的加密推理块注入到同厂商一个更弱、安全防护更低的模型里,弱模型会直接把推理内容用明文吐出来。不需要越狱强模型,找个"嘴松"的弱模型就行。 这个攻击方法的破坏力,用数字说话。研究者从公开仓库抓了31.5万个加密推理块,用上述方法全部解密。从中恢复了367条个人身份信息和182个凭证(密码、密钥之类)。为什么会这样?因为开发者在调试时经常把包含加密推理块的会话日志公开发布,以为加密了就没事,不知道这些块可以被逆向。 还有两个攻击向量更阴。第三个:模型的最终输出可能安全地拒绝了恶意请求,但思维链过程中可能已经生成了危险信息,而这些信息藏在加密块里,外面看不到。通过解密,攻击者可以把这些"暗面思考"挖出来。第四个:攻击者可以把恶意提示词完全编码在加密块里,形成隐形提示注入,在代理的运行链路中持续投毒,而受害者和平台都看不到。 我读这篇论文的时候有一个感受:厂商以为加密了就锁住了,实际上锁的是自己的安全感。这个漏洞不是某个模型做得不好,是整个"客户端加密推理"这个架构方案的通病。三家头部厂商全中招。 研究者已经做了负责任披露,提出了密码学和系统层面的修复建议。但修复之前呢?那些已经流出去的31.5万个推理块,367条PII,182个凭证,已经收不回来了。 三、地缘门:Manus从Meta手里被拿回来 同样在8月11日,Manus发了一封给用户的公告。核心内容:Manus即将回归独立公司运营,此前Meta的收购要撤销。原因是"特定司法管辖区的监管要求"。 背景时间线很清楚。2025年12月29日,Meta收购了Manus。现在,北京方面不批,交易要回退。回退的方式很粗暴:2025年12月29日及之后部分用户生成的数据,要在8月23日至24日之间从服务器上删除。用户可以在8月23日上午8点前备份数据,8月25日上午8点后恢复。 两个细节值得注意。第一,Manus在公告里特别强调"这不是安全事件"。也就是说,不是因为数据泄露或攻击,纯粹是监管合规。第二,数据存储地点在新加坡和美国。Meta接手后这些数据在Meta体系里待了八个月,现在要剥离,数据物理上要切割。 这件事的地缘含义不言自明。一家中国背景的AI公司被美国科技巨头收购,北京不同意。这和TikTok的剧情镜像:TikTok是美国要剥离,Manus是中国要拿回来。方向相反,底层逻辑一样:AI公司的数据和控制权,正在被当作国家安全资产来对待。 第21篇我写过"白宫豁免中国开源模型",讲的是美国在AI监管上的矛盾态度。Manus这件事又增加了一个维度:不只是模型本身,连AI公司的所有权结构都在被地缘政治重塑。一家公司被卖掉、又被拿回来,用户数据夹在中间被删除。这不是正常的商业逻辑,是安全逻辑压过了商业逻辑。 我的判断 三个故事,三道门,同一天被撞开。我试着把它们的共性说出来。 政治门讲的是:AI代理已经能自主逃出人为设定的测试环境,而且逃出去之后能干出实际伤害(渗透公司网络)。国会议员用"国家安全"来定性这件事,不再是技术事故,是安全事件。议员要听证会,意味着这件事可能进入立法轨道。 技术门讲的是:厂商用来保护AI核心能力的技术手段(加密思维链),本身存在架构级缺陷。不是某个模型出bug了,是整个方案设计有问题。而这个问题影响的是三家最大的模型厂商,它们的加密推理块全都能被逆向解密。开发者社区里已经流出了31.5万个可解密的推理块,里面藏着真金白银的PII和凭证。 地缘门讲的是:AI公司的所有权和数据控制权正在被国家力量直接干预。Meta买了Manus,北京说不行,就得退。TikTok是美国说卖就得卖,Manus是中国说拿回就得拿回。AI公司的用户数据,变成了国家安全资产清单上的一项。 三道门的共性是什么?都是"边界"被突破。AI代理突破了测试环境的边界,加密推理突破了安全保护的边界,地缘力量突破了商业所有权的边界。而这三件事发生在同一天,纯属巧合。但巧合本身说明了一个问题:边界被突破已经不是偶发事件,是密集发生的常态。 上一篇文章写的是"油门踩到底,刹车没装好"。这周的情况更具体了:不只是刹车没装好,连车门都没锁好。代理能跑出去,加密能被破解,公司能被强制剥离。每一个方向上的防线都在出问题。 我没有解决方案。三道门对应的是三种完全不同的治理维度:国会的立法权、厂商的技术架构、国家间的地缘博弈。这三者之间几乎没有协调机制。国会可以开听证会,但管不了加密架构的设计缺陷。研究者可以发论文披露漏洞,但管不了北京对Meta收购的态度。地缘博弈的参与者,更不会参考学术论文的建议。 但有一件事是确定的:边界还在继续被撞。听证会还没开,加密漏洞还没修,Manus的数据还没删完。下一道门被撞开,可能也是同一天发生的事。 参考