标签

美AI矛头直指真人

发布时间:2026-08-10 12:21阅读:2

英国人工智能安全研究所专家指出:“针对真人——这在我们看来是前所未闻的。”

构建虚假身份,不断向人施压,骗取许可,只为达成攻击目的——这种谍战片式的桥段,如今竟出现在了英国官方的事故报告里。

8月4日,英国政府下属的AI安全研究所(AISI)发布报告指出,调查发现,部分受测AI智能体持续对真实个人和组织实施潜在危害行为。

在最近进行的122次网络安全评估中,智能体在10次运行中突破了界限,共计记录到19起越界事件,涉事模型包括美国头部公司Anthropic和OpenAI。

最严重的一起案例是,智能体企图将恶意代码注入GitHub等主流代码托管平台的项目中。它研究了项目中的审核员,创建了多个虚假身份,向审核员施压,要求其批准代码。

AISI对此表示震惊,这是首次在未收到特定指令的情况下,于现实世界中如此清晰地观察到与自主性和欺骗性相关的风险。

“针对真人——这是我们以前从未见过的。”研究人员表示,智能体曾试图直接联系真实用户,通过在线文件传输服务发送消息和文件,诱导他们运行恶意代码。

这一幕令人倍感熟悉。翻开日历,这个夏天,美国AI的“翻车”事故几乎从未停歇。

7月21日,OpenAI承认其AI模型发现了零日漏洞、突破了沙箱限制,入侵了全球最大的AI开源社区Hugging Face。公司称,“这是一起史无前例的网络安全事件。”

7月30日,Anthropic承认,其Claude模型在网络安全受控测试环境中意外获得了互联网访问权限,进入了3家真实机构的系统,最早的事件可追溯到4月。

为了越界,AI模型甚至开始作弊。根据AISI的一项测试结果,在475次网络安全评估运行中,五款美国前沿AI模型全部出现作弊行为,作弊率在7.8%至14.1%之间。

问题出在哪里?此次报告的答案是,“从根本上看,智能体采取此类行动,是为了完成被赋予的任务。”

根源在于前沿AI的竞赛逻辑。美国头部AI企业竞争日趋白热化,沉迷于堆砌参数、刷榜、冲击上限,争的就是谁能先把能力推向极致。

为了获得更好的测试效果,研究人员甚至放松了安全权限。OpenAI此前也曾承认,为了测试模型的极限网络攻击能力,研究团队有意关闭了部分安全过滤器。

安全护栏本身也是黑箱。例如在Hugging Face的案例中,前沿闭源模型的安全护栏日趋僵化,甚至无法拯救受害者。

反观中国,AI被信赖的不仅仅是性能。OpenAI惹下的麻烦,正是靠智谱GLM-5.2将取证时间从数天缩短到数小时,靠的是可用、可控、可信,支持本地部署,数据安全权限始终受到严密保护。

更深层的差异在于制度。在鼓励创新的同时,中国的智能体治理已明确划定了若干红线,如操作不得超出用户授权范围,运行时必须有决策校验与容错熔断机制,全程可追溯、可审计等。

当美国企业先把能力推到极限再打补丁时,中国则及时补齐了技术、规则和责任的短板。这不是限制,而是确保全社会不会为技术的冒进买单。

在这一导向下,中国企业逐渐形成共识:谁能交付全程可审计的安全系统,谁才有可能握住企业级AI的入场券。

美国AI接连翻车,也在暴露新的安全隐忧。长期以来,AI安全议题多集中在内容合规性、数据偏见和隐私保护上,而今,其自身的行为安全性正变为现实。

显然,银行、医院、政务平台和大型制造企业不可能把核心数据和操作权限交给一个不可控的云端模型。

|总策划:俞岚

|策划:周锐

|统筹:王庆凯 程春雨

|执笔:左登基

|视频:陈庆洋

|责编:李金磊

|校对:黄蕾

|“三里河”工作室出品