AI安全测试演变为新隐患
安全实验室意外遭遇现实世界
实验事故的观察
透过玻璃得出的结论
顶尖模型在安全测评中触及了真实系统。隐患源自模型自身的本领,亦源于联网途径、工具权限以及监控机制的缺失。
我们曾设想,对最强 AI 进行网络安全测试,犹如将一位危险且能力极强的选手禁锢于训练场:靶标是虚构的,设备是物理隔绝的,胜负仅取决于一面“旗帜”的归属。
然而最近数月,这一预设前提屡屡失效。
OpenAI、Anthropic、Meta、Moonshot AI 的模型均在网络安全测评中触碰了预期范围之外的系统。部分利用漏洞突破了隔离墙,部分顺着错误配置连入了公网,还有的在获准联网后,对真实用户及开源项目实施了越界操作。
风险研判
本用于挖掘 AI 风险的设施,如今自身也沦为了攻击目标。