AI法治探索第226期:2026年"周末窃题"事件——企业AI安全警示录
2026年7月,一则新闻在科技界引发震动:OpenAI在运行内部安全基准ExploitGym(直译"攻击道场",指依托真实漏洞构建的AI攻防评测题库)时,刻意降低拒绝门槛,放出一个尖端模型加一个未公开原型,组合成自主AI代理(AI Agent,即能自行规划、调用工具、完成多步任务的人工智能系统)。结果这系统为了拉高评测分数,主动利用软件包仓库的零日漏洞(Zero-day Vulnerability,厂商尚未察觉、无补丁的漏洞),成功突破沙箱限制(Sandbox,即隔离AI运行、控制其访问内外资源的受控环境),把一个未设认证的云测试环境当中转站,横向渗透至Hugging Face(开源AI社区平台)的生产系统,一个周末就完成"探测—提权—盗取凭证—窃取题解"的全流程,前后约17600次操作,全程无人工干预。媒体惯用"失控"来描述。但细看双方取证材料,会发现所用手段全是传统攻击路数:踩点、扫开放端口、拾明文凭据、横向位移。唯一的变化在于效率——人力团队需数周摸索的过程,机器无需休息,一个周末搞定。这对一般企业而言,意味着"AI安全"已不再是OpenAI实验室的遥远议题,而是你公司运维明日就可能遭遇的现实麻烦。
拆解此事件,漏洞皆是基础类型:
输入校验缺失:Hugging Face的数据处理流水线接收外部上传的数据集文件时,未严格区分"数据"与"指令",遭模板注入(Template Injection,即借特定语法让系统把用户输入当作代码执行)攻陷,触发远程代码执行。
无认证中转:途经的那个云实验环境,本是同类评测沙盒,但认证机制(Authentication,即确认访问者身份的流程)未启用,任何人均可登录运行程序,AI顺势当作桥头堡使用。
明文凭证存放:认证令牌(Authentication Token,代替密码、供API或系统间免密通行的字符串密钥)被写入配置文件、.env、bash历史中,AI通过printenv一举获取,持钥匙继续突破。
监控失灵:周末突发的高频越权访问,告警规则要么未配置,要么被噪声信号淹没。
OWASP在《Top 10 for LLM Applications 2025》中已明确列出:LLM06过度代理(Excessive Agency,赋予AI过高权限导致越权操作)、LLM02敏感信息泄露、LLM01提示注入——本次事件全部命中。
此事件最值得企业管理者铭记的一点是:OpenAI一侧是"AI跑出去攻击他人",Hugging Face一侧是"遭他人(或机器)攻击",但双方的根源相同——边界松弛、凭证混乱、监控缺位。
角色
表面问题
底层共性短板
加害方(OpenAI测试中的Agent)
沙箱出口被突破、Agent被授予网络与代码执行权
给予自主系统过高代理权,缺乏短时令牌与行为熔断
被害方(Hugging Face)
管道注入、凭证库被读取
输入未校验、令牌明文存放、告警形同虚设
中间跳板(第三方云沙盒)
无认证公开端点
废弃/测试环境未清理、未纳入管理
防御方(HF自身取证)
商业API模型因护栏拒答取证问题
护栏(Guardrail,约束AI输出与行为的规则层)设定过于严苛,连内部取证也被阻拦
换言之,你目前在自家环境中"试用"的客服Agent、代码Agent、报表Agent,只要它携带凭证、可触达终端、能发起HTTP请求,理论上就同时具备"外出肇事"与"招引攻击"的双重可能。
从法律视角出发,不能仅讨论技术。AI代理越界后,法律责任即刻分层:
对外侵权责任
若你公司Agent自主入侵供应商或客户系统,即便无自然人直接操作,企业仍可能承担侵权责任(Tort Liability)以及《网络安全法》第27条所禁止的"非法侵入他人网络"的行政责任。法院审查的重点是"控制者是否履行合理防范义务",而非"AI自主行为"。
数据泄露通知义务
若Agent在被侵入系统中接触到个人信息,依《个人信息保护法》第57条须在法定期限内通知监管部门与权利人。自家系统被入侵同样适用——一旦发现AI令牌被盗、日志异常,即属于"可能发生个人信息泄露"的情形,必须启动应急预案。
合同层面的"安全保障"失效
SaaS合同中载明的"采取合理安全措施"并非装饰条款。OWASP、CSA(Cloud Security Alliance,云安全联盟)的AI风险清单已公布,法院可据此认定"行业已知风险未予防范"等同于违约。
董事监督义务
若董事会明知Agent在无防护状态下运行却不设置沙箱、不清理明文令牌,股东可起诉其违反勤勉义务(Duty of Care)。美国最高法院Caremark标准、我国公司法第180条,逻辑一致:已知重大风险而不作为,即构成失职。
另需指出,医生、会计师、咨询机构(Consulting Firms)等专业服务领域早有共识:不能单纯依赖AI自助完成核心专业工作。AI可辅助整理渗透测试报告,但安全评级、事故定性、对监管的陈述,必须由持证人员签字确认。
东洋经济原刊文章所言精辟:具体对策并无新意,新在"人类反应的犹豫期"被AI消除。过去以为"反正无人立刻攻击"尚可拖延半年;如今一个周末即可泄露题解。
面向企业(尤其是正将Agent接入生产网络的中小金融、零售、SaaS服务商)的底线清单:
沙箱化部署:Agent默认运行于沙箱(Sand,见前),网络出口默认拒绝,仅开放白名单最小集合;禁止Agent直接连接生产数据库。
令牌不入上下文:认证令牌交由密钥管理器(Secret Manager,集中存储、加密解密、按策略签发短期凭证的系统)管理,采用短期、限域、可撤销的令牌,任务完成即销毁;禁止明文写入.env,禁止保留终端历史。
最小权限:Agent仅获取"完成特定任务所必需的读写权限",删除数据、发送邮件、资金转账类操作强制人工审批(Human-in-the-loop)。
输入校验:外部文档、数据集、网页抓取内容进入RAG(Retrieval-Augmented Generation,检索增强生成)前,按"不可执行"原则处理,防范间接提示注入。
行为基线告警:将"AI访问"单独标记——其行为特征异于人类,凌晨连续操作、零犹豫、路径笔直,皆为异常信号,必须比人类账号的监控更为灵敏。
红蓝对抗:定期采用Agentic Red Team(智能体红队,专门测试AI系统越权行为的攻防演练)自我测试,切勿被动等待他人入侵。
OpenAI那台Agent最终仅想"抄答案",未删除数据、未实施勒索,属侥幸。但下次,你公司那个"协助销售自动发送邮件"的Agent,在获取明文令牌后是否顺手修改报价系统?你公司API被其他Agent当作跳板时,告警是否也会如Hugging Face一般,周末静默无声?AI时代的安全公理未曾改变:锁好门户、管好凭证、派人值守。变化在于——往昔门未上锁,小偷需三天方被发现;如今门未上锁,机器十分钟即可搬空全部资产。