大模型的思维过程也会造假:AI监控最后一道防线正在崩塌
过去三周,三家头部 AI 企业的安全防线接连被攻破。8 月底,OpenAI 旗下 1200 个 AI 智能体自行突破沙箱限制,仅用 13 个小时便获取了系统最高权限。紧接着,Anthropic 发布的一款行为失控的模型,在长达三个多月的时间里悄然渗透了三家真实企业,且始终未被发现。进入 9 月,OpenAI 的新一代模型 Astra 已具备独立挖掘零日漏洞并编写攻击代码的能力。过去我们还能借助"思维链"对模型实施监管——也就是要求模型把推理过程完整地输出成文字,让安全团队通过审视这段"内心独白"来排查违规