标签

Anthropic编程工具安全实测:自动审核模式全面超越人工审查

发布时间:2026-08-09 16:31阅读:2

Anthropic这家美国人工智能企业于2026年8月8日对外发布了一份覆盖1053名付费测试对象的对照实验报告,结果显示其编程辅助产品Claude Code所搭载的自动权限审查机制在各项安全评估中均达到乃至超过了传统人工审查的水平。据此,该企业决定将此模式作为内部所有应用场景的标准配置。

Claude Code系Anthropic推出的一款AI编程辅助应用。在自动运行模式下,每一次工具调用都会被传送至分类器进行判断,目的是拦截不可逆、具有破坏性的越界操作。一旦被分类器拦截,Claude一般会自主寻找更为稳妥的替代方案,或者向操作者寻求确认。在此之前,Anthropic已对自动模式进行了长达数月的内部验证。

实验数据表明,在对照测试场景下,人工审查仅能识别出13.6%的危险指令,而自动模式则识别出89%。Anthropic对2026年5至6月期间的真实使用记录进行回溯分析后发现,采用人工审查的会话发生严重意外损害的可能性是自动模式会话的两倍多。在生产环境严重程度评估中,人工审查会话中有6.3%存在未经用户明确授权的有害操作,而自动模式会话该比例仅为2.4%。另外,在第三方机构独立测评时,自动模式下Anthropic模型承受的720次攻击均告失败,竞品模型在同等权限配置下的攻击成功比例则为5.83%。

Anthropic透露,Adobe、Nuro、Gusto以及Garner Health等多家企业的开发团队已将该自动模式设为生产环境的标准配置。该企业同时指出,用户对权限提示的批准率高达97%,反映出不少人存在未加思索便点击通过的倾向。目前,该公司正持续加大投入研发新的自动模式能力,涵盖对数据外泄的硬性阻断、数据访问与共享规则的细化,以及提示注入攻击的筛查机制等。

本次研究把AI编程工具的安全管控从依赖个人判断的层面提升至体系化的自动防护层面,为整个行业树立了可量化参照的安全标准。