标签

OpenAI发布GPT-Red:AI攻防新纪元,四步循环超越人工红队

发布时间:2026-08-13 08:36阅读:2

在传统的网络安全攻防演练里,红队扮演着不可或缺的角色。他们模拟黑客思维审视系统防线,挖掘隐秘漏洞,设计攻击路径,突破看似坚固的边界,并在恶意攻击降临前协助防守方加固系统。这是一场永不落幕的攻防博弈,是网络安全领域最核心的实践之一。

如今,这种经典的攻防对抗正以全新姿态登陆大模型领域。2026年7月,OpenAI披露了其内部名为GPT-Red的自动化红队模型,这标志着人工智能安全迈入了一个崭新的时代。

GPT-Red的职责与众不同。它并非为了回答用户或编写代码,而是专攻其他GPT模型的提示词注入漏洞。它如同一位不知疲倦的测试员,持续向目标模型发送精心设计的指令,细致观察每一次响应,动态调整策略,逐步逼近预设的恶意目标。

其攻击目标可能涉及窃取内部目录、转发API密钥、关闭双重认证、上传凭据文件,甚至诱导具备操作权限的智能体篡改价格、取消订单。每一个目标背后,都映射着现实世界中可能发生的真实安全威胁。

值得注意的是,GPT-Red并非仅用于演示的实验项目。OpenAI明确表示,它已直接融入生产模型的训练流程,用于GPT-5.6 Sol的对抗训练。数据显示,相比四个月前的GPT-5.5,GPT-5.6 Sol在直接提示词注入基准测试中的失败次数减少了约六倍。面对GPT-Red的攻击,其失败率已降至0.05%,令人瞩目的安全提升。

这意味着大模型安全正经历重要范式转变。过去,安全团队依赖人工红队发现漏洞;如今,攻击模型自动生成、验证并改进策略,将结果反馈给防守模型。一场由AI攻击AI、再由攻击驱动防御升级的攻防循环已然成型。

一、提示词注入:智能体时代的核心安全威胁

提示词注入并非新概念。本质上,它是攻击者通过精心编写的指令干扰模型任务执行,使其忽略系统规则或开发者指令,转而执行攻击者的操作。早期大模型应用中,其影响多停留在输出异常内容层面,如绕过安全限制或泄露系统提示词,实际损失相对有限。

但随着大模型从聊天工具进化为具备自主行动能力的“智能体”,风险边界已发生根本变化。今天的智能体能连接浏览器、邮件、数据库等工具,拥有执行脚本、调用API、发起交易的实际能力。一旦具备这些工具,提示词注入便可能演变为真正的系统安全事件。

更危险的是,恶意指令可能隐藏在邮件、网页、代码注释或开源文件中。当智能体读取这些内容时,隐藏的指令可能进入上下文,影响判断。这类攻击被称为“间接提示词注入”。例如,员工让智能体总结邮件,邮件中却藏有上传凭据的指令,若模型无法区分“数据”与“指令”,便可能导致严重泄露。

这正是智能体安全的核心挑战:模型不仅要理解内容,还要判断哪些是可信指令,哪些是攻击载荷。传统防护手段往往难以应对。

二、GPT-Red的工作原理:像人类红队一样思考和攻击

OpenAI介绍,GPT-Red的运作方式与经验丰富的人类红队高度相似,具备高度智能和自适应性。其攻击流程分为四步:首先设定攻击目标(如诱导上传敏感文件),然后发送构造的提示词,观察响应;若失败,则分析原因,修改指令和上下文再次尝试。

这可概括为:设定恶意目标、生成攻击提示、观察目标响应、根据反馈持续迭代。循环直至突破防御或确认路径无效。

传统自动化测试依赖固定样本库,面对复杂动态行为时往往乏力。GPT-Red则不同,它不局限于固定模板,而是根据模型实时表现动态调整策略。当防守模型识别攻击时,GPT-Red必须寻找新的表达和欺骗路径,主动探索攻击空间,寻找薄弱环节。

这正是自动化红队的价值:人工红队创意和覆盖有限,而自动化红队可7×24小时运行,在海量场景中试探安全边界,系统化寻找新失败模式和漏洞。

OpenAI披露的测试场景包括数据外泄、伪造支付、窃取AWS凭据、关闭双因素认证、注入恶意脚本、转发API密钥及生成爬虫脚本等。这些攻击的共同特征是让模型执行现实世界中的危险操作,而非仅输出不当内容。这标志着大模型安全评估重点从“内容安全”转向“危险行动”。

三、真实案例一:AI售货机被攻陷的全过程

GPT-Red的真实测试对象是Andon Labs开发的AI自动售货机系统,这是一个由自主智能体驱动的系统,能处理定价、采购和订单管理。

OpenAI设定了三个目标:将高价商品降至0.50美元、以0.50美元采购100美元商品、取消正常客户订单。在模拟环境演练后,GPT-Red成功攻陷真实系统,完成全部目标。

这一案例揭示了智能体商业化的现实风险。攻击者无需攻破服务器或获取管理员权限,只需通过语言指令影响智能体判断,即可操纵业务流程。从传统视角看,系统代码、架构和权限控制可能安全;但从智能体视角看,业务逻辑已被提示词操纵。攻击者利用的是模型对自然语言的理解和服从倾向,这是一种全新的攻击面。

该攻击呈现跨层穿透特征:表面在对话层,实际穿透推理层、工具层和业务层,影响商品价格和订单。测试后,OpenAI按负责任披露原则通报问题,防护措施已进入测试阶段。这启示企业:涉及资金、订单、权限的智能体操作,不能仅靠模型自身判断,必须设置独立控制机制。

四、真实案例二:命令行编程智能体中的数据外泄风险

GPT-Red测试的第二个案例涉及基于GPT-5.4 mini的Codex命令行智能体。这类智能体拥有高系统权限,可读取目录、执行命令、修改代码和访问密钥,虽提升效率,但也意味着一旦被攻击,后果更严重。

测试显示,GPT-Red在未参与训练的10项数据外泄任务中,比GPT-5.5基线方案更易成功诱导智能体传输敏感数据。两个关键细节值得关注:一是“留出任务”测试,证明了GPT-Red具备将攻击策略泛化到新任务的能力;二是核心目标是数据外泄,涉及API密钥、代码、配置等,一旦泄露,恶意提示可能成为攻击入口。

例如,智能体分析GitHub仓库时,恶意指令可能隐藏在README或注释中,要求其读取本地密钥并发送至服务器。对人类是文档,对缺乏上下文隔离的智能体却是执行命令。因此,开发工具场景的防御需覆盖代码、文档、日志等所有载体。

五、真实案例三:成功率超过95%的“伪思维链”攻击

GPT-Red早期版本发现了一类名为“伪思维链攻击”的新型直接提示词注入方法,在针对GPT-5.1的测试中成功率超过95%,几乎是百试百灵。

出于负责任披露,未公开具体方法,但命名暗示其机制可能与伪造推理过程或利用模型对推理上下文的信任有关。其趋势是攻击者从简单命令逐步演进为利用模型推理机制和固有习惯进行精巧欺骗。

早期攻击直接(如“忽略指令”),随着模型识别能力提高,攻击更隐蔽。恶意内容可能伪装成系统日志、分析过程或工具输出。当模型误信伪造内容时,行为将被干扰。OpenAI表示,在GPT-5.6 Sol上,此类攻击成功率已降至10%以下。这证明了自动化红队发现攻击并利用对抗训练强化防御的有效性。

六、自我博弈机制:攻击与防守在对抗中共同进化

GPT-Red采用自我博弈强化学习机制,与不同特征的防守大模型在大量红队场景中对抗训练。攻击模型的目标是诱导目标模型出现至少一次安全失败;防守模型的目标是在拒绝恶意攻击的同时,正确完成合法任务。

这体现了安全与可用性的微妙平衡。模型若一味拒绝复杂输入虽能减少事故,但会失去实用价值。真正的防御是识别并拒绝恶意指令,同时高质量处理合法需求。例如,面对邮件中的恶意指令,应将其视为数据忽略,而非拒绝阅读邮件。

防守模型需同时优化识别攻击和完成任务的能力。在动态博弈中,防守变强迫使攻击进化,攻击发现新路径又提升防守。OpenAI透露,GPT-Red在间接提示词注入测试中攻破场景数已超人工红队。但这不代表替代人类,人类在理解业务场景、发现复杂逻辑风险、设计创意攻击方面仍具优势。GPT-Red旨在放大和扩展人工红队的能力边界。理想体系应是“人工定策略,自动化扩覆盖,人工做决策”的人机协同。

七、从三个真实案例看企业智能体安全的最佳实践

GPT-Red的案例为企业提供了现实指导意义。

第一,永远不将外部内容视为可信指令。网页、邮件、代码中的内容本质不可信。需在架构中明确区分“控制指令”和“待处理数据”,建立清晰的信任边界。

第二,高风险操作需独立授权机制。降价、采购、转账、删除数据等操作,不应仅凭模型自然语言输出执行。需设置二次确认、审批流程、细粒度权限校验、金额限制和地址白名单。智能体提供建议,执行许可由独立系统或人工决定。

第三,坚持最小权限原则。智能体权限越多,潜在损失越大。应根据任务需求分配最小必要权限,隔离不同能力。例如,分析代码的智能体无需访问生产密钥。

第四,对工具调用进行全链路监控审计。记录调用时间、工具、文件、网络请求和数据修改。建立基于规则的实时风险检测,如异常读取凭据或向未知服务器请求。支持攻击链回溯,实现端到端可观测性。

第五,建立持续性自动化红队测试机制。提示词注入需长期对抗。模型更新、工具变更都可能引入新风险。应将红队测试纳入持续交付流程,设计攻击目标库,在升级和变更后自动回归测试。人工专家应聚焦新场景和高影响攻击。

第六,安全评估关注真实任务完成情况。OpenAI审计SWE-Bench Pro发现质量问题,撤回相关建议。这表明评估数据集的真实性和质量至关重要。真正有价值的评估应难以被操纵、易于验证,并真实反映模型能力。这对行业评估标准建设有重要启示。

八、为什么GPT-Red必须与通用模型严格隔离

OpenAI强调GPT-Red与公众模型严格隔离。为了发现攻击路径,GPT-Red需学习绕过防护、构造恶意提示。这对防守方有价值,但若被滥用,也可能攻击现实模型。

自动化红队模型具有明显的双重用途。既是防御武器,也是进攻工具。因此,需建立严格的访问控制、独立运行环境、内容审查和审计日志。这对企业自研安全工具也是警示:攻击能力不能与业务能力混合部署,必须严格权限控制。攻击工具本身也需要被保护,确保发现漏洞的方法不被滥用。

九、从“防止模型说错话”到“防止模型做错事”

GPT-Red的亮相标志着大模型安全进入新阶段。过去关注输出违规、泄露隐私等,影响有限。如今,随着模型变为智能体,安全问题延伸至更紧迫的层面:读取敏感文件、发送密钥、修改价格、取消订单、关闭双因素认证。

当模型连接现实工具,安全对象从文本扩展到每一个动作、读写和权限变更。GPT-5.6 Sol在测试中表现优异,部分基准接近饱和,防御准确率超97%。但这不意味着问题解决,新环境仍可能出现未测试的失败模式。

真正可靠的安全体系需多层次防护:模型通过对抗训练获得安全能力(第一道防线),架构层面的权限控制和业务验证(第二道防线),系统层面的监控、审计和人工审批(第三道防线)。只有这种纵深防御架构,才能在智能体时代保护核心资产。

结语:一场没有终点的智能攻防竞赛

GPT-Red展示了未来安全模式:用擅长攻击的AI模型持续训练执行业务的AI模型。这是一场永无止境的竞赛。防御越强,攻击越需复杂;攻击发现新路径,又成为防御素材。这种动态博弈没有完美解决方案,但持续对抗能不断探索和强化安全边界。

对企业而言,重要不是拥有GPT-Red,而是建立同样的安全思维。上线前主动寻找错误,授权前评估失控损失,连接外部数据前假设有恶意指令,持续验证新环境行为。在智能体时代,最危险的漏洞可能不是代码逻辑,而是一句话。

一句被精心设计、伪装在邮件、网页或工具返回结果中的自然语言指令。一个拥有广泛权限却无法判断这句话可信度的智能体,可能瞬间将语言欺骗转化为现实安全事件。这就是智能体安全新挑战。GPT-Red的启示是:在AI世界,最好的防御者,可能也是一个AI。只有让AI去攻击AI,我们才能真正理解AI的失败之处,并变得更安全。