AppenTalk | GPT-Red:AI 自动攻防,能替代人类红队吗?

当 AI 系统开始自主浏览网页、读取邮件、调用工具,攻击面也在同步扩大。将恶意指令隐藏在网页、文件或工具中的提示注入(Prompt Injection)已成为大模型安全面临的最棘手挑战之一。

对此,OpenAI 的解决方案是让 AI 攻击 AI:GPT-Red 通过自我对弈强化学习,在与防守模型的持续攻防中自主进化,自动发现漏洞并生成训练数据来加固模型。本期 AppenTalk,一起来探讨。

自我对弈:GPT-Red 的训练机制

GPT-Red 采用自我对弈强化学习框架进行训练。在每一轮攻防环境中,系统会定义一个清晰的威胁模型(Threat Model)。GPT-Red 因成功触发模型失效而获得奖励;防守模型则因抵御攻击并完成原始任务而获得奖励。

这种双向激励驱动攻防双方在浏览网页、读取邮件、编辑代码等多样化任务环境中同步进化。防守方越强,攻击方必须探索更隐蔽、更有效的攻击方式。OpenAI 报告称,GPT-Red 的训练投入了与其最大规模后训练(Post-Training)相当的算力资源。

GPT-Red 的关键成果

OpenAI 披露的数据显示,GPT-Red 在多个维度上取得了显著成果。在针对间接提示注入(Indirect Prompt Injection)的基准测试中,GPT-Red 对 GPT-5.1 的攻击成功率达 84%。

GPT-Red 还发现了研究人员此前未见过的攻击类型——“假性思维链”攻击(Fake Chain-of-Thought Attack),通过向模型的推理过程注入伪造信息,使模型误以为虚假结论已经过自我验证。该攻击对 GPT-5.1 的成功率一度超过 95%。

在针对 Agentic System 的测试中,GPT-Red 在模拟环境中演练后,成功攻击了部署在 OpenAI 办公室的 AI 售货机 Agent,包括将高价商品降至 0.5 美元、取消其他顾客订单等。

未解决的问题

GPT-Red 的成果令人瞩目,但仍需审慎对待。OpenAI 的研究基于内部或内部复现的测试环境,攻击集、评分机制、置信区间等细节尚未公开披露。

更重要的是,在一种优化循环中获得的鲁棒性,在新的语言、模态、交互长度、工具和部署环境下未必能够保持。OpenAI 也明确表示,将继续将 GPT-Red 与人类红队、第三方红队、多层次防护和实时监控相结合。

澳鹏的“同一模型 不同弱点”研究对此提供了实证:在 363 个文本和多模态对抗场景中,通过从匹配的母语者评审组中收集 52,272 条危害评分和攻击成功判定发现 - 模型的安全排序在不同语言间并不一致。这表明语言与模态不应被作为独立的测试维度,它们的交互会同时改变绝对攻击成功率和相对模型排名

GPT-Red 证明了自动化对抗能够生成有价值的提示注入训练数据并迁移到新场景,但并未消除对独立评估的需求。这也为我们提出了安全评估的下一个难题:当威胁模型、语言、模态、交互模式、系统框架和评估机制全部变化时,鲁棒性是否还能保持?

References

OpenAI unveils GPT-Red to harden GPT-5.6 against attacks

GPT-Red beat human red teamers on a prompt injection test

OpenAI details GPT-Red, an AI that attacks its own models to find flaws

Meet GPT-Red: an LLM super-hacker OpenAI built to make its models safer

人類紅隊成功率僅 13%,GPT-Red 達 84%:OpenAI 如何讓 AI 攻擊 AI、強化下一代模型?

评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值