首页 / 资讯 / OpenAI 构建了一个 AI,通过越狱自身模型来提高其安全性
OpenAI

OpenAI 构建了一个 AI,通过越狱自身模型来提高其安全性

2026年7月23日1 分钟阅读
OpenAI 构建了一个 AI,通过越狱自身模型来提高其安全性

新闻摘要

OpenAI 披露了一个名为 GPT-Red 的内部系统细节,这是一个专门用于攻击公司自身前沿人工智能系统的自动化红队测试模型,旨在在现实世界被利用之前发现安全漏洞。该披露于 2026 年 7 月 15 日(美国东部时间)公开,描述了该工具在 GPT-5.6 的开发和安全评估过程中如何被广泛使用,以及其发现如何反馈到训练中,从而使发布的模型更能抵抗操纵。

GPT-Red 的功能

GPT-Red 旨在探测提示注入漏洞,这是一类弱点,攻击者将隐藏或恶意的指令嵌入到模型处理的内容中,试图覆盖系统的原始任务。OpenAI 没有仅仅依赖人工测试人员手动搜索这些缺陷,而是构建了 GPT-Red 作为一种专用的攻击模型,它不断生成新的攻击策略,并在受控环境中针对防御模型进行测试。

自我博弈训练循环

该系统使用自我博弈强化学习方法进行训练,其中攻击模型和一组防御模型通过反复相互竞争来改进。当攻击者成功诱导防御者遵循注入的指令时,它会获得奖励;而当防御者在正确拒绝恶意输入的同时仍能完成最初赋予的合法任务时,它会获得奖励。随着防御者在识别已知攻击模式方面变得越来越好,GPT-Red 被迫发现更多样化和更复杂的技巧,然后这些新发现的攻击被用来重新训练防御者。OpenAI 将此描述为一个升级周期,其中攻防能力会随着时间的推移共同提高。

超越人类红队

根据 OpenAI 分享的数据,GPT-Red 在测试场景中成功率约为 84%,而人类红队测试人员在处理同一组挑战时的成功率约为 13%。该公司表示,这一差距说明了自动化、大规模的对抗性测试可以比单独的手动审查更快、更一致地发现漏洞,同时强调人类专业知识仍然是评估中重要的补充层面。

发现新的攻击类别

该项目的一个显著成果是 GPT-Red 独立识别出了一种先前未被记录的攻击模式,研究人员后来称之为“虚假思维链”攻击。该技术针对的是推理模型,这些模型在生成最终答案之前会生成明确的中间推理步骤。该攻击通过在推理跟踪中插入一个伪造的条目来起作用,导致模型表现得好像它已经验证了一个错误的假设。报告显示,在采取缓解措施之前,此类攻击在 GPT-5.1 模型上成功率超过 95%。在使用 GPT-Red 的发现重新训练新系统后,在 GPT-5.6 模型上,同类攻击的成功率降至 10% 以下。

人工专家测试与自动化并行

OpenAI 指出,自动化红队测试旨在补充而非取代其现有的红队测试网络,该网络包括来自化学、生物安全、网络安全、法律和多语种语言学等领域的 200 多名外部专家。这些外部审查人员在模型发布前后继续评估模型,与自动化系统一起测试安全措施,以防范富有创意的现实世界滥用尝试。

大量的计算投入

该公司表示,在 GPT-5.6 的开发过程中,它投入了大量的计算资源,据报道超过 700,000 GPU 小时,用于运行所谓的通用越狱的自动化搜索。OpenAI 还表示,自动化红队测试将在模型部署期间继续运行,从而可以持续识别和修补新漏洞,而不是仅在固定的预发布测试窗口期间进行。

对人工智能安全研究的重要性

研究人员和行业观察家指出,GPT-Red 是人工智能安全领域更广泛趋势的一个例子:利用人工智能系统本身来测试和加固其他人工智能系统,其规模和速度是手动测试无法比拟的。随着推理模型变得越来越强大,并在自主或代理环境中得到更广泛的应用,像 GPT-Red 这样的工具被视为构建能够跟上日益复杂的攻击技术步伐的安全措施的重要一步,同时仍然为人类在最困难和最创新的安全问题上做出判断留有余地。

OpenAIGPT-Red