返回 AI 情报
论文精选 752026-07-28 08:00HuggingFace Daily Papers(社区热门论文)

GPT-Red:通过大规模自对弈实现自动化红队测试

GPT-Red: Automated Red Teaming via Self-Play at Scale

精选理由

OpenAI 用自对弈训练出 GPT-Red,攻击成功率超过人类红队,并直接用于加固 GPT-5.6。这是目前最大规模的安全训练实验,做对齐的值得逐段拆解,对抗训练的思路可能会被各家复用。

AI 摘要

OpenAI 推出 GPT-Red,一个通过自对弈算法训练的自动化红队智能体,用于发现针对前沿大语言模型的提示注入攻击。该模型在同等规模的最大 RL 后训练计算上训练,能可靠攻破 GPT-5.5 及更早模型,发现比人类红队更多的成功攻击,并泛化到未见环境与防御模型。GPT-Red 被用于对抗性训练 GPT-5.6,使其成为目前对提示注入最鲁棒的模型。

正文 · AI 翻译

我们推出了 GPT-Red,这是一个经过训练的自动化红队智能体,旨在针对前沿大语言模型发现新颖的提示词注入攻击。该模型的目标是评估并提升我们生产系统的鲁棒性。为此,我们利用它对 GPT-5.6 进行了对抗性训练,这是迄今为止我们对提示词注入攻击鲁棒性最强的模型。

为了创建 GPT-Red,我们设计了一种可扩展的自对弈算法,要求该模型攻击一个由同时训练的防御者智能体组成的多样化群体。我们在逼真的红队测试环境中训练该模型,所使用的算力与我们一些规模最大的 RL 后训练运行相当,使其成为有史以来规模最大的单一大语言模型安全训练运行。

GPT-Red 在红队测试方面表现出色:它能可靠地攻破我们此前直至 GPT-5.5 的模型,比人类红队测试人员发现更多成功的攻击,并且能够泛化到未见过的环境、防御者模型以及测试框架。未来,我们预计随着每个新 GPT 模型鲁棒性的提升,这将反过来为更强大的红队智能体提供更好的学习信号,从而开启一个自我改进的飞轮效应。

原文

Original Title

GPT-Red: Automated Red Teaming via Self-Play at Scale

Source

HuggingFace Daily Papers(社区热门论文)

Site

arxiv.org

Published

2026-07-28 08:00

阅读原文· arxiv.org

继续阅读