GPT-6 Astra 幻觉更少但仍易受隐藏提示词注入攻击
OpenAI's GPT-6 Astra hallucinates less but remains vulnerable to hidden prompt injections
精选理由
文章汇总 OpenAI 系统卡与 Gray Swan 独立测试数据,读者可据此比较 GPT-6 Astra 与竞品在幻觉和注入攻击上的实际防线。
AI 摘要
The Decoder 报道,OpenAI 新模型 GPT-6 Astra 幻觉少于前代 GPT-5.6 Sol,直接提示词注入防御率达 99.99%,但多轮自适应攻击下防御率降至约 67%。
正文 · AI 翻译
Sora 由 THE DECODER 提示生成
要点
OpenAI 的新模型 GPT-6 Astra 比其前代 GPT-5.6 Sol 的幻觉更少,并能拦截 99.99% 的直接提示注入攻击。
Astra 在抵御越狱攻击方面也更有效,但在多轮对话中,顽固的攻击者仍约有三分之一的几率能获得有问题的回答。
对于隐藏在 AI 所读取文档中的间接提示注入,Astra 的失败率从 27% 降至 8.5%。这是很大的进步,但比例仍然偏高。
OpenAI 的新模型 GPT-6 Astra 比其前代产品产生的幻觉更少,拦截提示注入攻击的效果也更好。但对于真正安全的 AI 智能体部署而言,它仍然不够可靠。
根据 OpenAI 的系统卡,新 Astra 模型比其前代 GPT-5.6 Sol 产生的事实性错误要少得多。OpenAI 使用用户标记为答案错误的 ChatGPT 对话对其进行了测试,这意味着这些是特别容易出错的案例,其失败率不应被视为日常使用的典型水平。Astra 重现这些已报告错误的频率要低得多,其中在低延迟设置和较低推理级别下取得的进步最大。
GPT-6 Astra(粉色)在所有延迟设置下的幻觉均少于 GPT-5 系列模型。| 图片来源:OpenAI
对于直接提示注入攻击——即用户试图通过自己的提示词操纵模型——Astra 实现了近乎完美的 99.99% 防御率。OpenAI 将此归功于其 GPT-Red 方法,该方法在训练期间使用自动化攻击者来强化模型。
越狱防御的表现也类似。针对一组固定的已知攻击数据集(这些攻击试图获取关于生物学、暴力和网络安全的有害回复),Astra 在 91.5% 到 98.3% 的情况下拒绝提供帮助。
当攻击者在多轮对话中调整策略时,Astra 的防御率降至约 67%,这意味着顽固的对手大约每三次尝试就能诱出至少一条有问题的回复。前代模型在同一测试中的得分略低于 50%。OpenAI 指出,这些测试是在裸模型上运行的,没有搭载实际产品中附带的生产级安全层(如分类器)。
隐藏的提示注入仍然是一个真实的安全问题
Astra 在间接提示注入方面取得了进展,这类攻击隐藏在 AI 读取的文档中。安全公司 Gray Swan 的外部测试使用了来自其 IPI Arena 的 1,810 个精选攻击,结果显示,在每种场景尝试 15 次的情况下,Astra 在 8.5% 的情况下至少被攻破一次。GPT-5.6 Sol 在 27% 的情况下失败。Claude Opus 5 在同一评估中表现更好,失败率为 4.8%,但它也并非完全免疫。
根据 Gray Swan 的 IPI Arena,间接提示注入的攻击成功率。| 图片来源:OpenAI
Gray Swan 将第一季度和第二季度测试合并后的数据,与早期结果相比实际上有所上升。Anthropic 此前仅基于难度较低的 Q1 测试报告了 2% 的攻击成功率,而 GPT-5.6 Sol 在该测试中的得分也只有 20%。Anthropic 还在所有模型上开启了扩展推理功能,再加上测试范围更广,这或许可以解释两者之间的差距。
尽管这些都是经过精心挑选的攻击场景,但这样的成功率足以让任何企业安全团队感到担忧。Astra 大约每十二个场景中就会有一个因注入指令而被攻破。Opus 5 的表现更好一些,但大约每二十一个场景中仍会出现一次失败。而且风险还在不断增长。AI 智能体正越来越多地自主编写代码、操作工具和控制计算机,这正是 Gray Swan 所测试的内容。这些智能体还被设计为全天候、大规模运行,而阅读和处理文档正是它们的核心工作之一。
GPT-6 系统卡
原文
Original Title
OpenAI's GPT-6 Astra hallucinates less but remains vulnerable to hidden prompt injections
Source
The Decoder:AI News(RSS)
Site
the-decoder.com
Author
Matthias Bastian
Published
2026-09-05 01:23