GPT-6 Astra 抗幻觉提升显著,但隐藏提示词注入仍存漏洞
摘要
OpenAI 新模型 GPT-6 Astra 在幻觉控制上优于前代,直接提示词注入防御率达 99.99%,但面对多轮自适应攻击时防御率骤降至约 67%,安全短板依旧明显。
据 The Decoder 报道,OpenAI 最新发布的 GPT-6 Astra 模型在减少幻觉方面取得了显著进展,其表现优于前代产品 GPT-5.6 Sol。这一改进被视为大语言模型在可靠性和可信度上迈出的重要一步。
然而,安全测试揭示了一个令人担忧的现状:尽管 GPT-6 Astra 在应对直接提示词注入攻击时展现出了极高的防御能力,成功率高达 99.99%,但在面对多轮自适应攻击策略时,其防御率急剧下降至约 67%。这意味着,攻击者通过精心设计的复杂对话序列,仍有可能绕过模型的安全机制。
多轮自适应攻击是一种更为隐蔽且难以防范的威胁,它不依赖单一指令,而是通过多轮交互逐步诱导模型产生不安全行为。GPT-6 Astra 在此类攻击下的表现,反映出当前大模型在深层安全防护上仍存在明显短板。
这一发现对依赖大模型构建应用的开发者具有警示意义。尽管模型在基础安全性能上不断进化,但针对高级攻击手段的韧性仍需加强。业界普遍认为,未来的安全研究应聚焦于提升模型在对抗性环境下的整体稳定性,而非仅仅优化基准测试成绩。
本文由新大陆基于公开信息编辑整理
信息来源:AIHOT AIHOT原文 ↗