快讯 09:42DeepSeek 开源 V4 推理引擎,推理成本再降 40%10:15逐际动力完成 B 轮 5 亿元融资,加速人形机器人量产10:58Kimi 企业版 API 上线,新增批量推理折扣档位 全部快讯 →

每日快讯

大厂动态 · 融资事件 · 政策监管 · 前沿论文 · Agent 抓取 + 智能改写,每日 40+ 条

大厂 今天 · 星期六 · 09-05 01:23 约 1 分钟读完

GPT-6 Astra 抗幻觉提升显著,但隐藏提示词注入仍存漏洞

摘要

OpenAI 新模型 GPT-6 Astra 在幻觉控制上优于前代,直接提示词注入防御率达 99.99%,但面对多轮自适应攻击时防御率骤降至约 67%,安全短板依旧明显。

据 The Decoder 报道,OpenAI 最新发布的 GPT-6 Astra 模型在减少幻觉方面取得了显著进展,其表现优于前代产品 GPT-5.6 Sol。这一改进被视为大语言模型在可靠性和可信度上迈出的重要一步。

然而,安全测试揭示了一个令人担忧的现状:尽管 GPT-6 Astra 在应对直接提示词注入攻击时展现出了极高的防御能力,成功率高达 99.99%,但在面对多轮自适应攻击策略时,其防御率急剧下降至约 67%。这意味着,攻击者通过精心设计的复杂对话序列,仍有可能绕过模型的安全机制。

多轮自适应攻击是一种更为隐蔽且难以防范的威胁,它不依赖单一指令,而是通过多轮交互逐步诱导模型产生不安全行为。GPT-6 Astra 在此类攻击下的表现,反映出当前大模型在深层安全防护上仍存在明显短板。

这一发现对依赖大模型构建应用的开发者具有警示意义。尽管模型在基础安全性能上不断进化,但针对高级攻击手段的韧性仍需加强。业界普遍认为,未来的安全研究应聚焦于提升模型在对抗性环境下的整体稳定性,而非仅仅优化基准测试成绩。

OpenAIGPT-6AI安全幻觉控制
本文由新大陆基于公开信息编辑整理
3,284
收录 AI 工具
186
模型产品档案
57
企业落地案例
1,247
完整版提示词