OpenAI将受限发布Astra:首个达网络安全Critical阈值模型
摘要
OpenAI宣布其模型Astra在Preparedness Framework评估中达到网络安全Critical能力等级,成为首个获此评级的模型。该模型能在最少人工干预下发现未知漏洞并构建利用链,OpenAI将对其采取受限发布策略。
OpenAI于今日正式披露,其新一代模型Astra在内部安全评估体系Preparedness Framework中,被评定为网络安全能力达到Critical阈值。这是该框架设立以来,首个获此最高风险等级的模型,标志着AI在自动化攻防领域的能力迈入新阶段。
据OpenAI官方说明,Astra在测试环境中展现出高度自主的漏洞挖掘与利用能力,能够在极少人工监督的情况下,独立发现未知安全漏洞,并进一步构建出完整的攻击利用链。这一表现远超此前所有参评模型,触发了公司预设的严格管控条件。
基于该评定结果,OpenAI决定对Astra实施受限发布策略。这意味着该模型不会面向公众开放完整能力,而是仅向经过严格审核的特定安全研究机构或合作伙伴提供访问权限,且使用过程将受到持续监控与行为审计。
OpenAI强调,此举旨在平衡技术探索与安全风险。Preparedness Framework作为其内部风险分级工具,专为评估前沿AI模型可能带来的生物、网络、核武等潜在危害而设计。Critical等级的出现,促使公司将安全协议提升至最高优先级。
对于行业而言,这一事件具有双重信号:一方面,AI驱动的自动化漏洞发现能力正快速逼近实战水平;另一方面,头部实验室对高危能力的管控方式,或将成为后续AI安全治理的参考范式。目前,OpenAI尚未公布Astra的具体技术细节及发布时程。
本文由新大陆基于公开信息编辑整理
信息来源:AIHOT AIHOT原文 ↗