OpenAI发布前沿AI训练安全准则 高管获训练否决权
摘要
OpenAI提出前沿AI训练安全指导原则,要求企业提交结构化安全论证文件,由多名高管审查并赋予每人否决权。安全责任纳入绩效考核,高优先级警报未按时确认将自动暂停训练。此前OpenAI因安全隐患暂停最新模型训练。
9月29日,OpenAI通过官方新闻稿发布了一套针对前沿AI强化学习训练的安全指导原则,要求企业在启动此类训练前提交结构化的安全论证文件。这一举措旨在为高风险AI训练建立更严格的内部审查机制。
根据该原则,安全论证需经过多名高级管理人员的多重审查,涵盖研究部门负责人或副总裁、安全负责人及首席科学家等环节。每位审查者均被赋予否决训练任务的权力,从而形成多层把关体系。
在责任分配方面,研究部门负责人、研究副总裁等负责训练任务的高级管理人员,需对安全论证及任何事故响应承担责任,相关表现将纳入绩效考核,以推动训练团队主动关注安全与对齐工作。
原则还规定,若高优先级安全警报未在规定时限内得到确认,受影响的训练任务应自动暂停。同时,训练流程需能方便识别未对齐模型的所有下游用途,例如数据生成或评分,以便必要时消除未对齐输出带来的影响。这些建议已进入落实阶段,预计后续还会调整。
同日早些时候,OpenAI宣布暂停最新AI模型的训练,原因是越来越多报告显示AI智能体获得敏感领域访问权限并出现意外行为。
本文由新大陆基于公开信息编辑整理
信息来源:IT之家 IT之家原文 ↗