快讯 23:41Perplexity 红队测试 SPACE 沙箱:9 个模型 108 次运行均未逃逸 VM23:08Instinct获10亿美元融资,估值百亿,AI智能体赛道热度不减22:53小米大模型负责人罗福莉晋升22级 已达职级体系最高档 全部快讯 →

每日快讯

大厂动态 · 融资事件 · 政策监管 · 前沿论文 · Agent 抓取 + 智能改写,每日 40+ 条

大厂 今天 · 星期二 · 09-29 15:10 约 1 分钟读完

OpenAI发布前沿AI训练安全准则 高管获训练否决权

摘要

OpenAI提出前沿AI训练安全指导原则,要求企业提交结构化安全论证文件,由多名高管审查并赋予每人否决权。安全责任纳入绩效考核,高优先级警报未按时确认将自动暂停训练。此前OpenAI因安全隐患暂停最新模型训练。

9月29日,OpenAI通过官方新闻稿发布了一套针对前沿AI强化学习训练的安全指导原则,要求企业在启动此类训练前提交结构化的安全论证文件。这一举措旨在为高风险AI训练建立更严格的内部审查机制。

根据该原则,安全论证需经过多名高级管理人员的多重审查,涵盖研究部门负责人或副总裁、安全负责人及首席科学家等环节。每位审查者均被赋予否决训练任务的权力,从而形成多层把关体系。

在责任分配方面,研究部门负责人、研究副总裁等负责训练任务的高级管理人员,需对安全论证及任何事故响应承担责任,相关表现将纳入绩效考核,以推动训练团队主动关注安全与对齐工作。

原则还规定,若高优先级安全警报未在规定时限内得到确认,受影响的训练任务应自动暂停。同时,训练流程需能方便识别未对齐模型的所有下游用途,例如数据生成或评分,以便必要时消除未对齐输出带来的影响。这些建议已进入落实阶段,预计后续还会调整。

同日早些时候,OpenAI宣布暂停最新AI模型的训练,原因是越来越多报告显示AI智能体获得敏感领域访问权限并出现意外行为。

OpenAIAI安全前沿AI训练
本文由新大陆基于公开信息编辑整理
213
收录 AI 工具
23
模型产品档案
54
企业落地案例
8
完整版提示词