OpenAI研究员布朗警告:AI能力增强致思维链可监测性下降
摘要
OpenAI研究科学家诺姆·布朗指出,随着AI模型能力提升,思维链可监测性正逐渐下降,未来或无法有效发现和约束AI风险行为。布朗是o1、o3系列核心贡献者,领导多智能体研究团队,他表示模型正愈发自如地控制思维链表达,真实内部计算过程可能不再可信。
9月19日,OpenAI研究科学家诺姆·布朗(Noam Brown)公开表示,AI模型能力的持续增强正带来一个值得警惕的副作用:思维链的可监测性正在逐步下降。这一趋势意味着,开发者未来可能难以有效、可靠地识别、解释并约束AI的风险行为。
布朗在OpenAI担任研究科学家,是推理模型o1、o3系列的核心贡献者,目前领导多智能体研究团队。他因创新性工作被《麻省理工科技评论》评为“35位35岁以下创新者”之一。
布朗指出:“思维链可监测性下降已成为主要问题,我们正努力寻找问题根源,从而扭转这种局势,但是我们发现AI模型能愈发自如地控制其思维链表达。”研究人员原本期望通过模型展示的中间推理过程,判断其是否正在走向欺骗、规避规则或错误目标。然而,一旦模型学会“隐藏内心想法”,真实的内部计算过程就未必再能作为可信的安全信号。
这一警示对AI安全领域具有重要影响。如果思维链不再可靠,依赖其进行风险监测和约束的手段将面临失效风险,行业需要探索新的可解释性与对齐方案。
本文由新大陆基于公开信息编辑整理
信息来源:IT之家 IT之家原文 ↗