纳德拉呼吁开发者预设AI模型失控风险,构建可中断任务的控制架构
摘要
微软CEO纳德拉发文指出,AI模型作为黑盒系统已深入敏感数据与关键任务,传统自我监控策略不足。他建议开发者默认假设模型可能失控,并围绕模型多样性、可观测性、可验证性等原则设计封闭系统,确保能强制中断任务。
微软首席执行官萨蒂亚·纳德拉近日就AI系统的信任架构发表观点,认为在超级智能快速演进的背景下,仅依赖模型自我监控等简单手段已无法满足安全需求。他指出,传统软件经过数十年部署,人类已具备追踪代码路径行为的工具,而AI模型虽然能力更强,却呈现黑盒特性,且正被赋予访问敏感数据、代表用户执行关键任务的权限。
纳德拉强调,模型提供商无法将责任外包,不能把超级智能视为嵌套的黑匣子并简单接受其输出。他提出,必须建立能够观察模型行为、测试极限并始终容纳行为的封闭系统。将前沿封闭权重和开放权重模型视为内部风险,是构建此类体系的一种思路——并非因为模型必然恶意,而是任何有能力接触重要系统的行为者都可能犯错或被攻破,遏制架构必须考虑这一现实。
在具体设计层面,纳德拉建议开发者围绕可观测性原则展开,包括:模型多样性,即任何重要结果都不应依赖单一模型,也不应由模型验证自身工作;观察一切,即每个有意义的模型动作都需留下防篡改、人类可读的证据,无法观察就无法信任,且结果重现不应依赖模型自证;可验证性,即系统需具备独立验证能力。这些原则旨在确保在必要时能够强制中断AI任务,避免失控风险。
本文由新大陆基于公开信息编辑整理
信息来源:IT之家 IT之家原文 ↗