快讯 23:48华为鸿蒙星河互联登陆Apple Watch,首批适配Pura X View等三款机型23:19华为6.17英寸1.5K小直屏新机开案,小屏旗舰或迎回归22:42腾讯元器平台宣布2026年11月停服,智能体服务将全面终止 全部快讯 →

每日快讯

大厂动态 · 融资事件 · 政策监管 · 前沿论文 · Agent 抓取 + 智能改写,每日 40+ 条

论文 今天 · 星期日 · 10-11 07:19 约 1 分钟读完

纳德拉呼吁开发者预设AI模型失控风险,构建可中断任务的控制架构

摘要

微软CEO纳德拉发文指出,AI模型作为黑盒系统已深入敏感数据与关键任务,传统自我监控策略不足。他建议开发者默认假设模型可能失控,并围绕模型多样性、可观测性、可验证性等原则设计封闭系统,确保能强制中断任务。

微软首席执行官萨蒂亚·纳德拉近日就AI系统的信任架构发表观点,认为在超级智能快速演进的背景下,仅依赖模型自我监控等简单手段已无法满足安全需求。他指出,传统软件经过数十年部署,人类已具备追踪代码路径行为的工具,而AI模型虽然能力更强,却呈现黑盒特性,且正被赋予访问敏感数据、代表用户执行关键任务的权限。

纳德拉强调,模型提供商无法将责任外包,不能把超级智能视为嵌套的黑匣子并简单接受其输出。他提出,必须建立能够观察模型行为、测试极限并始终容纳行为的封闭系统。将前沿封闭权重和开放权重模型视为内部风险,是构建此类体系的一种思路——并非因为模型必然恶意,而是任何有能力接触重要系统的行为者都可能犯错或被攻破,遏制架构必须考虑这一现实。

在具体设计层面,纳德拉建议开发者围绕可观测性原则展开,包括:模型多样性,即任何重要结果都不应依赖单一模型,也不应由模型验证自身工作;观察一切,即每个有意义的模型动作都需留下防篡改、人类可读的证据,无法观察就无法信任,且结果重现不应依赖模型自证;可验证性,即系统需具备独立验证能力。这些原则旨在确保在必要时能够强制中断AI任务,避免失控风险。

微软纳德拉AI安全可观测性
本文由新大陆基于公开信息编辑整理
213
收录 AI 工具
23
模型产品档案
60
企业落地案例
11
完整版提示词