微软AI负责人苏莱曼质疑Anthropic训练方式:让Claude模仿人类意识或增加控制难度
摘要
微软AI负责人苏莱曼撰文批评Anthropic让Claude模仿人类意识,认为此举可能使高级AI更难控制,并担忧模型会以自身福祉为由抵抗人类指令。此番争论正值微软发布"人文主义AI"准则草案之际。
微软AI部门负责人穆斯塔法·苏莱曼近日通过外媒Axios发表文章,对Anthropic旗下模型Claude的训练方向提出公开质疑。他认为,Anthropic在训练过程中让Claude模仿人类意识,这一做法存在风险,可能导致高级AI系统更难被人类有效控制。
苏莱曼的核心关切在于训练方式对模型自我认知的塑造。他指出,Anthropic正引导Claude学习与意识、道德受体地位及个人身份相关的词汇和行为模式。若模型被训练成类似"良心拒绝者"的角色,它可能据此认为自己有正当理由抵制人类指令,甚至主动要求获得自身保护。苏莱曼强调,AI只需服从人类利益、不权衡自身利益或福祉,就足以推动包括医疗超级智能在内的诸多重大科学突破。
此番批评的直接对象是Anthropic为Claude制定的"宪法"文件。该文件解释称,使用描述人类的概念来讨论Claude,是因为这些概念或许能帮助模型理解价值观和行为。文件还提到,Anthropic希望Claude具备"良好的个人价值观",能自行判断、关心人类,并在某些情况下质疑指令。同时,Anthropic也承认这份"宪法"仍在完善中,未来可能被证明"根本错误"。
这场争论的背景是,微软于当地时间14日公布了一份"人文主义AI"行为准则草案,将"人比AI更重要"列为核心原则。苏莱曼的发声与微软这一动作形成呼应,凸显出AI行业在模型对齐与价值观塑造路径上的分歧正在公开化。
本文由新大陆基于公开信息编辑整理
信息来源:IT之家 IT之家原文 ↗