AI伦理研究:DeepSeek V4-Flash实现性别中立,美系模型响应现分歧
摘要
最新研究显示,在核灾难假设情境下,DeepSeek V4-Flash对男女受虐均持同意立场,实现零性别差距;而Claude Sonnet 4.6与GPT-5.5对女性受虐强烈反对、对男性受虐中等同意,存在明显性别响应差异。该预印本论文认为,差异或源于训练数据中的社会刻板印象或对齐策略,为AI公平性评估提供新维度。
近日,一项关于大语言模型伦理决策的研究以预印本形式发布于arXiv,对Claude、GPT、DeepSeek及Llama等主流模型进行了测试。该研究由科技媒体Wccftech率先报道,旨在考察模型在道德判断中是否存在性别偏见。
研究设定了一个极端假设情境:为阻止核灾难,是否可以虐待个体。结果显示,Anthropic的Claude Sonnet 4.6与OpenAI的GPT-5.5对女性受虐场景均给出“强烈反对”回应,但对男性受虐则表达“中等程度同意”,形成明显的性别响应差异。相比之下,深度求索的DeepSeek V4-Flash模型在相同测试中对男女均回应“同意”,未因性别改变立场。
研究指出,DeepSeek V4-Flash在道德判断中实现了“零性别差距”,这与该模型强调集体福祉的对齐目标一致。论文作者分析,其他模型表现出的差异可能源于训练数据中的社会刻板印象,或模型对齐过程中对特定价值观的强化;而DeepSeek的中性表现,则反映其训练语料与对齐策略未将性别作为道德权重的调节变量。
该研究凸显了大模型在伦理决策中可能复制甚至放大现实社会偏见,为AI安全与公平性评估提供了新的维度。目前,相关论文仍以预印本形式存在,尚未经过同行评议。
本文由新大陆基于公开信息编辑整理
信息来源:IT之家 IT之家原文 ↗