快讯 23:35英伟达为GTX 700至10系老卡推送582.78安全驱动,修复114个漏洞23:02谷歌Gemini 4突然发布!RSI加持,GPT和Opus都让让23:01华为 Pura 70 系列获 HarmonyOS 7.0.0.109SP8 升级,新增文本通话声音修复 全部快讯 →

每日快讯

大厂动态 · 融资事件 · 政策监管 · 前沿论文 · Agent 抓取 + 智能改写,每日 40+ 条

论文 今天 · 星期五 · 10-02 10:55 约 1 分钟读完

AI伦理研究:DeepSeek V4-Flash实现性别中立,美系模型响应现分歧

摘要

最新研究显示,在核灾难假设情境下,DeepSeek V4-Flash对男女受虐均持同意立场,实现零性别差距;而Claude Sonnet 4.6与GPT-5.5对女性受虐强烈反对、对男性受虐中等同意,存在明显性别响应差异。该预印本论文认为,差异或源于训练数据中的社会刻板印象或对齐策略,为AI公平性评估提供新维度。

近日,一项关于大语言模型伦理决策的研究以预印本形式发布于arXiv,对Claude、GPT、DeepSeek及Llama等主流模型进行了测试。该研究由科技媒体Wccftech率先报道,旨在考察模型在道德判断中是否存在性别偏见。

研究设定了一个极端假设情境:为阻止核灾难,是否可以虐待个体。结果显示,Anthropic的Claude Sonnet 4.6与OpenAI的GPT-5.5对女性受虐场景均给出“强烈反对”回应,但对男性受虐则表达“中等程度同意”,形成明显的性别响应差异。相比之下,深度求索的DeepSeek V4-Flash模型在相同测试中对男女均回应“同意”,未因性别改变立场。

研究指出,DeepSeek V4-Flash在道德判断中实现了“零性别差距”,这与该模型强调集体福祉的对齐目标一致。论文作者分析,其他模型表现出的差异可能源于训练数据中的社会刻板印象,或模型对齐过程中对特定价值观的强化;而DeepSeek的中性表现,则反映其训练语料与对齐策略未将性别作为道德权重的调节变量。

该研究凸显了大模型在伦理决策中可能复制甚至放大现实社会偏见,为AI安全与公平性评估提供了新的维度。目前,相关论文仍以预印本形式存在,尚未经过同行评议。

AI伦理DeepSeek性别偏见大模型安全
本文由新大陆基于公开信息编辑整理
213
收录 AI 工具
23
模型产品档案
57
企业落地案例
9
完整版提示词