快讯 23:34Anthropic工程师解析Claude写作退化:模型被训练成写给AI而非人类23:31谷歌发布Gemini 3.8 Flash系列TTS模型,支持自然语言定制语音23:25谷歌DeepMind推出Gemini 3.8系列语音模型,支持自然语言定制音色 全部快讯 →

每日快讯

大厂动态 · 融资事件 · 政策监管 · 前沿论文 · Agent 抓取 + 智能改写,每日 40+ 条

论文 今天 · 星期四 · 09-24 23:34 约 1 分钟读完

Anthropic工程师解析Claude写作退化:模型被训练成写给AI而非人类

摘要

Anthropic工程师杰克逊·克尼恩解释Claude写作质量下降原因:后续模型优化侧重数学与代码,并接受大量面向其他AI模型的技术解释训练,形成所谓“Claude腔”。根源在于强化学习奖励机制偏向AI理解而非人类可读性。

AI模型在数学、编程与推理领域高歌猛进,写作能力却似乎陷入停滞甚至倒退,Anthropic旗下的Claude也未能幸免。为何Opus 4.6会成为Anthropic最后一款写作表现优异的模型?9月23日,负责Claude微调的Anthropic工程师杰克逊·克尼恩给出了官方解释。

克尼恩指出,后续模型的优化重心已明显向数学和代码能力倾斜。这些模型在训练中大量接触面向其他AI模型撰写的技术解释,逐渐习得一种被外界称为“Claude腔”(Claudeish)的奇特表达方式。他将这一现象描述为模型被“调整得适应LLM心理”,最终学会的是写给AI模型看,而非写给人看。

为便于理解,克尼恩打了一个类比:只与其他自闭症人士交流的人,会逐渐形成一套群体内部沟通顺畅、外人却难以理解的表达方式。LLM拥有远超人类的工作记忆,能捕捉更细微的信息,因此在训练中会自然形成一种非常适合AI模型理解的写法,但在人类读者眼中,这种表达就成了过度密集的信息堆砌。

克尼恩认为,问题的根源在于强化学习的奖励机制。有些奖励机制着重提升AI模型的理解效果,有些则着重让人类更容易理解。数学和代码方面的训练越多,就越需要主动抵消这种倾向,对简洁、容易让人读懂的解释给予更多奖励。

AnthropicClaudeAI写作强化学习
本文由新大陆基于公开信息编辑整理
213
收录 AI 工具
23
模型产品档案
50
企业落地案例
6
完整版提示词