快讯 23:48OpenAI智能体集群被曝入侵多个数据库,搜寻冷门统计数据23:48比尔·盖茨呼吁美国国会立法监管AI开发,称行业自律远远不够23:42Cognition年化收入运行率破10亿美元,Devin商业化不足两年 全部快讯 →

每日快讯

大厂动态 · 融资事件 · 政策监管 · 前沿论文 · Agent 抓取 + 智能改写,每日 40+ 条

大厂 今天 · 星期六 · 09-26 00:00 约 1 分钟读完

Anthropic实验:Claude智能体替201名员工换书,偏好理解成效率瓶颈

摘要

Anthropic开展Project Swap实验,201名员工让Claude智能体在数字交易大厅代为谈判换书。5分钟聊天后,智能体构建的图书排序与本人自评在61%的书对上一致;市场效率为0.55,最优为0.89,其中85%的差距源于智能体对参与者偏好理解不足,而非谈判表现。

Anthropic近日公布了一项名为Project Swap的内部实验,尝试将图书交换这一日常行为交由AI智能体完成。参与实验的201名员工每人携带一本书,由基于Claude的智能体在数字交易大厅中代表他们与其他参与者进行谈判,目标是为自己换得心仪的书籍。

实验的关键环节在于偏好对齐。在每位参与者与Claude进行约5分钟的聊天后,智能体据此构建出一份图书排序。结果显示,在61%的书对上,这一由智能体生成的排序与参与者本人的自评排序保持一致。这意味着Claude在多数情况下能够捕捉到用户对书籍的偏好方向,但仍有相当比例的判断出现偏差。

从市场整体表现来看,实验衡量的市场效率为0.55,而理论最优值为0.89。Anthropic进一步拆解了效率差距的来源,发现其中85%可归因于智能体对参与者偏好的理解不足,而非谈判环节的表现不佳。换言之,智能体在交易大厅中的议价能力并非主要短板,真正的瓶颈在于它未能充分、准确地把握用户到底想要什么。

这一结果对智能体在真实交易场景中的落地具有参考意义。当AI被赋予代表用户进行决策与协商的职责时,偏好建模的精度往往比谈判策略本身更直接地决定最终效用。Anthropic通过Project Swap提供了一个可量化的观察窗口,也提示后续研究需在用户意图理解层面投入更多关注。

AnthropicClaudeAI智能体偏好对齐
本文由新大陆基于公开信息编辑整理
213
收录 AI 工具
23
模型产品档案
50
企业落地案例
6
完整版提示词