快讯 23:53Claude 九月更新:Chat 与 Cowork 合并,5.5 系列模型登场23:07华为鸿蒙7.0.0.109补丁推送,多设备通信共享功能落地Mate 80系列22:50鸿蒙API分布更新:7.0.0版本占比逼近19%,5.0.0系列彻底退出 全部快讯 →

每日快讯

大厂动态 · 融资事件 · 政策监管 · 前沿论文 · Agent 抓取 + 智能改写,每日 40+ 条

大厂 今天 · 星期五 · 10-09 08:49 约 1 分钟读完

字节Seed团队论文揭示DeepSeek长上下文性能漂移机制

摘要

字节Seed团队在arXiv发表论文,指出分块KV缓存压缩引入的相位敏感性是DeepSeek长上下文检索性能波动的根源。研究评估多款DeepSeek模型发现,相同信息在不同相位检索难度差异显著,准确率波动可达40个百分点,平均基准分数可能掩盖这一周期性弱点。

字节跳动Seed团队于9月底在预印本平台arXiv提交了一篇研究论文,将目光投向大模型长上下文推理中的一个隐蔽问题。论文指出,分块KV缓存压缩技术虽然能有效降低长上下文场景下的内存占用与注意力计算成本,但其引入的相位敏感性正是DeepSeek模型表现不稳定的关键诱因。

该研究覆盖了多个DeepSeek模型版本,包括基础版与后训练版的DeepSeek-V4-Flash、DeepSeek-V4-Pro,以及经过后训练的DeepSeek-V4.1-Flash。研究揭示,分块KV缓存压缩以固定步幅将连续标记窗口压缩为更少的缓存条目,这一过程产生了一个新的位置坐标——Token的相位,即其相对于压缩窗口边界的位置。

团队在采用此类压缩的模型中观察到了系统性的不对称现象:同一信息在某个相位下可被轻松检索,而在另一相位下则难以获取。研究人员将这种检索性能随相位周期性起伏的现象命名为相位敏感性(phase sensitivity)。在大型开放权重模型中,长上下文检索准确度在不同相位间的差距最高可达40个百分点。

这一发现意味着,单纯依赖平均基准分数评估模型长上下文能力可能存在盲区——周期性弱点会被整体均值所掩盖。论文为理解DeepSeek等模型在长上下文任务中的性能波动提供了新的分析视角,相关预印本已公开于arXiv平台。

字节SeedDeepSeek长上下文KV缓存压缩
本文由新大陆基于公开信息编辑整理
213
收录 AI 工具
23
模型产品档案
60
企业落地案例
11
完整版提示词