您的位置首页 >资讯 >

字节团队探明 DeepSeek 模型性能时强时弱背后的技术原因

字节 Seed 团队通过实验研究,找到了 DeepSeek 模型在长上下文场景下表现时强时弱的技术原因,该现象来自模型使用的分块 KV Cache 压缩技术带来的相位敏感性。这项压缩技术原本用于降低长文本推理的内存开销与计算量,提升模型处理长上下文的效率,但会造成模型检索效果随 Token 所处压缩窗口位置周期性波动。在测试中,仅仅改变信息在输入文本里的位置,模型检索准确率就会出现明显差异,最高差距可达 40.2 个百分点,不同版本模型经过优化后,性能波动幅度能够得到缩减。

核心技术概念说明

  • 分块 KV Cache 压缩:长上下文优化方案,按固定步长把连续 Token 窗口压缩成更少缓存条目,减少算力和内存占用。
  • 相位敏感性:信息所处 Token 相对于压缩窗口边界的位置会影响模型检索效果,性能呈现周期性起伏。
  • 测试对象:DeepSeek-V4 系列多个版本模型,包含基础版、Pro 版以及后续迭代优化版本。

实验观测要点

  1. 性能变化规律:模型检索效果以 4 个 Token 为周期发生变化,调整前置无关字符,就可能改变模型输出结果。
  2. 数据表现:DeepSeek-V4-Flash-Base 不同相位准确率最大相差 40.2 个百分点;迭代后的 DeepSeek-V4.1-Flash 版本波动幅度缩小。
  3. 原理逻辑:压缩方案引入额外位置维度,相同信息放在不同相位位置,模型检索识别难度不一样。

研究带来的参考价值

字节 Seed 团队的这项研究,让行业更清楚 KV 缓存压缩方案存在的特性,能够帮助研发人员在设计长上下文模型时权衡压缩效率与检索稳定性,为后续大模型优化工作提供参考思路。

【常见问题】

问题 1:字节团队发现 DeepSeek 时强时弱是什么原因?

回答 1:字节团队发现 DeepSeek 时强时弱,根源是 DeepSeek 采用分块 KV Cache 压缩技术,带来相位敏感性,使得模型检索性能随 Token 位置周期性变化。

问题 2:分块 KV Cache 压缩这项技术有什么作用?

回答 2:分块 KV Cache 压缩是长上下文优化手段,能够降低内存与计算开销,也是造成字节团队观测到 DeepSeek 时强时弱现象的技术来源。

问题 3:相位敏感性会对 DeepSeek 模型带来怎样的影响?

回答 3:相位敏感性会让 DeepSeek 模型在长上下文检索任务中出现性能波动,也就是字节团队发现的模型时强时弱的现象,不同版本模型波动幅度有区别。

【数据来源】

[2026-10-09](字节找到了 DeepSeek 时强时弱的原因)量子位

[2026-10-09](DeepSeek “抽风” 原因找到了,字节 Seed 团队论文揭示相位敏感性)界面新闻

[2026-10-09](DeepSeek 为啥 “时灵时不灵”? 字节团队找到原因了:相位敏感性)新浪财经

免责声明:本文信息来源于公开媒体报道与学术预印论文,仅供技术资讯参考,模型实际表现请以开发者官方测试文档为准。

免责声明:本文由用户上传,与本网站立场无关,如有侵权请联系删除!财经信息仅供读者参考,并不构成投资建议,投资者据此操作,风险自担。

今日大家都在搜的词: