您的位置首页 >资讯 >

字节找到 DeepSeek 模型时强时弱背后的技术原因

字节 Seed 团队通过研究找到了 DeepSeek 模型时强时弱的核心原因,该现象来自模型采用的分块 KV 缓存压缩技术带来的相位敏感性。同样的问题和文本内容,仅仅改动信息在输入中的位置,模型回答效果就会出现周期性波动,在长上下文检索场景下,准确率最高可以相差 40 个百分点,这个发现清晰解释了 DeepSeek 模型表现不稳定的底层原理,也为行业优化长上下文大模型的压缩方案提供了重要参考。

产生性能波动的底层原理

  1. DeepSeek-V4 系列模型使用分块 KV 缓存压缩技术,把连续文本标记划分成固定窗口,压缩窗口内的缓存数据,降低长文本推理的内存占用与计算开销。
  2. 这套压缩机制会新增一个相位参数,代表文本标记相对于压缩窗口边界所处位置。
  3. 相同信息处在不同相位位置时,模型检索信息的能力会出现明显差异,也就是相位敏感性,最终造成模型输出效果时强时弱。

字节团队的验证步骤

  1. 选定 DeepSeek-V4 系列多个版本模型开展长上下文检索测试,构造大量测试用例。
  2. 保持问题内容不变,仅调整目标信息在输入文本里的位置,观察模型准确率变化。
  3. 记录数据,发现模型性能会以 4 个 Token 为周期周期性起伏,确认相位敏感性规律。
  4. 开展对照实验,复现该现象,验证该问题由分块 KV 缓存压缩机制引发。

本次研究带来的价值

字节团队的这项研究,帮助行业看懂长上下文 KV 缓存压缩方案存在的特性,后续模型研发人员可以针对性优化压缩策略,缓解相位敏感性带来的性能波动,进一步提升大模型长文本处理的稳定性。

【常见问题】

问题 1:字节找到的 DeepSeek 模型时强时弱的核心原因是什么?

回答 1:字节找到的 DeepSeek 模型时强时弱的核心原因是分块 KV 缓存压缩带来的相位敏感性,信息处在压缩窗口不同相位位置,模型检索能力会周期性变化。

问题 2:DeepSeek 模型时强时弱的现象主要发生在哪类任务场景?

回答 2:DeepSeek 模型时强时弱的现象主要出现在长上下文检索任务,在长文本场景下,相位敏感性会造成模型准确率出现明显起伏。

问题 3:字节研究 DeepSeek 模型时强时弱的现象,对 AI 行业有什么帮助?

回答 3:字节研究 DeepSeek 模型时强时弱的现象,揭示了 KV 缓存压缩方案的特性,为优化长上下文大模型、降低性能波动提供技术参考。

【数据来源】

[2026‑10‑09](字节找到了 DeepSeek 时强时弱的原因)量子位

[2026‑10‑09](DeepSeek 为啥 “时灵时不灵”?字节团队找到原因了:相位敏感性)新浪财经

免责声明:本文信息来源于公开网络资讯,仅供技术科普参考,不构成技术选型、产品采购建议,相关模型原理与实验结论请以论文及官方发布为准。

免责声明:本文由用户上传,与本网站立场无关,如有侵权请联系删除!财经信息仅供读者参考,并不构成投资建议,投资者据此操作,风险自担。

今日大家都在搜的词: