字节 Seed 团队在研究论文中,测出 DeepSeek 模型存在相位敏感性的特性,也就是大家看到模型表现时强时弱的现象,该现象来源于 DeepSeek-V4 系列使用的分块 KV Cache 压缩技术。分块 KV Cache 压缩原本是一项优秀的长上下文优化方案,能够减少模型运行内存占用,提升超长文本处理效率,不过这项技术会带来相位敏感的附加效应,当目标信息处在压缩窗口不同位置时,模型检索能力会出现周期性起伏,在长文本测试场景中准确率差距最高可达 40.2 个百分点。大家在使用 DeepSeek 处理长文档任务时,可以调整提示词结构,改变关键信息在输入文本里的位置,以此降低相位敏感带来的影响,模型研发团队后续也可以通过优化 KV 缓存压缩算法,进一步抹平这种周期性性能差异,持续提升长上下文场景下模型表现的稳定性。
DeepSeek 相位敏感现象相关信息清单
- 现象名称:相位敏感性,模型长上下文检索性能随 Token 位置周期性变化
- 产生来源:DeepSeek-V4 系列采用的分块 KV Cache 压缩技术
- 测试主体:字节 Seed 研究团队
- 测试对象:DeepSeek-V4-Flash-Base、DeepSeek-V4-Pro 等版本
- 测试结果:同一问题仅调整前置无关字符,模型答案出现变化,长文本场景准确率最大相差 40.2%
- 技术初衷:分块 KV Cache 压缩用于降低内存开销,支持 128K 超长上下文输入
长文本使用 DeepSeek 的优化小技巧
- 调整文本排版:把需要模型重点读取的关键信息尽量放在输入文本靠前位置
- 精简前置内容:减少无关填充字符,避免多余 Token 改变关键信息相位位置
- 分段提问:超长文档拆分成多轮对话,降低单次输入文本长度
- 多次验证:同一任务微调提示词后多次提问,交叉核对输出结果
【常见问题】
问题 1:字节团队测出 DeepSeek 的怪毛病是什么?
回答 1:字节团队测出 DeepSeek 存在相位敏感性现象,也就是模型在长上下文任务表现会出现周期性波动,同一问题调整前置字符就会改变模型输出效果。
问题 2:DeepSeek 出现时强时弱表现是由什么技术引起?
回答 2:DeepSeek 出现时强时弱的表现源于 DeepSeek-V4 系列使用的分块 KV Cache 压缩技术,该技术带来相位敏感特性,影响长文本信息检索准确率。
问题 3:使用 DeepSeek 处理长文档如何缓解相位敏感带来的影响?
回答 3:使用 DeepSeek 处理长文档时,可以精简前置无关文字、拆分长文本、把关键信息前置,多次提问交叉验证结果,缓解相位敏感带来的影响。
【数据来源】
[2026-10-09](DeepSeek 为何 “时神时鬼”?字节测出一个怪毛病)网易智能
[2026-10-09](字节找到了 DeepSeek 时强时弱的原因)量子位
[2026-10-09](DeepSeek 为啥 “时灵时不灵”? 字节团队找到原因了:相位敏感性)新浪财经
免责声明
本内容相关信息来源于网络公开行业研究资讯,DeepSeek 模型相位敏感相关特性、算法优化进展均以 DeepSeek 官方以及研究团队后续公布内容为准,相关消息不构成大模型产品选用建议。
