近期,字节跳动团队发表题为《Periodic Weak Spots: Phase Sensitivity from Chunked KV-Cache Compression》的论文,指出 DeepSeek V4 系列模型在采用分块 KV Cache 压缩技术时,存在显著的“相位敏感性”问题。这意味着模型对输入文本中关键信息的位置极度敏感,微小的空白字符变化或位置偏移可能导致答案从正确变为错误,这种现象被称为“神鬼二象性”。

分块压缩引发周期性失忆

研究团队通过代码补全实验发现,DeepSeek-V4-Flash-Base 在特定条件下表现出强烈的周期性错误规律。当在代码前添加装饰性等号时,若等号数量除以 4 余数为 0 或 1,模型错误率高达 71.3%;若余数为 2 或 3,正确率则回升至 91.5%。这种错误并非随机,而是源于分块压缩机制中 Token 相对位置(即“相位”)对门控层权重的影响。处于“盲点槽位”的 Token 容易被忽略,导致关键信息丢失。

为了验证这一现象的普遍性,团队进行了“大海捞针”测试,在 128K Token 的长上下文中检索特定键值对。结果显示,DeepSeek-V4-Flash-Base 在不同位置间的准确率最大差距达 40.2%,V4-Pro-Base 差距为 34.8%。即使经过后训练优化,差距仍维持在 19.1% 和 14.8%。DeepSeek 随后推出的 V4.1-Flash 通过将压缩步长从 4 降至 2,将准确率差距缩小至 6.1%,但未能完全消除该问题。

结构性缺陷与动态分块探索

字节团队使用 Qwen3-0.6B 架构进行对照实验,证实只要采用固定长度的分块压缩,模型就会出现周期性准确率波动,且波动周期严格等于压缩步长。这一现象与 RoPE 位置编码无关,也非参数调优问题,而是分块压缩方案本身的结构性缺陷。相比之下,未采用压缩的全注意力基线模型未出现此类波动。

针对这一缺陷,业界开始探索“动态分块”技术,即根据语义密度灵活调整切块边界,而非固定 Token 数量。香港科技大学(广州)团队提出的 ChunkKV 技术以连续语义块为压缩单位,在 NIAH 测试中,基于 LLaMA-3 的 ChunkKV 准确率达到 73.8%,显著优于传统 SnapKV 方法的 58.9%。此外,微软亚洲研究院的 MInference 框架利用注意力矩阵的稀疏规律,在百万字长文本推理中实现了最高 10 倍的预填充加速。

长文本处理的技术演进方向

分块 KV Cache 压缩曾是降低长上下文显存成本的关键手段,但其引入的位置敏感性限制了模型在复杂任务中的可靠性。随着用户从单纯追求上下文长度转向关注实际任务中的信息准确性与完整性,动态分块、稀疏计算等新技术成为解决“读不懂、找不准”问题的核心突破口。未来,平衡显存效率与语义完整性的架构设计,将是长文本大模型提升实际可用性的关键所在。