字节跳动 Seed 团队发现,DeepSeek-V4 在长文本处理中存在一种规律性弱点。研究人员让模型补全一段代码,代码本身没有变化,只延长前面一段无关注释,模型给出的答案就会在正确和错误之间来回切换。
错误会按固定周期出现
根据研究结果,V4-Flash 基础版每隔 4 个 Token 重复一轮,V4.1-Flash 也有类似现象,但周期变成了 2 个 Token。
字节将这种周期性检索差异称为「相位敏感性」。
问题指向分块 KV 缓存压缩
研究认为,这一问题与 DeepSeek 为节省显存采用的「分块 KV 缓存压缩」有关。该方法会把连续几个 Token 的信息合并保存,以降低处理长文本的成本。
但在压缩过程中,不同位置的信息保留程度并不一致,部分位置上的内容在后续更难被准确找回,这也使模型在输入位置变化后出现规律性波动。
测试结果与对照实验
在约 12.8 万 Token 的检索测试中,V4-Flash 基础版在不同位置上的准确率最高相差 40.2 个百分点。经过后训练后,这一差距缩小到 19.1 个百分点;V4.1-Flash 进一步缩小到 6.1 个百分点,但周期性波动仍未消失。
字节还从零训练了多组对照模型,结果显示,波动周期与压缩步幅一致;未使用分块压缩的对照模型,则没有出现相同规律。
本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.

