字节团队发现 DeepSeek-V4 长文本处理存在周期性错误

字节团队发现 DeepSeek-V4 长文本处理存在周期性错误

N
News Editor
2026-10-09 04:42:25
字节跳动 Seed 团队称,DeepSeek-V4 在长文本代码补全中存在规律性弱点:代码不变,仅延长前置无关注释,答案就会在正确与错误之间周期切换。研究将这一现象归因于分块 KV 缓存压缩带来的「相位敏感性」。在约 12.8 万 Token 检索测试中,V4-Flash 基础版不同位置准确率最高相差 40.2 个百分点,后训练后缩至 19.1 个百分点,V4.1-Flash 进一步缩至 6.1 个百分点。

字节跳动 Seed 团队发现,DeepSeek-V4 在长文本处理中存在一种规律性弱点。研究人员让模型补全一段代码,代码本身没有变化,只延长前面一段无关注释,模型给出的答案就会在正确和错误之间来回切换。

错误会按固定周期出现

根据研究结果,V4-Flash 基础版每隔 4 个 Token 重复一轮,V4.1-Flash 也有类似现象,但周期变成了 2 个 Token。

字节将这种周期性检索差异称为「相位敏感性」。

问题指向分块 KV 缓存压缩

研究认为,这一问题与 DeepSeek 为节省显存采用的「分块 KV 缓存压缩」有关。该方法会把连续几个 Token 的信息合并保存,以降低处理长文本的成本。

但在压缩过程中,不同位置的信息保留程度并不一致,部分位置上的内容在后续更难被准确找回,这也使模型在输入位置变化后出现规律性波动。

测试结果与对照实验

在约 12.8 万 Token 的检索测试中,V4-Flash 基础版在不同位置上的准确率最高相差 40.2 个百分点。经过后训练后,这一差距缩小到 19.1 个百分点;V4.1-Flash 进一步缩小到 6.1 个百分点,但周期性波动仍未消失。

字节还从零训练了多组对照模型,结果显示,波动周期与压缩步幅一致;未使用分块压缩的对照模型,则没有出现相同规律。

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
300

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。