知名AI公司智谱AI(Zhipu AI)近日宣布,已成功定位并修复其GLM-5系列模型在编码代理(Coding Agent)场景中存在的两个关键漏洞。这两个被用户自3月以来持续报告的问题——包括输出乱码和重复文本——主要出现在高并发与长上下文长度(Long Context)的任务中,对开发者的实际使用造成了显著干扰。
漏洞一:PD分离架构中的竞态条件
第一个Bug根源于智谱AI采用的预填充-解码分离(PD-separation)架构。在高并发请求下,系统存在竞态条件(Race Condition),导致内存提前被回收,进而引发数据覆写(Data Overwrite)。该问题在长序列生成时尤为突出,因为此时内存管理时序更加复杂。修复团队通过调整内存回收的同步机制,确保所有未完成读取操作完成后才释放内存,从而彻底消除了该隐患。
漏洞二:HiCache异步缓存缺乏同步
第二个Bug存在于智谱AI自主研发的HiCache系统中。作为KV缓存的高效管理模块,HiCache采用异步卸载(Asynchronous Cache Offloading)以降低延迟,但原始实现缺少必要的同步操作(Synchronization),导致缓存数据在写入磁盘或从磁盘加载时出现过早读取(Premature Data Read)。这直接造成了输出结果的重复和乱码。工程团队在HiCache的卸载流程中增加了严格的同步屏障(Memory Barrier),并优化了读写顺序,从而确保缓存操作的原子性和一致性。
新型异常检测:基于推测采样的接受率指标
除了修复漏洞,智谱AI还意外发现了一个有用的异常检测信号:推测采样(Speculative Sampling)中的接受率(Acceptance Rate)变化。当模型开始出现生成异常时,该指标会先于实际错误发生变化。利用这一特性,团队实时监控接受率,一旦检测到异常波动,便自动触发重试机制(Automatic Retry),从而在用户感知到问题前进行恢复。这一方法为AI推理系统的稳定性保障提供了新的低成本思路。
LayerSplit KV Cache优化推动性能飞跃
为从根本上提升长上下文场景的推理效率,智谱AI对LayerSplit KV Cache进行了深度优化。该优化针对请求长度在40K至120K Token范围内的任务,通过更智能的分层缓存管理,将吞吐量最高提升了132%。实测数据显示,随着上下文长度的增加,优化带来的加速比呈线性增长趋势——这意味着处理超长文档、代码库分析等场景将获得极为显著的性能红利。
截至发稿时,所有修复方案已通过内部测试并部署至生产环境。智谱AI表示,将继续关注社区反馈,并在即将发布的GLM-5后续版本中集成更多稳定性改进与性能增强。此次事件也凸显了大型语言模型在落地企业级编码代理应用时,面临的工程化挑战——从闪存管理到并发控制,任何细微的时序缺陷都可能在复杂场景下被放大。

