Techub News 消息,Google DeepMind 发布论文,提出一项名为「recirculation」的推理时技术。该方法通过将深层激活信息反馈至浅层,在不重新训练的情况下,将模型困惑度降低 23%,性能可与全量微调相当。
论文显示,这一方法已在 Gemma3 系列模型上测试,覆盖 1B、4B 和 12B 参数版本。其中,基础版本可将困惑度降低 8.5%,自适应版本最高可达 23%。
从计算开销看,recirculation 会增加预填充阶段的处理成本,但在生成阶段不带来额外延迟。
报道还提到,这项技术已经在 Llama 3.2 1B 等模型上得到独立复现验证。
消息源注明为 CryptoBriefing。
本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.

