普林斯顿博士生 Yifan Zhang 提出 Recurrent Looped Transformer(RLT),为 Transformer 增加了一条会持续向后传递的内部状态。
普通 Transformer 在生成下一个 Token 时,主要通过 Attention 和 KV 缓存读取前文。RLT 除了读取前文,还会把上一个 Token 计算结束后留下的内部状态,直接交给下一个 Token 继续使用。
按文中的比喻,这相当于给模型加上一根「思维接力棒」。第一个 Token 计算完成后,把当前状态传给第二个;第二个更新后,再传给第三个。虽然每个 Token 自身经过的网络层数没有变化,但这条状态链会随着文本变长而不断延伸。
论文将这一点称为「无限时间深度」,意思是这条计算链没有固定长度上限。
报道还提到,RLT 与近期讨论较多的 Ouro、Astra 一类循环架构并不相同。后者主要是让同一个 Token 在同一套网络中运行多轮;RLT 则是让不同 Token 之间持续传递内部状态。前一种方式更像一道题在交卷前反复检查几遍,后一种则更像上一棒跑完后,把手里的进度直接交给下一棒。
本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.

