普林斯顿博士生提出 RLT 架构,让 Token 之间持续传递内部状态

普林斯顿博士生提出 RLT 架构,让 Token 之间持续传递内部状态

N
News Editor
2026-09-14 08:33:35
普林斯顿博士生 Yifan Zhang 提出 Recurrent Looped Transformer(RLT),在 Transformer 中加入可持续向后传递的内部状态。与普通 Transformer 主要依赖 Attention 和 KV 缓存读取前文不同,RLT 会把上一个 Token 计算后的内部状态直接交给下一个 Token。论文将这条随文本延长而持续延伸的计算链称为「无限时间深度」,并指出其与 Ouro、Astra 等让同一 Token 多轮计算的循环架构不同。

普林斯顿博士生 Yifan Zhang 提出 Recurrent Looped Transformer(RLT),为 Transformer 增加了一条会持续向后传递的内部状态。

普通 Transformer 在生成下一个 Token 时,主要通过 Attention 和 KV 缓存读取前文。RLT 除了读取前文,还会把上一个 Token 计算结束后留下的内部状态,直接交给下一个 Token 继续使用。

按文中的比喻,这相当于给模型加上一根「思维接力棒」。第一个 Token 计算完成后,把当前状态传给第二个;第二个更新后,再传给第三个。虽然每个 Token 自身经过的网络层数没有变化,但这条状态链会随着文本变长而不断延伸。

论文将这一点称为「无限时间深度」,意思是这条计算链没有固定长度上限。

报道还提到,RLT 与近期讨论较多的 Ouro、Astra 一类循环架构并不相同。后者主要是让同一个 Token 在同一套网络中运行多轮;RLT 则是让不同 Token 之间持续传递内部状态。前一种方式更像一道题在交卷前反复检查几遍,后一种则更像上一棒跑完后,把手里的进度直接交给下一棒。

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
900

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。