上海 AI Lab 和上海交大发布了 89 亿参数模型 NCP-ArchPreview。与普通大模型主要训练「猜下一个 token」不同,NCP 还会预测后面一小段内容对应的内部概念信号,再把这套信号用于辅助 token 生成。
最终输出形式没有改变,模型仍然是逐 token 生成,但在内部处理上,已经会提前猜测后文。
NCP 把内部信号用于草稿生成
这套内部概念信号也可以用于投机解码提速。DFlash、DSpark 这类方案通常是先让一个小模型预测后文,再交给大模型统一检查。NCP 团队则把内部概念信号也交给这个小模型,相当于先提供一点「后面大概怎么写」的提示,再让它一次并行猜 16 个 token。
按照团队介绍,这样做后,小模型猜中的内容更多。
测试数据与训练开销
在四项测试中,大模型每验证一次,平均能通过的 token 数从 5.933 个升至 6.180 个,提升 4.17%;在 HumanEval 上,提升幅度为 7.59%。接入这套信号后,草稿模型只增加约 4 万参数。
在训练效率上,同样是 89 亿参数规模,NCP 用普通 Transformer 约 85% 的训练计算量,就能把训练误差降到接近的水平。
本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.

