AI 实验室 Banbury Road 发布了 Kardashev-0.7。该系统由 32 个不同模型组成,团队通过强化学习让这些模型一起训练,并未预先规定每个模型分别负责什么,而是让它们在训练过程中自行形成不同专长和互补能力。
Banbury Road 将这套方法称为 RL for Population Scaling(RLPS)。在此之前,RLPS 实验最多扩展到 16 个模型,这次 Kardashev-0.7 将规模进一步提升到 32 个模型。
8 模型与 16 模型实验结果
在 8 模型实验中,共同训练后的模型群体得分为 81.70%,高于 8 个独立训练模型的 71.04%,也高于同一个模型重复采样 8 次的 72.65%。
在 16 模型实验中,有 22 道题只有其中 1 个模型答对。Banbury Road 据此认为,不同模型确实学出了不同能力。
Kardashev-0.7 的成本与现状
Banbury Road 表示,Kardashev-0.7 能以 0.007 至 0.02 倍的推理成本、0.03 倍的内存达到前沿模型级表现。目前,其 API Beta 仍需加入候补名单才能使用。
尚未公开的关键问题
不过,此前 8 模型和 16 模型实验中的群体成绩,是在事后根据标准答案,从多个模型输出中选出最好结果。实际使用时并不存在标准答案,系统如何自动挑出正确回答,Banbury Road 目前还没有公开完整方案。
本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.

