ChainCatcher 消息,Fireworks AI 发布测评报告称,其对开源模型 Kimi K3 与闭源模型 Fable 5 进行了约 1030 项代理任务的对比测试,覆盖 SWE、终端运维、算法、多语言编码及法律等场景。
测试结果显示,两款模型在 SWE 基准上的准确率分别为 92.4% 和 92.6%,整体表现接近。不过在细分领域中,两者各有侧重:K3 在符号数学与开发工具领域领先,Fable 5 则在 Web 与数据可视化方面占优。
在终端长周期任务中,K3 独立完成了 11 项 Fable 5 未能解决的任务。报告同时指出,若采用任务级路由策略,在两款模型之间动态分配任务,准确率可达到 93%,高于任一单一模型。
成本方面,报告称 K3 在 Fireworks 平台上具备明显优势。在长周期代理任务中,其成本可低至 Fable 5 的 1/50。基于上述结果,报告建议将开源模型作为默认选项,并通过路由器持续学习任务与模型之间的最优匹配,以平衡质量与成本。
本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.

