Arcee开源Trinity-Large-Thinking:Agent能力紧咬Opus 4.6,价格仅4%

Arcee开源Trinity-Large-Thinking:Agent能力紧咬Opus 4.6,价格仅4%

N
News Editor 01
2026-07-23 06:50:14
美国AI创企Arcee发布开源推理模型Trinity-Large-Thinking,Agent基准PinchBench得分91.9,仅次Opus 4.6,Tau2-Airline夺最高分。采用400B MoE架构,推理算力仅13B,API定价$0.90/百万token,较Opus便宜96%。
ArceeTrinity-Large-Thinking开源AI模型Agent基准Opus 4.6

员工不到一百人的美国AI初创Arcee,扔出一颗重磅炸弹:开源推理模型Trinity-Large-Thinking在Agent场景基准中紧咬Anthropic旗舰Opus 4.6,定价却只有后者的4%。

Agent双基准:紧贴Opus,一项夺魁

在衡量模型Agent工作流实战能力的PinchBench上,Trinity-Large-Thinking拿下91.9分,而Opus 4.6为93.3,差距仅1.4%。另一项模拟真实客服的Tau2-Airline基准中,它更以88.0分超越所有对比模型。这意味着多轮对话与工具调用场景下,开源模型已具备顶尖水准。

定价更显激进:API输出费用为$0.90/百万token,官方称比Opus 4.6便宜约96%。对于需长期运行Agent、大量消耗token的应用,成本优势可能比分数差距更具颠覆性。

400B总参数,���理只烧13B算力

实现这一性价比的关键在架构。Trinity-Large-Thinking采用稀疏MoE设计,内置256个专家模块,每次处理token仅激活其中4个。400B参数的庞然大物,实际推理时只需13B算力,执行效率约为同量级密集模型的2-3倍。

相比1月底发布的Preview版,最大升级是加入了推理思考链。Thinking版本会在回答前先“想一下”,显著提升多轮工具调用的稳定性和长上下文连贯性。Arcee直白表示:这个模型专为长期Agent循环不崩溃而设计。

基础模型训练耗时33天、耗资2000万美元;Thinking版本的后训练又打磨了9个月。

Arcee CEO Lucas Atkins在发布文中写道:“Getting here took difficult technical work, hard calls…Nobody did that. They kept pushing.”

通用推理非强项,瞄准中国开源阵营

专精Agent也意味着取舍。通用推理基准上,Trinity-Large-Thinking表现平平:GPQA-D得分76.3,而Kimi K2.5为86.9、Opus 4.6达89.2;MMLU-Pro的83.4在对比中垫底。

但Arcee不打算硬拼这一方向。官方称Trinity-Large-Thinking是“许多维度上中国以外最强的开源模型”,明确对手不是Opus或GPT,而是DeepSeek、Kimi等中国开源阵��

模型已同步上架OpenRouter,前5天在OpenClaw中免费使用。前代Preview自1月底上线以来,在OpenRouter上累计处理超过3.37万亿token,在OpenClaw统计中为美国使用量第一、全球第四的开源模型。对于小初创,这一采用率验证了“便宜好用”的市场需求。

模型权重以Apache 2.0授权在Hugging Face公开,任何人可下载、修改、商用部署。

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
400

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。