Techub News 消息,DeepSeek V4 Flash 虽然登顶榜单,但在 Composio 的独立测试中表现欠佳,仅完成 53.8% 的复杂代理任务。
测试覆盖 30 个工作流,共运行 240 次
这项测试覆盖 30 个多步骤工作流,涉及 Gmail、GitHub、Slack 等实际工具,共进行 240 次运行。
不同框架结果分化,Pi Agent 表现最好
结果显示,该模型在不同智能体框架下的表现差异显著,其中 Pi Agent 完成 20 项任务,表现最佳。
低定价未抵消失败率带来的额外成本
尽管 DeepSeek V4 Flash 的输入 token 定价低至 0.14 美元/百万,约为同类产品的十分之一,但较高失败率可能带来额外的计算与调试成本。上述消息由 CryptoBriefing 报道。
本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.

