个人 AI 助手实战榜上线,Muse 暂列第一

个人 AI 助手实战榜上线,Muse 暂列第一

N
News Editor
2026-09-15 04:14:41
独立评测项目 Assistant Benchmark 开始用真实任务横向测试个人 AI 助手,任务包括订酒店、选餐厅、购物、回邮件和连接第三方服务,并按实际完成情况打分。目前 Muse 在已完成的 7 个评分维度中平均 9.1 分,暂列第一;Instinct 测完 11 个维度后平均 8.4 分,Grok Bot 在 7 个维度中平均 7.3 分。评测方强调,这是一份持续更新的真实体验榜,当前分数和排名后续都可能变化。

独立评测项目 Assistant Benchmark 已开始用真实任务横向评测个人 AI 助手,现阶段 Muse 暂列第一。

评测方式改为真实任务

据动察 Beating AI 快讯介绍,这项测试会直接让 Agent 执行订酒店、选餐厅、买东西、回邮件、连接第三方服务等任务,再按照实际完成情况评分。每个评分维度都对应一个公开的固定任务,且只有提供真实运行记录才会给分。

当前排名与得分

目前,Muse 在已完成的 7 个评分维度中平均得分为 9.1 分,暂列第一。Instinct 已测完 11 个维度,平均 8.4 分;Grok Bot 已测完 7 个维度,平均 7.3 分。

Muse 在购物、邮件和第三方应用连接三个项目上都拿到 10 分。

榜单仍会持续更新

这份榜单更适合被看作一份持续更新的真实体验榜。Muse 目前的 9.1 分,只是已测 7 个维度的平均分,并非完整成绩。与此同时,每个维度现在也只使用一个固定任务测试,后续补测后,分数和排名都可能发生变化。

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
5700

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。