EvolveScaler测试大模型动态推理,GPT-5.5最高仅答对59.3%

EvolveScaler测试大模型动态推理,GPT-5.5最高仅答对59.3%

N
News Editor
2026-09-15 09:11:00
腾讯混元等团队发布 EvolveScaler,用于检验大模型在信息持续被修改、撤回、补录和作废时,能否依据最新状态完成推理。该测试覆盖 117 类任务、159 种问题,最长约 1200 个事件,纳入 14 个模型配置。最难档成绩中位数仅 11.3%,表现最好的 GPT-5.5-xhigh 也只有 59.3%。团队还表示,这套数据可用于训练模型,内部 A3B 模型在加入 6000 条相关数据后,8 个外部测试成绩均有提升。

腾讯混元等团队发布了 EvolveScaler,专门测试大模型能否跟上不断变化的信息流。测试方法是在长文本中持续加入修改、撤回、补录和作废的信息,再要求模型根据最新状态回答问题。

EvolveScaler如何出题

以示例任务来看,系统会先给模型一段长时间序列信息,比如 40 天的游戏记录,然后追问:「如果第 7 天没打那个小 Boss,最后还能不能打赢?」这个变化会连带影响后续的装备、血量和战斗结果。

团队称,模型需要从第 7 天开始,把后面几十天的状态重新推演一遍,因为原文中并没有现成答案可直接提取。

测试覆盖117类任务

这套评测共设计了 117 类任务、159 种问题,最长约 1200 个事件。参与测试的共有 14 个模型配置,包括 GPT-5.5、Gemini 3.1 Pro、DeepSeek V4 Preview Pro、GLM-5.2 和 Qwen3.5 Plus。

最难档中位数仅11.3%

在最难档位下,模型成绩中位数只有 11.3%。即便是表现最好的 GPT-5.5-xhigh,正确率也只有 59.3%。

数据也可用于训练

团队还提到,这套数据不仅能用于测试,也可以拿来训练模型。一个内部 A3B 模型在加入 6000 条这类数据后,在 8 个外部测试上全部取得提升,平均提高 5.25 分。

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
8200

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。