GPT-6 Astra 韩国修能 AI 评测拿下满分,领先 GPT-5.6 1.5 分

GPT-6 Astra 韩国修能 AI 评测拿下满分,领先 GPT-5.6 1.5 分

N
News Editor
2026-09-10 10:05:37
GPT-6 Astra 在韩国大学修学能力试验 AI 评测中拿到 450 分满分,成为首个全科零失分模型。韩国日报报道,排名第二的 GPT-5.6 得分 448.5 分,仅差 1.5 分,但 Astra 解完整份试卷只用了 35.7 万 tokens,较第二名少约 17%。本次评测使用 2025 年实际施行的 2026 学年度修能考题,且不允许外部联网搜索。

GPT-6 Astra 在韩国大学修学能力试验(修能)AI 评测中拿下 450 分满分,成为首个全科零失分的模型。

据《韩国日报》报道,这次评测中,Astra 在国语、数学、英语、韩国史,以及物理 I、化学 I、生物 I、社会文化等选考科目上全部未失分。450 分是这份评测记录的总分上限,必须全对才能取得满分。

前五名分差很小,第二名仅落后 1.5 分

排名第二的是 GPT-5.6,得分 448.5 分,与满分只差 1.5 分。之后依次为 GPT-5.4 的 448 分、Claude Fable 5.1 的 447.5 分,以及 Gemini 3.1 Pro 的 445 分。

前五名全部集中在 5 分以内。按 450 分总分计算,Astra 与第二名之间 1.5 分的差距约为 0.3%。

评测使用韩国考生实际作答过的试题

这次评测运行在 GitHub 上的「2026 学年度修能 LLM 解题记录」页面,使用的是 2025 年实际施行的 2026 学年度修能考题,也就是韩国考生真实参加过的那套试卷。

评测过程不允许使用外部网络搜索,模型只能依靠训练阶段学到的内容作答。报道指出,这项限制让分数更有可比性;如果允许联网,选择题答案本身就可能在网上被找到,评测对象就会从解题能力变成搜索能力。

考试形式也会影响成绩。Gemini 3.1 Pro 之前在只考两个科目的形式下曾被记为 450 分满分,但在这次全科综合评测中降至 445 分。报道称,科目增加、题型跨度变大后,分数表现就会出现变化,因此比较排名时也需要同时看评测覆盖了几科。

Astra 也是前列模型中最省 tokens 的一个

Astra 解完整份试卷共用了 35.7 万 tokens。tokens 是模型读写文字时使用的计算单位,用量越高,通常意味着思考时间更长、单次运行成本更高。

同一份试卷中,GPT-5.6 使用了 42.9 万 tokens,Claude Fable 5.1 使用了 56.2 万 tokens。按报道给出的数据,Astra 比第二名少用约 17%,比 Claude Fable 5.1 少 36%,两者相差 20.5 万 tokens。

从得分看,Astra 与 GPT-5.6 只差 1.5 分;但从算力消耗看,差距更明显。

教授:差异在结构效率,不只是原始能力

报道引述李承铉(Lee Seung-hyun)教授的解读称,Astra 在解题过程中一边压缩并修改自己的解题计划,一边维持推理脉络,关键在于结构效率,而不只是原始智力。

按照这一说法,在分数已经很难继续大幅拉开的情况下,模型之间更容易被拉开差距的部分,是完成同一道题时究竟需要多少步骤,以及为此消耗多少 tokens。

关于满分成绩的讨论仍在继续

对于 AI 在学测类考试中拿到满分是否代表 AGI 已经到来,原文提到,受访业界人士认为学测分数并不是全部,AI 的价值在于解决尚无答案的难题。与此同时,OpenAI 总裁与黄仁勋都表示 AGI 已到,韩国政界与学界仍在辩论。

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
7600

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。