Anthropic Mythos Preview 决策胜率64%碾压人类,AI递归自我提升加速

Anthropic Mythos Preview 决策胜率64%碾压人类,AI递归自我提升加速

N
News Editor 01
2026-07-23 09:30:15
Anthropic最新报告显示,其Mythos Preview模型在AI研究决策测试中以64%胜率超越人类专家,两年内提升近三倍。代码优化速度达52倍,但公司警告RSI加速可能带来失控风险,并成立研究所应对。
AIAnthropicMythos Preview递归自我提升RSI

美国AI巨头Anthropic于2026年6月4日发布报告,揭示其最新模型Mythos Preview在辅助AI研究决策的测试中,以64%的胜率超越人类专家。两年前的2024年,同一指标仅为22%,意味着AI的判断能力在短时间内实现爆发性增长。

研究决策测试:64%胜率超越人类

Anthropic团队设计了一项特殊测试:向Claude展示人类研究员即将误判研究方向的对话记录,并询问“接下来该怎么做?”结果显示,Mythos Preview在64%的情况下做出了比人类更优的决策。相比之下,2024年的旧模型仅22%胜率,增幅接近两倍。这暗示AI已开始具备指导甚至引领高阶研究的能力。

代码优化:52倍速度提升颠覆效率

除了决策能力,AI在编程效率上同样惊人。Anthropic内部数据显示,工程师每季交付的代码量已是2021至2025年平均水平的8倍。在开放性问题中,Claude的成功率6个月内飙升50个百分点,达到76%。许多工程师认为其代码质量已逼近人类。

最引人注目的是“优化小型AI模型训练代码”测试:一名熟练人类工程师需4至8小时才能将速度提升约4倍;2024年的Claude Opus 4平均提升3倍;而Mythos Preview竟达成52倍速度提升,彻底突破了过去效率天花板。

RSI加速:革命与风险并存

尽管数据亮眼,Anthropic仍谨慎指出:这并不保证递归自我提升(RSI)已近在咫尺——目前无法确定Claude是否具备自主选择“正确研究问题”的全局判断力。但若趋势持续,AI系统自行设计更强大继任者的情境将极具可能性。

Anthropic承认,这有望在医学、科技和经济领域带来革命性正面效应,但也可能加剧对齐(Alignment)难题,最终导致“失去控制”风险。为此,公司宣布与外部利益相关方合作成立Anthropic研究所,旨在深入研究强大AI系统的深远影响,确保人类能为技术未来做出审慎选择。

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
400

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。