美国AI巨头Anthropic于2026年6月4日发布报告,揭示其最新模型Mythos Preview在辅助AI研究决策的测试中,以64%的胜率超越人类专家。两年前的2024年,同一指标仅为22%,意味着AI的判断能力在短时间内实现爆发性增长。
研究决策测试:64%胜率超越人类
Anthropic团队设计了一项特殊测试:向Claude展示人类研究员即将误判研究方向的对话记录,并询问“接下来该怎么做?”结果显示,Mythos Preview在64%的情况下做出了比人类更优的决策。相比之下,2024年的旧模型仅22%胜率,增幅接近两倍。这暗示AI已开始具备指导甚至引领高阶研究的能力。
代码优化:52倍速度提升颠覆效率
除了决策能力,AI在编程效率上同样惊人。Anthropic内部数据显示,工程师每季交付的代码量已是2021至2025年平均水平的8倍。在开放性问题中,Claude的成功率6个月内飙升50个百分点,达到76%。许多工程师认为其代码质量已逼近人类。
最引人注目的是“优化小型AI模型训练代码”测试:一名熟练人类工程师需4至8小时才能将速度提升约4倍;2024年的Claude Opus 4平均提升3倍;而Mythos Preview竟达成52倍速度提升,彻底突破了过去效率天花板。
RSI加速:革命与风险并存
尽管数据亮眼,Anthropic仍谨慎指出:这并不保证递归自我提升(RSI)已近在咫尺——目前无法确定Claude是否具备自主选择“正确研究问题”的全局判断力。但若趋势持续,AI系统自行设计更强大继任者的情境将极具可能性。
Anthropic承认,这有望在医学、科技和经济领域带来革命性正面效应,但也可能加剧对齐(Alignment)难题,最终导致“失去控制”风险。为此,公司宣布与外部利益相关方合作成立Anthropic研究所,旨在深入研究强大AI系统的深远影响,确保人类能为技术未来做出审慎选择。

