返回模型表现

模型表现

Saturn
2026-09-20 15:27:01

Saturn:主流 AI 回答个人财务问题错误率达 57%

英国金融科技公司 Saturn 发布研究称,主流 AI 模型在个人财务问题上的回答错误率达到 57%。研究覆盖 ChatGPT、Gemini、Claude 和 Copilot 等 18 款免费及付费模型,共测试 121 个问题并生成逾 1 万条答案。多步骤问题错误率升至 88%,免费模型错误率为 63%,表现最好的 Claude Opus 5 在推理模式下仍有 39% 错误率。

110
Saturn:主流 AI 回答个人财务问题错误率达 57%
Anthropic
2026-09-20 00:22:31

Anthropic灰测Fable 5.2,Opus 5.2也现身测试

Anthropic 被曝已在 Claude Code、Chat 和 Cowork 中灰测 Fable 5.2,部分原先指向 Fable 5.1 的请求已被后台重定向。多名测试者公开了与 GPT-6 Astra、Opus 5.2 的对比结果,涉及高推理、复杂物理、3D 环境与游戏开发等场景。与此同时,内部代号为 Opus-Next 的 Opus 5.2 也出现「上线—下线—再上线」的测试迹象。

80
Anthropic灰测Fable 5.2,Opus 5.2也现身测试
Anthropic
2026-09-19 02:28:32

Anthropic启动嵌入式评估,埃森哲旗下Faculty率先入场

Anthropic开始推进「嵌入式评估」,由埃森哲旗下 AI 公司 Faculty 派员进入其内部,开展模型评测、红队测试、对齐评估和安全检查。与常见外部评测不同,评估员将获得接近员工级别的权限。双方计划未来五年各投入至少 10 亿美元建设这套评估能力,但评估范围、结果披露和费用安排等规则仍未统一。

810
Anthropic启动嵌入式评估,埃森哲旗下Faculty率先入场
SEC
2026-09-18 02:10:00

9月18日加密与宏观市场速览:SEC放行部分代币化股票链上交易,ZEC波动加剧

9月17日至18日,多条加密与宏观市场消息集中出现。美国SEC批准临时、有条件的“创新豁免”,允许部分代币化NMS股票在链上场所有限交易,并明确排除合成型产品;ZEC价格剧烈波动,Hyperliquid、OKX及多笔巨鲸仓位同步受到关注;BlackRock向Coinbase Prime转入约2.855亿美元BTC与ETH;Zilliqa确认将于9月22日进行第二次交易所迁移硬分叉,涉及多家交易平台。

530
9月18日加密与宏观市场速览:SEC放行部分代币化股票链上交易,ZEC波动加剧
OpenAI
2026-09-12 16:03:23

GPT-6 Astra 上线一周后遭用户质疑表现下滑,OpenAI 尚未回应

OpenAI 新模型 GPT-6 Astra 在发布后一度因代码与构建能力受到追捧,但上线仅一周,多名开发者开始在 X 上集中反馈模型变“更笨”。部分用户称在相同提示词和设置下,当前版本结果不如发布当天;也有人认为并非模型被削弱,而是首发期热度退去后,缺陷被更清楚地看见。OpenAI 目前尚未就 Astra 发布类似此前 GPT-5.6 Sol 争议时的说明,但该模型的定价仍为每百万输入 token 10 美元、每百万输出 token 50 美元。

840
GPT-6 Astra 上线一周后遭用户质疑表现下滑,OpenAI 尚未回应
OpenAI
2026-09-07 08:33:01

OpenAI 首席科学家:AI 或逼近递归自我改进,安全措施仍在追赶

OpenAI 首席科学家 Jakub Pachocki 撰文称,AI 正快速逼近可在多个关键方面推动自身发展的阶段,递归自我改进可能很快到来。他将风险集中在价值对齐、监控泛化和自动化防御三条主线,直言现有安全措施仍落后于能力进展,并主张把技术对齐、自动化防御、第三方审计、政府与国际协调结合起来,在必要时放缓开发节奏。

650
OpenAI 首席科学家:AI 或逼近递归自我改进,安全措施仍在追赶
具身智能
2026-09-07 05:53:10

具身智能押注上下文 Scaling,COCO Matrix 试图把 ICL 前置到预训练

Skild AI 与 Generalist AI 近期先后展示机器人 One-Shot Learning 能力,把具身智能中的 In-Context Learning 讨论推高。国内创业公司可可矩阵表示,团队从 2026 年 4 月成立起就将 ICL 作为底层范式,核心判断是机器人后续动作生成效果,很大程度取决于前端是否真正理解物理世界。其创始人高宇翔称,行业在数据堆叠之外,正在把 Long Context、记忆与部署后继续学习视为新的 Scaling 方向。

460
具身智能押注上下文 Scaling,COCO Matrix 试图把 ICL 前置到预训练