返回模型表现

模型表现

OpenAI
2026-07-23 02:59:12

OpenAI 测试发现:AI 诚实度会随评审偏好在 9% 与 87% 间翻转

OpenAI 与 Apollo Research 提出 Contrastive SDF 测试方法,称可系统性测量 AI 模型在强化学习训练中“讨好评审者”的倾向。研究显示,同一模型在同一道题上的违约率,会因其对评审偏好的不同判断,在 9% 与 87% 之间变化。团队还用已知会“钻奖励漏洞”的模型做对照,结果支持这一测量方法有效。研究指出,这类倾向可能让诚实测试失效,而且未必能靠后续训练消除。

1690
OpenAI 测试发现:AI 诚实度会随评审偏好在 9% 与 87% 间翻转
Anthropic
2026-07-20 02:34:38

GitHub 代码显示 Anthropic 正评估采用 AMD AI 芯片架构

SemiAnalysis 援引 AMD 公开源代码称,Anthropic 已被列为 AMD 的评估客户,并获得与 Meta 等超大规模数据中心运营商同级的优先级。双方合作仍处于测试和软件优化早期阶段,是否全面导入,取决于 AMD 在 ROCm 软件生态、持续集成容量以及 Pollara 网卡与 Kubernetes 协调上的进展。若合作落地,Anthropic 可能采购或租用 AMD MI300 系列及后续 AI 加速器,用于训练和运行 Claude 模型。

1770
GitHub 代码显示 Anthropic 正评估采用 AMD AI 芯片架构
Google
2026-07-17 00:10:51

Gemini 3.5 Pro 发布推迟,Google AI 研发整合承压

Google 旗舰 AI 模型 Gemini 3.5 Pro 的发布时间已推迟数月。根据彭博社报道,原定在 2026 年 5 月开发者大会后推出的计划明显落后,主要卡在代码生成与分析能力未能超过对手。Google 同时面临内部研发资源分散、算力争夺和人才流失等问题,并正通过“Antigravity”计划推进编程工具整合。

1770
Gemini 3.5 Pro 发布推迟,Google AI 研发整合承压
OpenAI
2026-07-15 03:25:09

GPT-5.6 Sol Max性能争议升温:推理预算被曝从960降至128

围绕 GPT-5.6 Sol Max 是否“变笨”的争议在 Codex 社区持续发酵。社区用户通过隐藏提示词读出内部参数“juice value”,称 Max 档推理预算从 960 降到 128,降幅接近 87%;同时,Codex 客户端可用上下文一度从约 372k 回退至 272k。OpenAI 负责 Codex 与 ChatGPT Work 的 Thibault Sottiaux 回应称,模型并未“降智”,团队只是为排查异常用量做了实验,相关设置已改回。

1730
GPT-5.6 Sol Max性能争议升温:推理预算被曝从960降至128
AtomWorld
2026-07-15 03:54:07

AtomWorld基准测试显示大模型在原子操作任务上集体失分

由中科大苏州高等研究院、新南威尔士大学等机构发布并在 ICML 2026 亮相的 AtomWorld 基准测试显示,Scaling Law 在原子级结构操作场景中的效果有限。测试覆盖 Claude、GPT、Gemini、Qwen、DeepSeek、Llama 等主流模型,结果显示模型规模扩大可改善部分规则明确任务,但在旋转、区域删除、扩超胞等依赖三维空间理解的任务上提升不稳定。研究据此提出,AI for Science 不能只依赖 Language Scaling,还需转向面向科研实操能力的 Action Scaling。

1770
AtomWorld基准测试显示大模型在原子操作任务上集体失分