返回新智元

新智元

Anthropic
2026-08-31 10:55:09

Anthropic 遭集体诉讼:Claude Max 20x 被指实际仅 6 至 8 倍

开发者 Karl Kahn 在 6 月 14 日于加州北区联邦法院起诉 Anthropic,称其每月 200 美元的 Claude Max 20x 套餐并未兑现「Pro 计划 20 倍用量」。诉状依据包括 Anthropic 在 2025 年 7 月发给订阅用户的邮件,以及 TechCrunch 披露的每周参考额度。争议核心在于,Anthropic 的套餐同时受 5 小时滚动窗口和每周总额度两层限制,用户在周额度层面实际拿到的增幅远低于宣传倍率。

60
Anthropic 遭集体诉讼:Claude Max 20x 被指实际仅 6 至 8 倍
SpaceXAI
2026-08-31 10:53:09

Lauren Tan详解GrokBot工作流:单月超1000个PR,20个智能体可自动合并主干

SpaceXAI 的 GrokBot 工程师 Lauren Tan 在团队工作坊中披露,她目前会同时运行 20 多个智能体,上个月交付 1000 多个 PR,8 月目标翻倍。她展示了自己 5 个月累计 3000 多个 PR 的 GitHub 贡献曲线,并称如今从提 PR、跑验证到合入主干,很多环节已可由智能体独立完成。她将关键归因于验证体系、feature map、自动化代理 Benny,以及以 pstack、Dune、CI 和 lint 规则构成的强约束架构。

110
Lauren Tan详解GrokBot工作流:单月超1000个PR,20个智能体可自动合并主干
Anthropic
2026-08-31 08:16:11

Anthropic公开自动化对齐研究:Claude用单块 H200 在 48 小时内完成安全迭代

Anthropic发布一篇51页研究论文,展示让 Claude 充当「自动化对齐研究员」的实验结果。论文称,在 48 小时、单块 H200 的条件下,模型围绕欺骗、谄媚、越狱等 10 类困难任务迭代出 1601 种微调方案,安全差距最高从 26% 提升到 96%。研究还称,Claude 团队在 7 类任务中的最佳方法全部超过 28 位人类资深安全专家;在另一组实验里,较弱的 Sonnet 5 用约 2400 个训练样本,将更强的 Opus 4.8 对齐到接近生产级水平。

120
Anthropic公开自动化对齐研究:Claude用单块 H200 在 48 小时内完成安全迭代
OpenAI
2026-08-28 03:22:26

OpenAI测试Codex持久化智能体:可跨会话续跑且不会强制休眠

WIRED审查OpenAI公开的Codex代码库后发现,OpenAI正在测试一种持久化智能体模式,相关设置已写入Codex CLI。该模式下,Codex可持续运行直至被强制休眠,支持跨会话延续、基于历史互动决定后续任务,并可主动联系用户。OpenAI确认相关探索存在,但称暂无立即发布计划。报道同时提到,此前与Hugging Face事件相关的「高持久性内部模型」被认为与这一路线有关,OpenAI已为相关能力设置权限和安全边界。

160
OpenAI测试Codex持久化智能体:可跨会话续跑且不会强制休眠
人工智能
2026-08-28 00:22:09

Claude解出随机热力学开放问题,物理学界讨论AI科研冲击

在数学领域接连出现AI攻克难题的消息后,物理学也出现了类似案例。非平衡统计力学研究者 Gavin E. Crooks 将一个随机热力学开放问题交给 Claude,后者在几天内给出完整解答,并把多项既有 DFT 界统一到同一凸几何框架下。报道所引内容显示,这项工作不只涉及一个具体结果,也让学界重新审视 AI 在提出、连接和推进理论研究中的角色。

400
Claude解出随机热力学开放问题,物理学界讨论AI科研冲击
Anthropic
2026-08-27 00:21:21

Fable 5.1灰度迹象增多,Anthropic或最快明日发布

多位开发者称已在 Claude 网页端被灰度到新的 Fable 5.1,相关测试模型「melon」与「marshmallow」也在曝光数小时后被下线。爆料人 Leo 此前称 Anthropic 原计划等 OpenAI 的 Astra 后再应对,但最新说法改为 Anthropic 正加紧准备,最快明天发布。与此同时,Anthropic 员工 Thariq 公开回应 Opus 5 用户不满,承认当前模型表现存在问题,并表示修复已成头等大事。

220
Fable 5.1灰度迹象增多,Anthropic或最快明日发布
加州理工学院
2026-08-26 12:42:10

加州理工团队用 AI 改写 DFT 计算规模,单卡完成 8.25 万电子模拟

加州理工学院 Anima Anandkumar 团队于 8 月 24 日发布论文,提出 Kohn-Sham FNO,将密度泛函理论中最耗时的一步由传统立方级复杂度降至接近线性级。论文显示,该方法在单块 NVIDIA B300 GPU 上完成了 8250 个原子、82500 个价电子的镁位错计算,而 2019 年同类全量 DFT 计算曾使用约 7800 块 NVIDIA V100 GPU。研究还比较了两类既有 AI 路线在外推与稳定性上的局限。

250
加州理工团队用 AI 改写 DFT 计算规模,单卡完成 8.25 万电子模拟
Anthropic
2026-08-26 11:50:11

消息称 Anthropic 或于本周发布 Opus 5.1,AI 模型竞赛再度升温

多则爆料显示,Anthropic 可能在本周推出 Opus 5.1,升级重点据称放在编程、复杂推理和长时间运行的 AI Agent 能力上。与此同时,Polymarket 预测其未来两周发布下一代旗舰模型的概率为 74%。报道还提到,OpenAI 一个代号为 Bel 的 10 万亿参数模型已完成预训练,AI 大模型发布节奏正在加快。

360
消息称 Anthropic 或于本周发布 Opus 5.1,AI 模型竞赛再度升温