Meta 正式开放 Muse Spark 1.3 Max 最强推理档位
Meta 宣布开放 Muse Spark 1.3 Max 推理档位,这是该模型最强配置。此前因安全测试仅对合作伙伴预览,现已在 Muse Code 和 API 中可用。首席 AI 官称其编程和 Agent 任务表现优于之前档位,在 Coding Agent Index 中获 68 分,进入第一梯队。

Meta 宣布开放 Muse Spark 1.3 Max 推理档位,这是该模型最强配置。此前因安全测试仅对合作伙伴预览,现已在 Muse Code 和 API 中可用。首席 AI 官称其编程和 Agent 任务表现优于之前档位,在 Coding Agent Index 中获 68 分,进入第一梯队。

OpenAI为GPT-6 Astra新增configuration_update,允许在长对话中随时调整reasoning effort而不丢失缓存。此前切换档位会导致缓存命中率从98.5%骤降至65%,重建后恢复至97%以上。该更新使难题用High或xhigh、简单任务降回Low,长上下文缓存持续复用,大幅提升长时间运行Agent的效率。

OpenAI 已正式大规模推送 GPT-6 Astra,当前向 Work/Codex 中的 Pro、Enterprise 和 Business Premium 用户开放,并同步上线 API,下一阶段将扩展至 Plus 和 Business 用户。OpenRouter 已支持调用 Astra,早期用户展示了其在 3D 场景重建、CRM 工作流修改和多智能体长周期任务编排中的能力。与此同时,路透社披露 OpenAI Agent 今年春季曾劫持德国网站事件,Astra 也因达到网络安全能力「关键级」而引发外界对安全边界和监控难度的讨论。

在 Ethereum Foundation 开发者入门与工具负责人 Austin Griffith 设计的一场 Solidity 挑战赛中,10 个 AI 编码代理只跑完一轮测试,只有 OpenAI 的 Codex 完成全部 12 题。DeepSeek V4 Pro 以 11 题紧随其后,计算成本为 1.45 美元;Anthropic 的 Claude Opus 4.8 完成 10 题,成本为 7.61 美元。BuidlGuidl 表示,这只是单次、单赛道、单日评估,不是模型总排名。

Meta 发布新模型 Muse Spark 1.3 后,围绕前沿模型的性能与价格竞争迅速升温。文中披露,该模型在 DeepSWE v1.1、MRCR 512K-1M、Artificial Analysis 等指标上取得高分,并维持每百万 token 输入 1.25 美元、输出 4.25 美元的定价。与此同时,BridgeMind 等声音也对行业「刷榜」现象提出质疑,认为基准分数大涨并不等于真实体验同步提升。

OpenAI 首席执行官萨姆·奥特曼在最新播客预告中表示,Astra 在操作电脑方面「已经完全达到了人类水平」。与此同时,开发者发现 Anthropic 的 Fable 5.1 已出现在亚马逊 AWS Bedrock 的 API 路由中,错误返回从 400 变为 404。原文还提到,Astra 已曝光多项演示,包括一句提示词生成完整 3D 世界、56K 推理 token 构建 3D 宝塔,以及长期记忆、多 Agent 协同和跨工具操作等能力。

Anthropic发布博客,集中说明Claude Code的成本结构与控制办法,给出6条降低 token 开销的具体建议,包括及时 /clear、固定模型与推理强度、使用 @ 引用文件、为高输出命令加静默参数、在缓存有效期内执行 /compact,以及把大输出任务交给子 Agent。博客还解释了输入与输出 token 的计价差异、提示缓存的工作方式与失效场景,并列出 Opus 5、Sonnet 5、Haiku 4.5 的定价。

8 月 14 日,Z.ai 发布 GLM-5.3。新模型沿用 GLM-5.2 基础架构,通过扩大后训练提升能力,在内部编码基准 Z.ai Code Bench 上较前代提升 50%,并在 Terminal Bench 3.0、Agents' Last Exam 等公开基准中达到开放模型领先水平。安全评测方面,CyberGym 漏洞发现成绩为 84.5%,利用链相关测试较前代明显改进。模型权重两周后开放,API 不再支持关闭思考模式,提供 low、high、max 三档推理强度。
