Anthropic内测Claude Opus 5.5,传定价下调并同步推进Fable 5.2
开发者爆料显示,Anthropic代号为「claude-wafer-eap」的Claude Opus 5.5已进入内测,最快可能于本周二推出。流传信息称,其API价格或降至每百万Token输入4美元、输出20美元,低于现役Opus 5。与此同时,Claude Fable 5.2也被指正在灰度切换。多名开发者分享的测试结果,集中在3D生成、前端开发、代码重构和长程规划能力上。

开发者爆料显示,Anthropic代号为「claude-wafer-eap」的Claude Opus 5.5已进入内测,最快可能于本周二推出。流传信息称,其API价格或降至每百万Token输入4美元、输出20美元,低于现役Opus 5。与此同时,Claude Fable 5.2也被指正在灰度切换。多名开发者分享的测试结果,集中在3D生成、前端开发、代码重构和长程规划能力上。

Jev近期在开发者圈快速走红。这个模型不做聊天和长文本生成,主要处理 Yes/No、选项选择和评分三类判断,并直接返回结果与概率。PANews报道称,TypeSafe测试显示其最高可提速约193.6倍、成本最多降低444.6倍。Jev创始人 Diogo Almeida 曾参与 OpenAI 的 GPT-4、ChatGPT 及 InstructGPT/RLHF 相关工作,他在公开演讲中反思 RLHF 是否适合 AI 自动化场景,这也成为理解 Jev 设计思路的关键线索。

Pi Agent Harness 发布 0.86.0,加入 Prompt Cache Warming 功能。针对长时间工具任务,系统会在缓存接近过期前重发上一次请求,仅生成 1 个 Token,以延长已缓存的长上下文保留时间。该机制不会持续保活,而是先计算成本,只有在预计净节省至少 0.05 美元时才会触发刷新。

Aether AI 发布首版因果世界模型 CausalWM,参数规模为 16B,并提出 Causal Chain-of-Thought 方法,将 Optical Flow、Depth 和 Pointmap 组织成显式推理链。该模型在机器人世界模型基准 TriWorldBench 最新榜单中取得 Top-1,TWB-Score 为 66.04,也在 PAI-Bench 等评测中位列前列。团队称,这一路线试图让世界模型不只预测未来画面,还显式建模运动、几何与后续结果之间的因果关系。

阿里巴巴于 9 月 19 日发布实时同步口译模型 Qwen3.8-LiveTranslate。Qwen 团队称,该版本采用 Interleave 架构,在 60 种语言上将平均延迟(LAAL)从 2.8 秒降至 2.3 秒,并提升了忠实度、流畅度与简洁度。新模型还加入说话人区分、原文与译文同步显示,以及长上下文消歧功能,目前通过 QwenCloud 提供,未见权重在 Hugging Face 上架。

清华大学团队在 ACM MM 2026 论文中提出,多模态大模型的物体幻觉并非只来自语言先验,短输出场景下还存在由视觉特征提取与图文嵌入错位驱动的“视觉源幻觉”。研究同时给出 AHAF 与 ACFT 两项方法。实验显示,ACFT 仅用 COCO 数据集 0.9% 的数据、且不增加推理开销,就在 POPE、MME 及 4 个描述级幻觉基准上,于 LLaVA、MiniGPT-4、Qwen2.5-VL 三个模型取得优异表现。

一台约 150 美元的 SO-101 机械臂在 GPT-6 Astra 控制下完成金门大桥绘画后,Astra 在机器人圈迅速引发关注。多组公开实验显示,这个并非专为机器人训练的通用模型,已能完成模仿学习、real2sim 环境构建和双臂抓取等任务。文章梳理了 Astra 的控制方式、RoboCurve 的实机测试结果,以及它在精细接触和高频控制上的现实限制。

TypeSafe AI 于 9 月 15 日发布 Jev,并将其归为专门处理结构化判断任务的「System One Models」。过去几天,Jev 在 X、GitHub 和 Agent 开发者社区快速传播,应用场景覆盖 Agent 评估、广告分析、Claude Code 上下文压缩和浏览器 Agent。LangChain 在 9 月 20 日公布的小规模实验中称,Jev 单次调用平均耗时约 0.44 秒、成本约 0.00035 美元,并在连续评分一致性上表现突出。
