Anthropic 今日正式发布旗舰模型 Claude Opus 4.6,距上一代 Opus 4.5 仅隔三个月。该模型已在 claude.ai、Anthropic API、Amazon Bedrock、Google Cloud Vertex AI 等平台全面上线,定价维持每百万 token 输入 5 美元、输出 25 美元不变。
百万 token 上下文窗口(Beta)
Opus 4.6 首次在旗舰级模型中支持 100 万 token 的上下文窗口,是 Opus 4.5 的五倍(200k → 1M)。这意味着一口气处理约 1,500 页文字、30,000 行代码或超过一小时的视频内容,无需切割、摘要、分批处理。在长上下文检索测试 MRCR v2 的百万 token 变体中,Opus 4.6 达到 76% 准确率,而前代 Sonnet 4.5 仅 18.5%。
自适应思考与 128k 输出
新引入的“自适应思考”机制让模型根据任务复杂性自动决定推理深度。开发者通过 effort 参数在低、中、高、��大四档间调节智能、速度与成本的平衡。简单查询用低档省钱,复杂推理开最大档。单次输出上限提升至 128,000 token,可一次生成完整程序模块或长篇报告。
Agent Teams:多代理协同作战
最颠覆性的升级是 Agent Teams——多个 Claude 代理人并行分工,各自负责子任务并通过共享任务目录同步进度。Anthropic 研究员 Nicholas Carlini 用这套系统让多个 Claude 并行开发一个 C 编译器:最终产出 10 万行 Rust 代码库,成功编译 Linux 6.9 内核,支持 x86、ARM、RISC-V 三种架构,通过 99% 标准测试,还能编译 QEMU、FFmpeg、SQLite、Postgres。花费约 2,000 个 Claude Code session,API 费用接近 2 万美元。这表明自主化大规模开发已是工程现实。
500 个零日漏洞:AI 自主发现
发布前 Anthropic 团队将模型放入沙盒,只给 Python、调试器、模糊测试工具,无特定指令。结果 Opus 4.6 自主发现超过 500 个此前未知的安全漏洞,包括 GhostScript 的崩溃漏洞、OpenSC 的缓冲区溢出漏洞、CGIF 的缓冲区溢出(并主动编写了概念验证代码)。每个漏洞都经内部或外部研究员验证。Anthropic 也因此新增了即时检测系统以防范恶意滥用。
基准测试全面领先
在独立评测 GDPval-AA 中,Opus 4.6 比 OpenAI GPT-5.2 高出约 144 Elo 分,比前代 Opus 4.5 高出 190 Elo 分。在代理式编码测试 Terminal-Bench 2.0 中同样拿下最高分。Anthropic 官方称该模型“计划更周密、能持续进行更长的代理任务、在大型代码库中更可靠、代码审查与调试能力更强”。
产品集成:Excel 升级,PowerPoint 全新加入
Claude in Excel 获得增强版,支持长期运行任务和多步骤变更,可处理整个电子表格重构。全新 Claude in PowerPoint(研究预览版)能读取设计系统、保持品牌一致性、生成完整演示幻灯片。Excel 集成和 Cowork 功能已对所有付费方案开放,PowerPoint 集成优先提供给 Max、Team 及 Enterprise 方案用户。

