GPT-6 Astra新增无损换挡功能,长对话可灵活调整推理强度
OpenAI为GPT-6 Astra新增configuration_update,允许在长对话中随时调整reasoning effort而不丢失缓存。此前切换档位会导致缓存命中率从98.5%骤降至65%,重建后恢复至97%以上。该更新使难题用High或xhigh、简单任务降回Low,长上下文缓存持续复用,大幅提升长时间运行Agent的效率。

OpenAI为GPT-6 Astra新增configuration_update,允许在长对话中随时调整reasoning effort而不丢失缓存。此前切换档位会导致缓存命中率从98.5%骤降至65%,重建后恢复至97%以上。该更新使难题用High或xhigh、简单任务降回Low,长上下文缓存持续复用,大幅提升长时间运行Agent的效率。

Meta 发布新模型 Muse Spark 1.3 后,围绕前沿模型的性能与价格竞争迅速升温。文中披露,该模型在 DeepSWE v1.1、MRCR 512K-1M、Artificial Analysis 等指标上取得高分,并维持每百万 token 输入 1.25 美元、输出 4.25 美元的定价。与此同时,BridgeMind 等声音也对行业「刷榜」现象提出质疑,认为基准分数大涨并不等于真实体验同步提升。

Codex在代码库中新增了_context工具,并配合工作注释与历史查询能力,显示Codex CLI可能正在测试新的长任务记忆方案。按现有线索,系统在上下文窗口接近上限时将切换到新窗口,同时保留完整历史记录供查询。OpenAI官方文档截至发稿仍将compaction列为长任务上下文管理机制,文中判断这更像是准备转向或测试阶段,而非已全面上线。

小米推出MiMo V2.5系列多模态AI模型,整合文本/图像/音频/视频处理。Pro版SWE-bench解决率57.2%,匹配Claude Opus 4.6和GPT-5.4,token消耗比Kimi K2.6低42%。基础版速度更快价格更低,均支持1M上下文窗口。

Cursor 3.11新增侧边聊天、对话搜索和云端 Agent Hooks。新版本支持在不中断主 Agent 的情况下追问问题,也能通过本地索引搜索历史对话,并在关键节点挂接脚本。

Tether将TurboQuant集成进QVAC SDK 0.12.0,称可把AI模型KV cache内存需求最高压缩5倍,并尽量不影响模型质量,重点推动本地AI与隐私敏感场景落地。

Anthropic技术团队成员Thariq Shihipar解释,Claude Code即便拥有100万token上下文窗口,长对话中仍会出现“Context Rot”。官方建议开发者根据任务状态使用Continue、Rewind、Clear、Compact和子代理。

Harness Engineering正成为AI Agent落地的核心议题。文章梳理其定义、兴起时间线,以及Context、Tool、Permission、Memory、Hook、Sub-agent、Prompt Cache七大模块。
