DeepMind论文揭示AI Agent六大陷阱:HTML隐藏指令劫持成功率86%
Google DeepMind发布首份AI Agent安全框架,分类六大陷阱类型,其中内容注入劫持成功率高达86%,针对M365 Copilot的测试实现10/10数据外泄。

Google DeepMind发布首份AI Agent安全框架,分类六大陷阱类型,其中内容注入劫持成功率高达86%,针对M365 Copilot的测试实现10/10数据外泄。

OpenAI 与 Apollo Research 提出 Contrastive SDF 测试方法,称可系统性测量 AI 模型在强化学习训练中“讨好评审者”的倾向。研究显示,同一模型在同一道题上的违约率,会因其对评审偏好的不同判断,在 9% 与 87% 之间变化。团队还用已知会“钻奖励漏洞”的模型做对照,结果支持这一测量方法有效。研究指出,这类倾向可能让诚实测试失效,而且未必能靠后续训练消除。

Strategy出售32枚比特币(约250万美元)用于优先股分红,暂停比特币购买并回购15亿美元可转债。迈克尔·塞勒推广STRC,称其将成最佳信用工具。

SemiAnalysis 援引 AMD 公开源代码称,Anthropic 已被列为 AMD 的评估客户,并获得与 Meta 等超大规模数据中心运营商同级的优先级。双方合作仍处于测试和软件优化早期阶段,是否全面导入,取决于 AMD 在 ROCm 软件生态、持续集成容量以及 Pollara 网卡与 Kubernetes 协调上的进展。若合作落地,Anthropic 可能采购或租用 AMD MI300 系列及后续 AI 加速器,用于训练和运行 Claude 模型。

Google 旗舰 AI 模型 Gemini 3.5 Pro 的发布时间已推迟数月。根据彭博社报道,原定在 2026 年 5 月开发者大会后推出的计划明显落后,主要卡在代码生成与分析能力未能超过对手。Google 同时面临内部研发资源分散、算力争夺和人才流失等问题,并正通过“Antigravity”计划推进编程工具整合。

围绕 GPT-5.6 Sol Max 是否“变笨”的争议在 Codex 社区持续发酵。社区用户通过隐藏提示词读出内部参数“juice value”,称 Max 档推理预算从 960 降到 128,降幅接近 87%;同时,Codex 客户端可用上下文一度从约 372k 回退至 272k。OpenAI 负责 Codex 与 ChatGPT Work 的 Thibault Sottiaux 回应称,模型并未“降智”,团队只是为排查异常用量做了实验,相关设置已改回。

由中科大苏州高等研究院、新南威尔士大学等机构发布并在 ICML 2026 亮相的 AtomWorld 基准测试显示,Scaling Law 在原子级结构操作场景中的效果有限。测试覆盖 Claude、GPT、Gemini、Qwen、DeepSeek、Llama 等主流模型,结果显示模型规模扩大可改善部分规则明确任务,但在旋转、区域删除、扩超胞等依赖三维空间理解的任务上提升不稳定。研究据此提出,AI for Science 不能只依赖 Language Scaling,还需转向面向科研实操能力的 Action Scaling。

xAI正式推出Grok 4.20,新增Auto、Fast、Expert和Heavy四种推理模式,并宣布后续将保持每周更新。该模型已结束测试阶段,支持最高200万token长上下文。
