高盛硅谷调研:Agent 进入执行阶段,AI 竞争转向工作流
高盛在 8 月 18 日至 19 日完成对硅谷 AI 产业链的实地调研后指出,AI 正从“会回答”走向“能执行”,商业化模式也从按席位订阅转向按消费量、交易量和结果收费。报告认为,企业部署 Agent 的关键约束正从模型能力转向可控性与责任划分;前沿模型与开源模型将出现更清晰分工,而世界模型可能推动未来 5 年算力需求增长约 24 倍。

高盛在 8 月 18 日至 19 日完成对硅谷 AI 产业链的实地调研后指出,AI 正从“会回答”走向“能执行”,商业化模式也从按席位订阅转向按消费量、交易量和结果收费。报告认为,企业部署 Agent 的关键约束正从模型能力转向可控性与责任划分;前沿模型与开源模型将出现更清晰分工,而世界模型可能推动未来 5 年算力需求增长约 24 倍。

匿名开发者、比特币红队负责人 Calle 表示,团队正结合 AI 模型与人工复核,检查几乎整个比特币开源生态中的安全缺陷,覆盖钱包、闪电网络应用、软件库等项目。团队称已完成一轮基础扫描,8 月在 390 个项目中提交 4,962 项发现,其中 85 项为严重级别、635 项为高危。Calle 提到,团队除使用 OpenAI 和 Anthropic 模型外,也转向 Moonshot AI 的 Kimi K3 及 Z.ai 的 GLM 5.2,原因是美国模型在安全研究中存在限制。

RootData 披露其“死亡项目”统计方法称,项目被判定为停止运营需满足官宣停运或破产、官网及社媒停更超 6 个月、或官网与社媒账号无法打开或已注销等条件,并经过自动追踪与人工复核。数据显示,2026 年迄今记录的死亡项目为 124 个;在约 1.2 万个拥有 X 账号且未注销的项目中,8 月仍发推的活跃项目约 2200 个。与此同时,今年每月新增项目仅 70 至 100 个,而每月停止更新推文的项目已连续高于 200 个。

谷歌研究发现,GPT-5 和 Gemini 3 等模型对 95%–98% 的测试事实已完成参数存储,但在直接问答中仍有 26%–34% 的事实无法取出,即使开启 thinking 后仍有 11%–12% 无法回忆。研究基于新基准 WikiProfile,对 13 个模型累计生成约 450 万条回答。结果显示,前沿模型事实错误的主要瓶颈已从“没学到”转向“取不出”,冷门知识和反向提问是最明显的卡点。

Meta发布开放权重模型Muse Glimmer,并表示未来几周将开放更强的Muse Spark 1.2模型权重。Muse Glimmer采用Apache 2.0许可证,支持文本和图像输入,主打本地Agent场景。扎克伯格同步在官网为开放模型和蒸馏辩护,称应把强大且免费的AI交给数十亿人,而不是集中在少数大型机构手中。

针对 ICML 2026 论文的两项 AI 复现与核查项目显示,论文可复现性和客观错误问题正在被集中暴露。一项审计称,168 篇口头报告中有 92 篇具备至少 5 条可验证结论,其中 58 篇无法复现;另一项基于 GPT-5 的检查系统则称,顶级 AI 会议和期刊论文平均每篇检出 4.7 个客观错误,99.2% 的论文至少被标记出一个问题。不过,报道同时强调,无法复现并不等同于造假,AI 工具结果仍需人工复核。

Anthropic宣布自8月14日起,Claude Code在Pro、Max和Team方案新开工作会话中将默认启用Auto Mode,由独立安全分类器取代频繁的权限弹窗。官方受控实验显示,1,053名测试者仅拦下13.6%的危险指令,而分类器拦截率为89%;在连续处理50次以上权限确认后,人工拦截率还会降至约5%。即日起,Pro、Max、Team用户不再为分类器额外Token开销付费。

Bitcoin Red Team用AI辅助审计比特币生态项目,29.8小时内扫描390个项目,发现4962个潜在问题,其中720个被列为高危或关键级,21.4%已可复现。团队由16名志愿者组成,包括AnchorWatch CEO Rob Hamilton等;审查在Coldcard硬件钱包逾1亿美元被盗事件后启动。
