谷歌研究称 GPT-5 与 Gemini 3 存在“舌尖现象”
谷歌研究发现,GPT-5 和 Gemini 3 等模型对 95%–98% 的测试事实已完成参数存储,但在直接问答中仍有 26%–34% 的事实无法取出,即使开启 thinking 后仍有 11%–12% 无法回忆。研究基于新基准 WikiProfile,对 13 个模型累计生成约 450 万条回答。结果显示,前沿模型事实错误的主要瓶颈已从“没学到”转向“取不出”,冷门知识和反向提问是最明显的卡点。

谷歌研究发现,GPT-5 和 Gemini 3 等模型对 95%–98% 的测试事实已完成参数存储,但在直接问答中仍有 26%–34% 的事实无法取出,即使开启 thinking 后仍有 11%–12% 无法回忆。研究基于新基准 WikiProfile,对 13 个模型累计生成约 450 万条回答。结果显示,前沿模型事实错误的主要瓶颈已从“没学到”转向“取不出”,冷门知识和反向提问是最明显的卡点。

小红书 dots 实验室宣布开源 dots3 系列首个模型 dots3-note preview。该模型总参数 280B、激活参数 16B,支持 512K 上下文,并具备文本、视觉与语音多模态理解能力。官方将其定位为面向旅行规划、婚礼筹备、家装与经营等长程开放任务的 Agent 模型,同时披露了 TEMPO、自我评价机制,以及 VibeSearchBench 和 VibeLifeBench 两套评测基准。

OpenAI 于 8 月 14 日凌晨联合 AI 芯片厂商 Cerebras 预览 GPT-5.6 Sol 的「超高速模式」。该模式最高输出速度可达 750 tokens/s,较标准模式约 53 tokens/s 提升最高 14 倍。OpenAI 表示,该模式将率先上线 API,并已向部分客户开放有限预览。Cerebras 披露,GPT-5.6 Sol Ultrafast 在 HLE 测试中用 11 小时 11 分钟完成 2500 道题,Claude Fable 5 用时 78 小时 27 分钟。

原阿里通义千问技术负责人林俊旸正式公布创业去向,在上海创办 AI 公司 Pragmatik Labs(语用科技,简称 p7k),研究横跨数字世界和物理世界的下一代 Agent。林俊旸披露,高榕创投与 HSG(红杉中国)共同领投本轮融资,腾讯和上海未来产业基金提供支持。公司官网已上线,当前公开方向涵盖数字 Agent、物理 Agent、研究到产品以及长程探索。

内蒙古乌兰察布正成为中国 AI 算力基础设施竞争的核心区域。凤凰网科技实地探访显示,阿里云已在当地建设采用模块化设计的 5.0 方舱数据中心,并称其承载了阿里云 80% 的智算业务。随着 DeepSeek 计划在当地建设总功率达 1 吉瓦的超大型智算中心,行业也从“租机房、买算力”转向更重视自建或深度掌控算力底座。低电价、高绿电占比、低时延与气候条件,正在推动乌兰察布成为全国大型智算集群重地。

8月11日,据The Information报道,英伟达(NVDA.O)正在开发新一代Nemotron 4开源AI模型。多位参与NEMOTRON项目研发的员工预计,最大NEMOTRON 4模型的参数规模至少达到1万亿。

宇树科技于 8 月 10 日启动科创板网上申购,发行价为 150.8 元/股,发行市值约 609 亿元。此前披露的 IPO 战略配售名单显示,深度求索获配 93.339 万股,金额约 1.41 亿元。宇树科技董事长王兴兴称,双方已签署《战略合作备忘录》,合作方向涉及通用人工智能、机器人本体和 AI 大模型,但具体执行细节尚未公开。

据英国《金融时报》援引三名知情人士消息,字节跳动正处于超大规模 AI 模型训练早期阶段,参数量可能达到 10 万亿级别,约为月之暗面 Kimi K3 的三倍。知情人士称,该模型已进入预训练阶段,通常需要 3 至 6 个月,后续若进展顺利将进行微调并发布。
