三大 AI 模型在 IMO 2026 测试中拿下满分
一项由前 Google 工程师 Deedy Das 发起的测试显示,Claude Fable 5、GPT-5.6 Sol xhigh 和 Kimi K3 在 IMO 2026 六道题的全自动解题中均获得 42 分满分,AxiomProver 也独立交出满分成绩。测试采用 Lean 4 形式化题面自动判分,结果与过去七年 IMO 人类满分比例形成鲜明对照,也让长链条逻辑推导能力再次成为焦点。

一项由前 Google 工程师 Deedy Das 发起的测试显示,Claude Fable 5、GPT-5.6 Sol xhigh 和 Kimi K3 在 IMO 2026 六道题的全自动解题中均获得 42 分满分,AxiomProver 也独立交出满分成绩。测试采用 Lean 4 形式化题面自动判分,结果与过去七年 IMO 人类满分比例形成鲜明对照,也让长链条逻辑推导能力再次成为焦点。

宇树机器人递交科创板IPO申请,计划融资6.2亿美元。招股书显示,2025年人形机器人出货5500台全球第一,但74%销往学术机构,工业应用仅占9%。毛利率近60%,垂直整合是核心优势。

IT桔子统计了 107 家中国 AI 和机器人/具身智能独角兽的天使轮投资方,发现截至 2026 年 7 月,接近 300 家机构至少在天使轮收获 1 家独角兽。按总量看,红杉中国以 11 家居首,高瓴创投和真格基金各有 9 家;若只看 2022 年后新增的具身智能布局,奇绩创坛、蓝驰创投和 SEE Fund 更集中。报告还梳理了三家机构各自的投资方法,以及美元基金与人民币基金在超早期项目上的节奏差异。

四川大学雷印杰教授团队提出VLA后训练框架PolicyTrim,目标是在不改动模型架构、不重新收集专家数据的前提下,提高机器人策略效率。该方法分两阶段扩展可靠动作chunk并压缩冗余物理步骤。论文结果显示,PolicyTrim在LIBERO、ManiSkill、Meta-World及真实机器人任务中,在保持成功率稳定的同时提升执行效率,其中π0.5在LIBERO上的最高端到端加速达到5.83倍。

英国 AI 安全研究所 7 月 17 日发布评估报告,首次公开量化开源模型与闭源前沿模型在网络攻击能力上的差距,结果显示已收窄至 4 至 7 个月,低于去年内部测试的 6 至 10 个月。报告同时指出,开源模型在成本上明显更低,闭源模型的安全护栏也未形成决定性优势,政策层面的核心问题正转向:哪些能力级别以上的模型不应开放权重。

第 67 届国际数学奥林匹克 7 月 13 日至 21 日在上海举行,中国队以全员金牌、团体总分 232 分夺冠,领先第二名美国队 25 分。邓乐言、张柏伦、刘澈以满分摘金。报道同时提到,GPT-5.6 Pro 被称在无人工提示下首次尝试解出 2026 年 IMO 全部 6 题,但截至成绩揭晓尚无官方公开结果。

MarsBit援引多方公开信息称,a16z 联合创始人 Marc Andreessen 在播客中表示,AGI 可能已在 2026 年 2 月前后悄然到来,判断标准是模型通用认知能力已达到或超过聪明人的水平。他同时描述了硅谷重度 AI 用户的工作状态:领先科技公司的程序员在使用 AI 后每小时产出可达过去的 20 倍,但工作时间反而拉长。报道还提到医疗测试与模型异常行为记录,显示模型能力提升与稳定性问题并存。

Kimi K3发布后,低价冲击高端模型定价引发讨论。同期,OpenAI CEO Sam Altman罕见发文认错,并称公司将迎来“有史以来最出色的12个月”;OpenAI与Anthropic也在同一周相继取消或上调部分产品额度。OpenAI CFO Sarah Friar还提出“每美元有用智能”指标,主张用完成任务的总成本,而非单纯 token 单价,衡量 AI 产品价值。
