Kimi开源PerceptionBench,16款模型准确率均未超过60%
Kimi宣布开源多模态大模型视觉感知评测基准 PerceptionBench,将视觉感知拆分为 10 项原子级能力独立测试。该基准基于 42 个现有评测集中的模型失败案例构建,包含 3000 道经人工验证的问题。评测覆盖 16 款前沿多模态大模型,结果显示没有任何模型整体准确率超过 60%,GPT-5.6-Sol 以 59.7% 排名第一。报告还指出,视觉幻觉是各模型表现最弱的能力。

Kimi宣布开源多模态大模型视觉感知评测基准 PerceptionBench,将视觉感知拆分为 10 项原子级能力独立测试。该基准基于 42 个现有评测集中的模型失败案例构建,包含 3000 道经人工验证的问题。评测覆盖 16 款前沿多模态大模型,结果显示没有任何模型整体准确率超过 60%,GPT-5.6-Sol 以 59.7% 排名第一。报告还指出,视觉幻觉是各模型表现最弱的能力。

英伟达发布开源多模态模型Nemotron 3 Nano Omni,单模型统一处理视频、音频、图像和文本,专为AI代理设计。30B参数混合专家架构,视频推理性能提升9.2倍,权重、数据集和微调配方全公开。

DeepSeek称V4将优先采用国产芯片方案,背后折射出中国AI产业在算法优化、国产算力与全球Token输出上的同步推进。

在 2026 年世界人工智能大会一场围绕世界模型的圆桌讨论中,复旦大学副校长姜育刚、智元机器人合伙人姚卯青、它石智航 CEO 陈亦伦和亮源新创 CEO 姜旭认为,通用具身智能距离落地仍远,现阶段需先在专用场景取得突破。讨论聚焦数据瓶颈、模型架构分歧和制造业落地路径,嘉宾将未来竞争重点指向高质量数据获取与场景闭环验证能力。

阶跃星辰于 7 月 13 日发布大模型原生智能体手机 STEPX Neo,搭载 Step AOS 与内置智能体 Amoo,并推出 Step Edge 端侧模型和 GUI-MCP 协议,试图绕开豆包手机助手曾因模拟点击跨应用而遭遇风控的旧路。产品将于 7 月 17 日在 WAIC 首秀,硬件配置和售价尚未公布。其跨应用能力最终能否成立,取决于 App 厂商接入意愿、协议稳定性以及利益分配机制。

阶跃星辰于 7 月 13 日发布大模型原生智能体手机 STEPX Neo,搭载 Step AOS 和智能体 Amoo,并推出 Step Edge 端侧模型与 GUI-MCP 协议。与豆包手机助手依赖模拟点击的路线不同,阶跃星辰主打协议化接口和端云协同。其首批生态合作方覆盖外卖、办公、出行、支付等场景,但跨应用能力最终能否成立,仍取决于更多 App 厂商是否愿意接入。

阶跃星辰于 7 月 13 日晚发布首款大模型原生智能体手机 STEPX Neo,搭载 Step AOS 与智能体 Amoo,并推出 Step Edge 端侧模型和 GUI-MCP 协议。文章认为,这一路线与豆包手机助手依赖模拟点击的跨应用方案不同,核心在于以标准化接口争取 App 厂商接入。但这套方案能否打破生态围墙,仍取决于合作范围、利益分配和真实场景下的稳定性。

ARIA.AI代币ARIA当前价格较历史高点下跌96%,但较历史低点已反弹38.83%,流通量约3.12亿枚。市场关注AI赛道复苏与供需博弈。
