返回模型表现

模型表现

Claude Code
2026-07-30 10:10:09

Claude Code负责人称产品脚手架半年就该重删重测

Anthropic Claude Code 负责人 Boris Cherny 在 YC 最新访谈中表示,AI 产品团队应定期删除 system prompt、skills 与 hooks,再逐项加回测试影响。他将这套方法归纳为消融实验,并称 Claude Code 的 harness 如今大多只保留安全、权限和静态分析部分。访谈中,他还提出“产品悬余”和“解缚”两组思路,主张给模型更难任务、增加实验,并让模型自行验证结果。

450
Claude Code负责人称产品脚手架半年就该重删重测
巨鲸运动
2026-07-29 02:34:00

7月29日加密与AI市场要闻:监管、融资与链上动态密集更新

7月29日,多项加密与AI相关动态集中出现:肯尼亚下调稳定币发行商资本门槛并保留严格储备监管;俄罗斯央行发布数字资产有组织交易草案;摩根士丹利资管推出以太坊与Solana ETP。与此同时,Luno、Visa披露裁员与业务调整,Zcash完成主网升级,Ionic Digital上市首日大涨,黑客攻击、代币异常波动与监管立法进展也继续成为市场关注重点。

2590
7月29日加密与AI市场要闻:监管、融资与链上动态密集更新
Kimi
2026-07-28 16:02:00

Kimi开源PerceptionBench,16款模型准确率均未超过60%

Kimi宣布开源多模态大模型视觉感知评测基准 PerceptionBench,将视觉感知拆分为 10 项原子级能力独立测试。该基准基于 42 个现有评测集中的模型失败案例构建,包含 3000 道经人工验证的问题。评测覆盖 16 款前沿多模态大模型,结果显示没有任何模型整体准确率超过 60%,GPT-5.6-Sol 以 59.7% 排名第一。报告还指出,视觉幻觉是各模型表现最弱的能力。

1770
Kimi开源PerceptionBench,16款模型准确率均未超过60%
Encord
2026-07-27 07:22:53

Encord测试用脑波标记机器人失误时刻,补足物理AI训练数据

加州数据工具公司 Encord 正与德国神经科学初创 Zander Labs 试验一套 EEG 脑波标记方案,让机器人训练员在执行任务时同步记录“错误感知”等神经信号。Encord 认为,物理 AI 的核心瓶颈不在芯片或算法,而在高质量训练数据不足。该项目目前仍处试验阶段,Encord 计划今年内再招募 10 名“飞行员”,先验证脑波数据是否真的能提升机器人模型表现。

2040
Encord测试用脑波标记机器人失误时刻,补足物理AI训练数据
微软
2026-07-24 02:30:06

微软上线两款 MAI 新模型,并称部分场景 GPU 成本最高降 89%

微软公布两款自研模型 MAI-Image-2.5-Pro 和 MAI-Voice-2-Flash,已进入公开预览,并披露在客服、图像生成、办公与医疗等场景中的内部评测数据。其中,客服中心切换至 MAI-Voice-2-Flash 后算力成本下降 89%,PowerPoint 图像生成的 GPU 成本下降 84%。微软同时表示,只要自家模型表现持平或超过前沿替代方案,就会把更多流量导向 MAI。

610
微软上线两款 MAI 新模型,并称部分场景 GPU 成本最高降 89%