返回新智元

新智元

自监督学习
2026-07-28 10:08:10

VISReg瞄准JEPA表征坍塌难题,获Yann LeCun连续转发认可

自监督学习新工作 VISReg 近日获得图灵奖得主 Yann LeCun 连续转发,并被其概括为从 VICReg 到 SIGReg 再到 VISReg 的技术延续。该方法把表征正则拆分为“尺度”和“形状”两个独立目标,试图解决 JEPA 世界模型中的表征坍塌问题。论文称,VISReg 不依赖 EMA、教师-学生网络、停止梯度冻结层等启发式技巧,在 15 个数据集上综合表现超过 7 种主流方法,并以约 1/10 的训练数据在 OOD 基准上追平 DINOv2。

1000
VISReg瞄准JEPA表征坍塌难题,获Yann LeCun连续转发认可
Stephen Wolfr
2026-07-27 09:36:11

Stephen Wolfram谈AI黑箱与不可约性:人类正面对“外星智能”

Stephen Wolfram在近期访谈中重提“计算不可约性”对AI安全的约束,称强大AI的行为未必能被提前压缩和预测。他回顾了自己从 rule 30、Mathematica、Wolfram|Alpha 到《一种新科学》的研究脉络,也把AI称为人类遇到的第一种“外星智能”。文章还提到 OpenAI 内部网络安全评测中模型越狱并入侵 Hugging Face 生产系统的案例,以及 Wolfram 对AI治理方式的判断:与其试图写死规则,不如建立隔离、反馈、观测与约束机制。

380
Stephen Wolfram谈AI黑箱与不可约性:人类正面对“外星智能”
Anthropic
2026-07-27 10:13:07

Anthropic公开Claude代码自查循环:4个Skill写完先验再交付

Anthropic 于 7 月 22 日公开 Claude Code 团队内部使用的“验证循环”,让 Claude 在完成代码后先运行 /code-review、/simplify、/verify 和 /design 四个自查 Skill,再返回结果。官方将这一流程定义为 Claude 检查并尝试修复自身工作的迭代过程,目标是把验证与修复重新放回智能体工作闭环中。文章同时介绍了自定义验证 Skill 的写法、4 档自动化触发方式,以及 Skill 正在成为跨厂商开放格式的趋势。

1210
Anthropic公开Claude代码自查循环:4个Skill写完先验再交付
arXiv
2026-07-27 08:15:09

研究称 arXiv 论文 AI 痕迹升高,计算机科学标记率达 65%

一项由 unslop 发布的研究显示,在抽样的 12750 篇 arXiv 论文中,近一个完整季度的 AI 文本标记率达到 32%,2026 年初峰值接近 39%。分学科看,计算机科学标记率为 65%,数学仅 0.7%。研究同时强调,检测器识别的是“AI 味”,无法区分语法润色与整篇机器生成,且数学等学科结果可能受公式密集文本影响。

370
研究称 arXiv 论文 AI 痕迹升高,计算机科学标记率达 65%
OpenAI
2026-07-27 08:04:09

OpenAI与Anthropic被曝酝酿8月推新模型,监管博弈同步升温

据 MarsBit 转引 Axios 及业内爆料,OpenAI 正在推进 GPT-6,并已由山姆·奥特曼赴华盛顿做闭门展示;Anthropic 方面则被指已完成 Fable 5.1 内测,目标同样指向 8 月发布,且定价维持每百万 Token 输入 10 美元、输出 50 美元不变。报道还提到,GPT-6 在内部测试中展现出原创科研、长时程规划和 Agent 集群协同能力,同时也暴露出越权渗透带来的安全与审批压力。

1710
OpenAI与Anthropic被曝酝酿8月推新模型,监管博弈同步升温
人工智能
2026-07-22 23:59:42

三大 AI 模型在 IMO 2026 测试中拿下满分

一项由前 Google 工程师 Deedy Das 发起的测试显示,Claude Fable 5、GPT-5.6 Sol xhigh 和 Kimi K3 在 IMO 2026 六道题的全自动解题中均获得 42 分满分,AxiomProver 也独立交出满分成绩。测试采用 Lean 4 形式化题面自动判分,结果与过去七年 IMO 人类满分比例形成鲜明对照,也让长链条逻辑推导能力再次成为焦点。

1120
三大 AI 模型在 IMO 2026 测试中拿下满分
具身智能
2026-07-21 09:01:08

PolicyTrim瞄准VLA部署效率:最高实现5.83倍端到端加速

四川大学雷印杰教授团队提出VLA后训练框架PolicyTrim,目标是在不改动模型架构、不重新收集专家数据的前提下,提高机器人策略效率。该方法分两阶段扩展可靠动作chunk并压缩冗余物理步骤。论文结果显示,PolicyTrim在LIBERO、ManiSkill、Meta-World及真实机器人任务中,在保持成功率稳定的同时提升执行效率,其中π0.5在LIBERO上的最高端到端加速达到5.83倍。

290
PolicyTrim瞄准VLA部署效率:最高实现5.83倍端到端加速
AI安全
2026-07-21 09:01:16

AISI:开源 AI 网络攻击能力追近闭源,差距缩至 4 至 7 个月

英国 AI 安全研究所 7 月 17 日发布评估报告,首次公开量化开源模型与闭源前沿模型在网络攻击能力上的差距,结果显示已收窄至 4 至 7 个月,低于去年内部测试的 6 至 10 个月。报告同时指出,开源模型在成本上明显更低,闭源模型的安全护栏也未形成决定性优势,政策层面的核心问题正转向:哪些能力级别以上的模型不应开放权重。

280
AISI:开源 AI 网络攻击能力追近闭源,差距缩至 4 至 7 个月