返回自监督学习

自监督学习

Skild AI
2026-08-26 08:30:11

Skild AI发布机器人模型S1:看一遍演示即可完成长程任务

北美具身智能公司 Skild AI 发布机器人基础模型 S1,核心是上下文学习能力:模型无需后训练或微调,只看一段人类演示视频,就能完成未见过的新任务。官方展示中,S1可处理煎饼、咖啡冲泡、植物换盆和设备组装等任务,最长任务时长超过 10 分钟。在未见过任务上,其成功率为 66%,高于基于语言提示的 VLA 的 9%;若走传统后训练路线,大约需要约 380 次演示才能追平这一水平。

360
Skild AI发布机器人模型S1:看一遍演示即可完成长程任务
字节跳动
2026-08-12 03:10:10

字节 Seed 研究文生图文本条件扩展:长度饱和后结构化提示成关键变量

ByteDance Seed 团队在论文《Scaling Properties of Text Conditioning in Visual Generation》中提出,文生图训练中真正决定效果的并非 Caption 长度,而是其中可被模型利用的图像信息。团队据此引入 Structured Prompt,用结构化 JSON 组织全局、元素和关系层信息,并结合 GPG、ED 两项指标衡量文本条件信息量。在相同 Qwen-Image 架构、训练图像和预算下,这套结构化接口在复杂组合、推理和世界知识生成任务上取得更好结果。

1520
字节 Seed 研究文生图文本条件扩展:长度饱和后结构化提示成关键变量
自监督学习
2026-07-28 10:08:10

VISReg瞄准JEPA表征坍塌难题,获Yann LeCun连续转发认可

自监督学习新工作 VISReg 近日获得图灵奖得主 Yann LeCun 连续转发,并被其概括为从 VICReg 到 SIGReg 再到 VISReg 的技术延续。该方法把表征正则拆分为“尺度”和“形状”两个独立目标,试图解决 JEPA 世界模型中的表征坍塌问题。论文称,VISReg 不依赖 EMA、教师-学生网络、停止梯度冻结层等启发式技巧,在 15 个数据集上综合表现超过 7 种主流方法,并以约 1/10 的训练数据在 OOD 基准上追平 DINOv2。

1100
VISReg瞄准JEPA表征坍塌难题,获Yann LeCun连续转发认可