田柯宇创办世界模型实验室,未发产品估值已达 2 亿美元

田柯宇创办世界模型实验室,未发产品估值已达 2 亿美元

N
News Editor
2026-10-08 08:53:27
曾因字节跳动实习争议受到关注的研究员田柯宇,已成立一家聚焦世界模型的 AI 实验室。彭博称,这家尚未正式命名、团队约 10 人的公司已获近 3,000 万美元融资,投后估值 2 亿美元。田柯宇计划构建不依赖人类语言的视觉表示系统,并让模型学习约 1 亿小时视频数据,完整基础模型预计于 2027 年推出。

曾因字节跳动实习争议被中国网友称为「AI 投毒实习生」的研究员田柯宇,如今以创业者身份再次进入公众视野。

据彭博 10 月 7 日报道,田柯宇已成立一家专注于世界模型(World Models)的 AI 实验室。该公司尚未正式命名,也没有公开产品,团队规模约 10 人,但已获得五源资本、IDG Capital 等机构近 3,000 万美元融资,投后估值达到 2 亿美元。

计划构建不依赖人类语言的视觉表示系统

田柯宇的目标,是打造一套不依赖人类语言的 AI 视觉表示系统,让模型通过约 1 亿小时视频理解真实世界。这一路线将与李飞飞、杨立昆等研究者投入的世界模型技术形成竞争。

他认为,当前大型语言模型使用的人类语言,并不是描述物理世界最高效的方式。以一段视频为例,如果只靠文字完整描述,除了人物和物体,还要交代每个对象的位置、运动轨迹、光影变化以及物理互动,自然语言很难完整保留这些信息。

基于这一判断,田柯宇选择反过来设计系统:不是让 AI 学习用人类语言描述视频,而是直接为 AI 建立一套更适合处理视觉信息的符号体系。

按照他的说法,团队已经建立了一套类似字典的视觉表示系统,其中包含约 20 万个人类无法直接识读的符号。这些符号类似大型语言模型中的 Token,但处理对象不是文字,而是图像和视频中的视觉信息,用于以更适合机器计算的形式表示、压缩和预测视频内容。

田柯宇表示,人类无法用自然语言完美描述一段视频,因此团队首先要为 AI 建立自己的语言,再让模型学习约 1 亿小时的视频数据。

这套技术延续了他过去在视觉自回归生成(Visual Autoregressive Modeling)上的研究方向,试图让视觉模型像大型语言模型一样,通过可规模化的表示和预测机制完成训练。

他还称,这种方法目前已能把每秒视频生成成本至少降低一个数量级,也就是降到原来的十分之一或更低。不过,这一效率提升仍有待公开技术成果验证。

团队计划先通过线下活动和公开展示介绍模型能力,完整基础模型预计于 2027 年推出。田柯宇强调,现阶段并不急于开发消费级产品,商业模式也不是优先事项,团队会先集中资源完成底层技术。

字节跳动实习争议与法院判决

2024 年,田柯宇在字节跳动实习期间,被指控擅自修改或干扰其他研究人员执行的模型训练程序,随后遭公司开除。事件很快在中国 AI 社群发酵,网络上还出现了他破坏大型基础模型训练、影响超过 8,000 张 GPU、造成数千万美元损失等传言。

不过,字节跳动当时曾公开澄清,部分网络说法存在严重夸大或误导。

田柯宇在接受彭博采访时承认,自己当时确实关闭了另一名实习生的程序,原因是他认为对方超额占用了计算资源,希望释放算力供其他研究工作使用。

他将这次行为描述为用不当手段处理不当问题,并表示如果可以重新选择,自己应该采取更明智的处理方式。

字节跳动事后向田柯宇提出 800 万元人民币损害赔偿请求。根据彭博查阅的法院判决文件,法院最终判令田柯宇因违反合同赔偿 50 万元人民币,并返还其在字节跳动取得的薪资。

离开字节后获得 NeurIPS 2024 最佳论文奖

尽管卷入争议,田柯宇在 AI 研究领域仍有获得国际学术社群认可的成果。2024 年,他以第一作者身份发表论文《Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction》,并获得 NeurIPS 2024 最佳论文奖。

这篇论文提出名为 VAR 的视觉自回归建模方法。其核心思路是,AI 不再按传统方式逐个预测图像 Token,而是从低分辨率到高分辨率,逐步生成不同尺度的图像内容。

这种「下一尺度预测」方法,让视觉生成更接近大型语言模型的自回归建模框架,同时改善了传统方法在图像生成上的效率和可扩展性。

田柯宇当前的创业方向,就是把这一路线从静态图像延伸到视频和物理世界建模。他的目标并不只是开发另一款 AI 视频生成工具,而是建立能够理解空间、物体运动和物理规律的基础模型,用于支撑机器人、自动驾驶和交互式虚拟环境等场景。

世界模型成为 AI 研究和产业的新焦点

世界模型正逐渐成为大型语言模型之外,AI 研究者和科技公司集中投入的方向。与主要处理文字、代码和知识推理的语言模型不同,世界模型试图让 AI 建立对外部环境的内部表示,理解物体如何移动、彼此如何影响,并预测不同操作可能带来的结果。

在这一领域,由「AI 教母」李飞飞创立的 World Labs 是空间智能方向的重要团队。ABMedia 文中提到,AMD 已于今年 9 月 28 日宣布,将以约 82 亿美元全股票交易收购 World Labs,希望借助该公司的空间智能技术和研究人才,强化其在机器人、物理 AI 以及新一代计算基础设施上的布局。该交易仍需通过监管审查,预计于 2026 年底完成。

另一边,前 Meta 首席 AI 科学家杨立昆也在持续推进世界模型研究,Google DeepMind 的 Genie 系列同样在探索可实时生成、供用户交互的虚拟环境。

对于目前仅约 10 人、尚未推出公开产品的田柯宇团队来说,近 3,000 万美元的早期融资,显示出创投机构对其研究能力和技术路线的期待。至于这套 20 万视觉符号体系,以及大规模视频训练,能否最终转化为真正理解物理世界并支持实际任务的基础模型,仍要等待后续公开展示和技术测试结果。

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
100

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。