前字节跳动实习生田柯宇公开披露了自己的世界模型创业计划。按其说法,团队已从五源资本、IDG 资本等机构融资近 3000 万美元,投后估值为 2 亿美元。
目前,这支团队约有 10 人,还没有公开发布产品。
团队计划用视觉符号处理视频
世界模型的目标,是让 AI 学习现实世界中物体如何运动和变化,应用方向包括视频生成和机器人。
田柯宇是 NeurIPS 2024 最佳论文的第一作者,曾研究让 AI 从粗到细逐步生成图片。新团队沿着这一方向,为视频设计了一套包含 20 万个视觉符号的「词表」。这些符号的作用,类似语言模型处理文字时使用的 Token,用来让 AI 以更适合计算的方式处理视频。
团队计划用 1 亿小时视频训练模型。田柯宇称,这种方法有望把每秒视频的生成成本降至现有水平的十分之一,甚至更低。
发布时间表与公开计划
按田柯宇的说法,团队准备先做公开演示,完整模型将在 2027 年发布。
字节纠纷与法院判决
田柯宇还向彭博社承认,自己曾关闭另一名实习生的程序,并称当时是为了腾出算力给其他研究者使用,同时承认这一做法并不妥当。
字节跳动于 2024 年将其辞退,随后起诉索赔 800 万元。彭博社查阅的判决书显示,法院判令田柯宇因违约支付 50 万元。
本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.

