← 返回资讯热点
AI热点雷峰网发布时间:2026-10-09 10:34热度 212.0000

当年「字节投毒实习生」田柯宇,估值 2 亿美元,要挑战李飞飞做世界模型

2026 年 10 月,AI 创投圈迎来一笔颇具戏剧感的融资。 一家 10 人规模的神秘实验室,没产品、没名字,成了资本市场冰火两重天的风暴眼。一方面,业内进行着道德审判, “人品不行的公司绝对不能投”,另一方面,顶级 VC 机构五源资本和 IDG 却暗中追捧,偷偷塞了 3000 万美金,把估值推到 2 亿美元。 而这家公司的创始人,正是 2024 年震动国内 AI 圈、 被称作 “字节投毒实习生” 的北大博士生田柯宇 。彼时,他身陷字节跳动索赔 800 万元的诉讼风波,却同时以第一作者身份拿到 NeurIPS 2024 最佳论文奖。这样一个争议与天才并存的人,如今又拿到了顶级 VC 的巨额押注, 要在世界模型领域另辟蹊径,与李飞飞较量。 在世界模型热的当下,路线之争加速分化且日趋复杂,资本押注技术团队时,也在技术爆发力和历史污点中重新权衡。 01 田柯宇的公司在做什么? 田柯宇切入世界模型赛道的角度确实独特, 他想让 AI 发明一套自己的语言,重新理解现实世界。 在他看来,人类语言并不适合完整描述物理世界,它的信息维度太低,会丢失了海量物理信息,也会白白消耗算力。比如,一段橘猫从桌上跳下的五分钟视频,很难用文字准确描述物体的位置、运动轨迹、光影和物理变化。 因此,他的思路是创造一套 AI 专属的符号语言。目前, 团队已经搭建了一套包含 20 万个符号的“视觉词典”。 这些符号人类看不懂,但 AI 可以用它们表示、压缩和预测视频。据他介绍, 这种方法能将生成一秒钟视频的成本降低至少一个数量级。 然后,他们准备喂进去大约 1 亿小时的视频,让模型通过这套自己的语言去学习现实世界。最终,田柯宇希望打造一个机器人、自动驾驶和交互式视频等领域的基座模型,计划于 2027 年正式发布。 他透露,团队目前不急于商业化,重心仍放在基座模型研发上。 有网友指出,这个想法并无新意,本质上就是把图像和动作换成了机器自己的符号。不过,这套“新语言”对视觉模型有一个实打实的用处,能彻底解决“指代不清”的混乱,让 AI 在长时间模拟物理世界时保持绝对的稳定,从而真正改良视觉模型的底层架构。 这个想法并非凭空诞生,如果溯源,其实绕不开两年前,他以第一作者身份拿下的那篇 NeurIPS 2024 最佳论文, 《 Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction 》, 这篇论文正是他在字节参与的项目,开发新一代的视觉生成模型 VAR。 在当年 NeurIPS 上万篇投稿中,这篇论文能杀出重围, 关键在于它让视觉生成像 LLM 一样,可以依靠 Scaling Law 持续提升能力,同时降低生成成本和实现复杂度。 在 VAR 出现之前,视觉生成一直在两条弯路上内卷。 最早的一派

来源:雷峰网
说明:本站展示中文整理摘要,便于快速阅读;完整内容和版权归原站所有。