AI 开始学习「想象未来」:ECCV 2026背后,中国学者如何卡位世界模型
世界模型开始合流,中国团队正在进入核心问题。 作者丨吴思梦 编辑丨岑 峰 2026 年 9 月 8 日,全球计算机视觉顶级会议 ACM 与 ECVA(European Computer Vision Association)主办的 ECCV 2026 将在瑞典马尔默的 Malmö Arena 和 Malmömässan 两个相邻场馆开幕。 这个两年一届、与 CVPR、ICCV 并称计算机视觉领域“三大顶会”的学术盛会 ,收到了 10473 篇论文投稿,最终接收 2883 篇(接收率 27.5%)。在会议公布的 86 个 workshop 中,有 13 个直接以“World Models”或“Embodied AI”为主题,这是 ECCV 历史上从未出现过的密度。Yann LeCun、Jürgen Schmidhuber、Kristen Grauman、Jamie Shotton 等学者都将作为 keynote 演讲者出现。 围绕世界模型的 workshop、tutorial 和论文,从三维理解、视频生成,到具身智能、安全评估,被集中放到了 ECCV 2026 的议程中。届时AI 科技评论将前往现场,进行前沿追踪报道。 这背后代表的不只是一个研究方向升温。它意味着 AI 的竞争正在从“理解世界”,走向“预测世界”。 而在这场变化中,中国研究者正在试图占据新的位置。 01 ECCV 2026 为什么突然都在讨论世界模型? 世界模型并不是一个新概念。早在强化学习领域,研究者就提出过类似思想:如果智能体能够预测环境变化,就可以减少真实世界中的试错成本。 但过去很长时间,这条路线没有真正成为主流。原因很简单:世界太复杂。 真实环境中的数据昂贵,物理规律难以建模,而传统模型很难同时处理视觉、动作和长期预测。过去两年的变化,让世界模型重新进入中心。 一方面,生成式 AI 的快速发展,让模型第一次具备了预测复杂视觉世界的能力。另一方面,机器人和自动驾驶产业开始迫切需要一种新的学习方式。 机器人不能像语言模型一样,通过互联网文本获得经验。它需要面对真实世界里的动作和反馈。 于是,一个新的问题出现:AI 能不能像人一样,在行动之前先想象? ECCV 2026 的世界模型相关讨论,实际上集中在四个问题。 第一个问题:世界模型如何构建? 研究者需要回答,什么样的数据才能训练一个理解世界变化的模型。单纯的视频是否足够?是否需要动作数据?是否需要三维信息? 第二个问题:世界模型如何评价? 过去评价生成模型,通常关注图像质量。但世界模型不同。一个模型生成的视频再逼真,如果无法帮助机器人完成任务,也没有真正价值。因此,新的评测体系开始关注:模型是否理解空间关系?是否符合物理规律?是否能够预测行动结果? 第三个问题:世界模型是否可靠? 如果未来进入自动驾驶、人形机器人等领域,错误预测可能带来
说明:本站展示中文整理摘要,便于快速阅读;完整内容和版权归原站所有。