← 返回资讯热点
AI热点雷峰网发布时间:2026-09-30 08:09热度 148.0000

从海拉鲁到现实世界:视频模型如何理解「变化」

HiDream-O1-Video 的三场世界回应测试。 作者丨Reah 编辑丨李 娜 在《塞尔达传说:旷野之息》中,玩家点燃一片草地,火焰会沿着草叶蔓延,热空气随之升起。此时展开滑翔帆,林克便能借助上升气流离开地面。雷雨中装备金属武器可能招来闪电,降雨又会让攀爬变得困难。海拉鲁并没有追求照片级的视觉拟真,却通过一组稳定、可组合的规则,让玩家感受到一个世界正在持续运行。 这种体验的关键是无论世界里有多少种物体,系统都会回应玩家的行动,并且符合物理规律。规则稳定,玩家才有可能根据经验作出预测;多条规则相互作用,又会产生未被逐一写死的解法。一个可信的虚拟世界,因而同时包含状态、变化、交互与反馈。 素材出自抖音博主「丑丑鱼-主机游戏」 《塞尔达》当然不是机器学习语境中的世界模型。前者的规则主要由设计师与工程师显式构建,后者则试图从数据和交互中学习状态、行动与后果之间的关系。两者机制不同,但指向了同一种直观体验:一个世界之所以成立,肯定不是因为它看起来真实,关键是它能够对行动作出符合人们物理世界的回应。 这也是理解世界模型的一个有效入口。世界模型不是更大规模的视频生成器,也不是把图像、视频、三维空间和机器人排列在同一张矩阵图里。它需要形成对世界状态及其变化规律的表征,并进一步支持预测、规划或行动。 智象(HiDream.ai)将新发布的 HiDream-O1-Video-1.0 (下文简称为HiDream V1)定义为“更懂真实世界的视频生成模型”,并把它放在“一个 UiT( Unified Transformer)、四大模型同源演进”的世界模型路线中。按照官方介绍,模型具备前置多模态意图理解、5—20 秒动态时长、1080P 输出、物理变化生成和原生音画等能力。Video 在这套叙事中的作用,是让静态空间进入时间:模型不仅要呈现世界是什么样,还要表达一个动作发生后,世界将如何变化。 不过,视频模型本身并不是完整的世界模型,一段符合常识的成片也不能证明模型已经形成了可泛化的物理认知。要判断更懂真实世界是否超越传播口号,仍然需要回到可观察的输出。 比如在下面这个场景中,拉环尚未弹开,气泡声是否已经提前响起;可乐在手中晃动是否符合液态规律。 比如在炒菜的场景里料酒还未落入热锅,火焰是否凭空升起; 比如鼓槌没有接触鼓面,鼓声是否已经出现。 宏大的世界模型命题,最终需要从这些最小的状态变化开始接受检验。 01 我们怎么测试 “世界有没有正确回应”? 今天的视频模型已经能够稳定生成大量运动效果:镜头推进、人物转身、头发飘动、烟雾扩散与火焰变化都不再罕见。但画面存在运动,并不等于模型完成了一个事件。完整事件至少包含三个层次: 首先是对象发生运动,其次是动作按顺序产生结果,最后是视觉、声音与状态变化都能找到对应原因。 大量生成结果仍会停留在第一层。它们通过运动模糊、镜头晃动、火焰和

来源:雷峰网
说明:本站展示中文整理摘要,便于快速阅读;完整内容和版权归原站所有。