越大越强,不再是 LLM 的专利:PixVerse R2 攻克实时世界模型 Scaling 难题
AI 视频的下一战:谁能让世界保持运行 作者丨Reah 编辑丨李娜 岑峰 大语言模型已经用 Scaling 证明模型、数据和算力可以持续换来更强能力,必须一边生成、一边回应用户的实时世界模型,能不能也走上这样一条路? 2026 年 1 月,爱诗科技提出“通用实时世界模型”这 一产品方向,并推出 R1。 目前,PixVerse R2 已全量上线 用户可以直接进入网页端体验动作指令和互动影游的相关交互 01 实时世界模型, 能走上 LLM 的 Scaling 之路吗 过去几年,Scaling 最具确定性的成功故事来自大语言模型。随着模型容量、训练数据和计算规模持续扩大,语言模型获得了更强的理解、推理与泛化能力,“越大越强”也由此成为大模型产业最重要的认知基础之一。 但如果把这条经验迁移到世界模型的话,问题就复杂很多,不能只是简单地继续放大视频生成模型。语言模型可以在接收问题后集中计算再给出答案,但 实时世界模型却必须一边运行,一边接收用户的动作、文字和声音,同时继续输出连贯的音视频内容。 于是这形成了一组长期存在的矛盾:实时要求模型足够快、足够高效,通用则要求模型足够强、见过足够丰富的世界。模型能力向上扩展,计算负担就要随之增加;如果为了速度持续压缩能力,实时体验又容易停留在只能完成有限演示的专项模型。 为什么实时世界模型不能简单复制 LLM 的 Scaling?为什么“快”和“强”会互相拉扯?PixVerse R2 给出了自己的答案 —— 把能力与效率拆成两层推进,具体的实现机制我们会在后文展开更详细的讨论。 R2 将五类增长纳入同一可扩展框架,使生成质量、长程一致性和多模态控制能够共同提升 02 一次生成, 怎样变成一个持续运行的世界? 进入 PixVerse R2 实时生成的世界“冬日宫殿”,用户面对的是一个真实仍在运行的世界。WASD 和方向键用于控制移动与视角,新的指令可以继续改变当前体验;每次操作之后,页面不会退回独立的生成流程,用户仍然留在同一个世界里,决定下一刻发生什么。 技术报告中的 Scaling 最终需要回到产品端接受检验:它能否让用户真正进入一个世界,而不是在一段视频上叠加几个控制按钮? 为此,我们除了进行实机体验,还进一步分析了冬日宫殿会话的 HAR 网络记录。 HAR 可以被 理解为浏览器网络活动的飞行记录仪 ,它虽然没办法直接看见模型内部,但能帮我们记录一次产品会话究竟怎样被组织。 本轮会话最关键的事实是客户端全程只观察到一次 session_init 和一次 generation_started 。此后八轮系统推荐 Prompt 共享同一条内容流,提示历史从第一轮连续累积到第八轮,客户端没有为每一轮输入重新预约资源、初始化会话或切换媒体通道。约 119.5 秒的生成窗口里,所有操作都被组织在同一条持续 session 中。 这意味
说明:本站展示中文整理摘要,便于快速阅读;完整内容和版权归原站所有。