← 返回资讯热点
AI热点雷峰网发布时间:2026-07-03 12:48热度 142

生数科技发布 Vidu S1,推动视频生成迈向“实时交互”新时代

7月3日,在2026全球数字经济大会人工智能融合应用发展论坛,生数科技创始人朱军发表题为《通用世界模型,推动数字世界与物理世界统一的新范式》的主题演讲,并正式发布面向实时交互场景的新一代模型——Vidu S1 实时交互模型。大会期间,北京软件和信息服务业协会(BSIA)正式发布《2025年北京市数字经济标杆企业评价报告》,生数科技凭借在技术创新与产业应用方面的突出表现,成功入选“新模式新应用标杆企业”。 Vidu S1 实时交互模型,提供实时可交互的新一代视频生成能力,推动AI视频从“生成一段内容”,迈向“持续进行互动”。 模型支持 实时视频通话和语音控制视频走向 ,用户不仅能通过 语音控制数字人的行为 ,还能实现 无限时长连续互动 。同时,Vidu S1支持 540P (960x540)高清分辨率、25FPS帧率(最高支持42FPS) ,可基于真人、动漫、萌宠等任意初始形象及个性化音色,快速创建专属交互角色,为用户带来更自然、流畅、更具沉浸感的实时互动体验。 语音指令实时跟随,从离线生成到实时回应,让数字人真正“听懂”用户 传统视频大模型通常采用“输入提示词—等待生成—播放结果”的离线模式。视频生成后,内容和走向基本固定,如需调整动作或剧情,只能重新输入提示词生成,人与视频仍是离线的“生成与观看”关系。 Vidu S1 打破了这一边界。 用户可以在视频通话过程中持续输入语音,模型则结合语音内容、对话上下文和当前画面状态,实时生成角色的后续内容和动作。 与此同时, Vidu S1也让数字人从“语音驱动口型”,进一步走向“语音控制行为”。 不同于传统数字人依赖“音频驱动口型+预设动作库”,Vidu S1 采用实时视频生成技术,将语音从驱动嘴型的音频信号,升级为控制角色视觉行为的实时指令。模型不仅能够生成与语音同步的口型,还能理解语义、意图与情绪,实时生成相匹配的表情、眼神、手势、身体姿态及全身动作, 让数字人从“会说话的虚拟形象”,进化为能够理解用户、即时回应并持续互动的生成式角色。 无限时长实时生成,让视频在互动中持续演化 传统视频生成模型通常一次生成一段 3s-30s 的固定时长的视频。视频生成过程中,用户难以在过程中加入新的指令,实时改变后续画面。 Vidu S1 采用自回归扩散模型 (AR + Diffusion) 路线,不再一次性生成完整视频,而是基于已经生成的历史画面,结合当前语音指令和对话上下文,持续预测并生成后续内容。 当用户发出新的语音指令时,模型可以实时理解并调整角色的表情、动作及后续视频走向,使视频从预先确定的固定内容,转变为一个持续生成、实时响应、动态演化的交互过程。 除了交互式实时生成,Vidu S1 还首次实现了 无限时长的实时视频生成 。即使连续生成数小时,画面仍能保持稳定,不会漂移或崩坏。 实现长时间连续互动,仅仅“持续生成”还

来源:雷峰网
说明:本站展示中文整理摘要,便于快速判断价值;完整内容和版权归原站所有。