生数科技Vidu S1:实时视频通话级交互,无限时长语音控场

当视频生成不再是预先渲染的“离线任务”,而是可以像视频通话一样实时对话、由语音指令驱动画面持续演进,AI视频的边界就被彻底重写了。7月3日,生数科技在2026全球数字经济大会上发布的Vidu S1实时交互模型,正是这一转变的明确信号。它把视频生成从分钟级的等待压缩到毫秒级的响应,且搭配无限时长连续交互能力,为虚拟陪伴、直播、即时内容创作等场景打开了新的可能性。

Vidu S1采用自回归扩散技术路线,一改传统视频生成“先定内容再输出”的离线逻辑。模型基于已生成的画面帧和用户的语音指令,持续预测并生成后续视频内容,形成闭环互动。这意味着用户可通过自然语言实时控制视频走向——例如要求角色转身、改变场景光线、调整表情——而无需重新渲染或中断流程。同时,Vidu S1无需传统三维建模或动作捕捉,仅凭一张图片即可创建角色,并支持自定义音色,进一步降低了实时交互视频的创作门槛。

在技术指标上,Vidu S1在540P分辨率下实现25FPS的实时生成速度,峰值可达42FPS。虽然分辨率低于主流的720P/1080P输出,但考虑到实时生成对算力的巨大消耗,这一折衷在可接受范围内。生数科技通过TurboDiffusion等技术显著降低计算成本,使得实时推理能够跑在相对经济的硬件上,这对商业落地至关重要。目前模型已开启内测,实际延迟和交互稳定性有待验证。

行业内同类产品多聚焦于离线生视频的高质量(如Sora、Runway Gen-3),实时交互领域尚属空白。Vidu S1的价值在于将视频生成从“创作工具”升级为“实时互动伙伴”,其无限时长连续交互特性远超此前所有产品。不过,540P分辨率也限制了在精细场景下的表现力,更适合以人物/角色为中心、强调即时反馈的应用,如虚拟主播、线上客服、教育陪练等。

对于关注AI视频落地的从业者,Vidu S1的内测值得跟进。虚拟陪伴和直播带货场景可优先尝鲜,借助语音控制与实时渲染,打造类似“AI数字人”的无延迟互动体验。然而需注意,内测阶段模型在复杂场景切换、多对象交互下的表现仍需实测,且TurboDiffusion的实际降本效果与硬件需求将直接影响部署成本。长远来看,实时交互视频的分辨率有望随算力提升而改善,Vidu S1或许只是开端——当视频生成达到“实时通话”级,AI与人的视觉交互将彻底重构。