生数科技正式发布Vidu S2模型,带来实时互动、实时视频编辑和空间视频探索三大能力升级。该模型发布当天即全量开放,不设内测、不限名额。Vidu S2包含两个细分模型:Vidu S2-Avatar负责实时交互,支持语音对话、语音控制数字人做动作,并可在交互过程中输入参考图;Vidu S2-Editing负责实时视频编辑,能够改变服装、人物、背景和视频风格。
在数字人交互方面,Vidu S2-Avatar大幅提升了动作执行能力。实测对比显示,同样让数字人跳舞、转圈和跺脚,上一代S1未能完成要求,而S2能跟随指令动起来。实时输出分辨率也从上一代的540p提升至720p,数字角色面部和衣服细节更加丰富。用户还可以在互动过程中随时提供新图片,让数字人拿起图中物品、换上指定衣服或进入新场景。
Vidu S2-Editing带来的实时视频编辑能力是本次最大更新之一。实测中,画面对准正在接受采访的女士,可秒切不同款式服装,人物动作连贯、脸部一致性良好,服装随动作产生的形变也较为真实。该模型还能更换背景、替换人物,并支持风格迁移。不过,实测也发现第二套衣服在呈现色块时仍有一点涂抹感,人物佩戴帽子时头发仍有轻微穿模。
Vidu S2-Editing对正在播放的画面提供四类实时编辑能力,这意味着直播间的视觉效果、虚拟角色演出和创意视频玩法都有了更多临场发挥空间。从Vidu S1到Vidu S2,生数科技仅用69天便完成了一次大版本跃迁。
咨询
咨询