字节跳动近日开源了AnimateDiff-Lightning模型,该模型基于Stable Diffusion,仅需4步推理即可生成高质量视频,速度提升10倍以上。项目已在GitHub发布,包含模型权重和推理代码。
AnimateDiff-Lightning通过渐进式对抗训练和潜在一致性蒸馏技术,解决了多步采样速度慢的问题。实验显示,在4步设置下,其生成视频的FVD和CLIP评分均优于现有方法,接近50步采样的质量。
该模型支持文本到视频生成,并兼容ControlNet等扩展工具。字节跳动表示,后续将发布更多预训练权重和训练脚本,推动AI视频生成技术的普及。