谷歌研究院近日发布了一款名为Lumiere的新型AI视频生成模型,该模型能够根据文本提示生成高质量、连贯且具有真实感的视频。与现有的视频生成模型相比,Lumiere在时间连贯性和运动表现方面取得了显著进展,能够更好地处理复杂的动作和场景转换。

Lumiere采用了一种名为“时空U-Net”的架构,通过同时处理空间和时间维度,实现了对视频内容的全局理解。这一创新使得模型能够生成更加自然流畅的视频,并支持多种编辑功能,如局部修改和风格迁移。谷歌表示,该模型在多个基准测试中均优于现有方法,为AI视频生成领域树立了新的标杆。

尽管Lumiere展示了巨大的潜力,但谷歌也强调了负责任AI的重要性,并指出该模型目前仍处于研究阶段,尚未向公众开放。未来,团队计划进一步优化模型性能,并探索其在电影制作、虚拟现实等领域的应用可能性。