Lumiere
Lumiere是谷歌研究团队开发的文本到视频扩散模型,旨在合成具有逼真、多样且连贯运动的视频。项目页面展示了文本到视频、图像到视频、风格化生成、视频风格化、动态图像以及视频修复的示例输出。
该模型采用空间-时间U-Net架构,可以在一次模型运行中生成完整的视频片段,而不是通过远距离关键帧和时间超分辨率填补空白。它利用空间和时间的下采样与上采样,基于预训练的文本到图像扩散主干网络,跨多个时空尺度产生全帧率视频。
该网站是一个科研演示和论文配套,而非面向消费者的应用程序。它面向研究人员、工程师和创作者,帮助他们研究最先进的视频扩散技术,并探索模型在生成和编辑任务中的能力。
将文本提示转换为完整动态片段,演示页面提供数十个示例输出
将静态图像与简短文本描述结合,生成动态视频
风格化生成通过微调的文本到图像权重复制参考图像的风格
视频风格化逐帧应用基于文本的图像编辑方法,确保画面风格一致
动态照片模式仅对蒙版区域进行动画处理,其余图像保持静止
视频修复根据文本提示填充蒙版区域或编辑服装和配饰
使用时空U-Net一次生成完整视频时长,替代关键帧拼接
一个模型支持多任务:文本到视频、图像到视频、修补和风格化
演示画廊展示了多样的提示、风格和带有可见输入的编辑示例
已发布的研究论文和作者署名使技术方法易于验证
无公开接口用于生成自定义视频;该网站仅作为研究展示
模型输出以低分辨率显示,符合论文中全帧率、低分辨率的设计
没有定价信息、支持渠道或针对希望投入生产的团队的产品路线图
谁开发了Lumiere?
Lumiere由Google Research的研究人员开发,合作机构包括魏茨曼研究所、特拉维夫大学和以色列理工学院。项目页面列出了完整的作者团队,并将Google Research列为主要机构。
Lumiere是否作为公开应用或API提供?
否。Lumiere作为Google Research的一个项目展示,包含演示图库和论文链接。网站不提供注册、下载或用于生成您自己视频的API。
Lumiere使用什么架构?
Lumiere采用Space-Time U-Net架构,可以一次性生成视频的完整时间长度。它执行空间和时间上的降采样及升采样,依赖预训练的文本到图像扩散模型作为主干网络。
Lumiere可以将图像转换成视频吗?
可以。Lumiere支持图像到视频的生成。演示页面展示了静态图像配合文本提示,生成动画短片段。
Lumiere支持视频修补和编辑吗?
支持。Lumiere展示了视频修补功能,可以填充视频中被遮挡的区域,以及基于文本的编辑,如改变视频序列中的服装、配饰或姿势。
我可以在哪里阅读Lumiere的研究论文?
Lumiere论文已发布在arXiv,链接为https://arxiv.org/abs/2401.12945。项目主页的“Read Paper”处直接链接该论文。

