Lumiere

Lumiere

Lumiere是谷歌研究团队开发的文本到视频扩散模型,旨在合成具有逼真、多样且连贯运动的视频。项目页面展示了文本到视频、图像到视频、风格化生成、视频风格化、动态图像以及视频修复的示例输出。

该模型采用空间-时间U-Net架构,可以在一次模型运行中生成完整的视频片段,而不是通过远距离关键帧和时间超分辨率填补空白。它利用空间和时间的下采样与上采样,基于预训练的文本到图像扩散主干网络,跨多个时空尺度产生全帧率视频。

该网站是一个科研演示和论文配套,而非面向消费者的应用程序。它面向研究人员、工程师和创作者,帮助他们研究最先进的视频扩散技术,并探索模型在生成和编辑任务中的能力。

主要功能:
  1. 将文本提示转换为完整动态片段,演示页面提供数十个示例输出

  2. 将静态图像与简短文本描述结合,生成动态视频

  3. 风格化生成通过微调的文本到图像权重复制参考图像的风格

  4. 视频风格化逐帧应用基于文本的图像编辑方法,确保画面风格一致

  5. 动态照片模式仅对蒙版区域进行动画处理,其余图像保持静止

  6. 视频修复根据文本提示填充蒙版区域或编辑服装和配饰

Pros:
  1. 使用时空U-Net一次生成完整视频时长,替代关键帧拼接

  2. 一个模型支持多任务:文本到视频、图像到视频、修补和风格化

  3. 演示画廊展示了多样的提示、风格和带有可见输入的编辑示例

  4. 已发布的研究论文和作者署名使技术方法易于验证

Cons:
  1. 无公开接口用于生成自定义视频;该网站仅作为研究展示

  2. 模型输出以低分辨率显示,符合论文中全帧率、低分辨率的设计

  3. 没有定价信息、支持渠道或针对希望投入生产的团队的产品路线图

常见问题:

谁开发了Lumiere?

Lumiere由Google Research的研究人员开发,合作机构包括魏茨曼研究所、特拉维夫大学和以色列理工学院。项目页面列出了完整的作者团队,并将Google Research列为主要机构。

Lumiere是否作为公开应用或API提供?

否。Lumiere作为Google Research的一个项目展示,包含演示图库和论文链接。网站不提供注册、下载或用于生成您自己视频的API。

Lumiere使用什么架构?

Lumiere采用Space-Time U-Net架构,可以一次性生成视频的完整时间长度。它执行空间和时间上的降采样及升采样,依赖预训练的文本到图像扩散模型作为主干网络。

Lumiere可以将图像转换成视频吗?

可以。Lumiere支持图像到视频的生成。演示页面展示了静态图像配合文本提示,生成动画短片段。

Lumiere支持视频修补和编辑吗?

支持。Lumiere展示了视频修补功能,可以填充视频中被遮挡的区域,以及基于文本的编辑,如改变视频序列中的服装、配饰或姿势。

我可以在哪里阅读Lumiere的研究论文?

Lumiere论文已发布在arXiv,链接为https://arxiv.org/abs/2401.12945。项目主页的“Read Paper”处直接链接该论文。

定价:

免费

标签:

Google Research
Space-Time Diffusion
Video Generation
Lumiere
Text-to-Video
Cinemagraph
Image-to-Video
Video Inpainting
Diffusion Model

使用的技术:

Ant Design
jQuery
Webflow
Amazon CloudFront
Google Cloud
Google Analytics
Google Tag Manager
Google Fonts
Font Awesome
Ruby
YouTube
GitHub

评论:

Give your opinion on Lumiere :-

Overall rating

Join thousands of AI enthusiasts in the World of AI!

最佳免费 Lumiere 替代方案(和付费)

By Rishit