Lumiere
Lumiere é um modelo de difusão de texto para vídeo do Google Research, desenvolvido para synthesizar vídeos com movimentos realistas, diversos e coerentes. A página do projeto apresenta amostras de resultados para texto-para-vídeo, imagem-para-vídeo, geração estilizada, estilização de vídeo, cinemagraphs e inpainting de vídeos.
Sua arquitetura Space-Time U-Net gera um clipe de vídeo completo em uma única passada do modelo, ao contrário de criar keyframes distantes e preencher lacunas com super-resolução temporal. O modelo utiliza down-sampling e up-sampling espacial e temporal e se apoia em uma backbone de difusão de texto para imagem pré-treinada para produzir vídeos em plena taxa de quadros em múltiplas escalas espaço-temporais.
O site é uma demonstração de pesquisa e companheiro de artigo, não sendo um aplicativo para consumidores. Destina-se a pesquisadores, engenheiros e criadores que desejam estudar os mais avançados métodos de difusão de vídeo e ver o que o modelo pode fazer em tarefas de geração e edição.
Transforma prompts de texto em clipes de movimento completos com dezenas de exemplos na página de demonstração
Anima uma imagem estática em vídeo quando combinada com uma descrição curta em texto
Geração estilizada copia o estilo de uma imagem de referência usando pesos de texto-para-imagem ajustados
Estilização de vídeo aplica métodos de edição de imagem baseados em texto, quadro a quadro, para aparência consistente
Modo cinemagraph anima apenas uma região mascarada enquanto o resto da imagem permanece estático
Inpainting de vídeo preenche áreas mascaradas ou edita roupas e acessórios a partir de prompts de texto
Gera a duração total do vídeo em uma única passagem com um Space-Time U-Net em vez de costura de keyframes
Abrange várias tarefas em um único modelo: texto para vídeo, imagem para vídeo, inpainting e estilização
A galeria de demonstração mostra uma ampla variedade de prompts, estilos e exemplos de edição com entradas visíveis
Artigo de pesquisa publicado e créditos dos autores facilitam a verificação da abordagem técnica
Nenhuma interface pública para gerar vídeos personalizados; o site é apenas uma vitrine de pesquisa
Saídas do modelo exibidas em baixa resolução conforme o design do artigo, com taxa de quadros completa e baixa resolução
Sem preços, canal de suporte ou roteiro de produto para equipes que desejam implantá-lo em produção
Quem desenvolveu o Lumiere?
O Lumiere foi desenvolvido por pesquisadores do Google Research, com colaboradores do Instituto Weizmann, da Universidade de Tel-Aviv e do Technion. A página do projeto lista toda a equipe de autores e credita o Google Research como a instituição principal.
O Lumiere está disponível como um aplicativo público ou API?
Não. O Lumiere é apresentado como um projeto do Google Research com uma galeria de demonstrações e link para o artigo. O site não oferece cadastro, downloads ou uma API para gerar seus próprios vídeos.
Qual arquitetura o Lumiere utiliza?
O Lumiere utiliza uma Space-Time U-Net que gera toda a duração temporal de um vídeo em uma única passagem. Aplica down-sampling e up-sampling espaciais e temporais e depende de um modelo de difusão pré-treinado de texto para imagem como sua espinha dorsal.
O Lumiere pode transformar uma imagem em vídeo?
Sim. O Lumiere suporta geração de vídeo a partir de imagem. A página de demonstração mostra imagens estáticas combinadas com prompts de texto que são animadas em pequenos clipes de vídeo.
O Lumiere suporta inpainting e edição de vídeo?
Sim. O Lumiere demonstra inpainting de vídeo que preenche regiões mascaradas em filmagens e edições guiadas por texto, como mudar roupas, acessórios ou poses dentro de uma sequência de vídeo.
Onde posso ler o artigo de pesquisa do Lumiere?
O artigo do Lumiere está publicado no arXiv em https://arxiv.org/abs/2401.12945. A página inicial do projeto linka diretamente para esse artigo em 'Read Paper'.

