
Última atualização 08-14-2026
Categoria:
Classificação Geral:
5.0 🏆
Reviews:
Join thousands of AI enthusiasts in the World of AI!
Text-To-4D
Text-To-4D é um projeto de pesquisa da Meta AI (MAV3D) que gera cenas dinâmicas tridimensionais a partir de descrições em texto. O método utiliza um Neural Radiance Field dinâmico 4D otimizado para consistência de aparência, densidade e movimento, consultando um modelo de difusão texto-para-vídeo.
Diferente dos geradores 3D estáticos que produzem uma única malha, o Text-To-4D gera cenas que podem ser visualizadas de qualquer ângulo de câmera e compostas em outros ambientes 3D. A abordagem não requer dados de treinamento 3D ou 4D; o modelo texto-para-vídeo subjacente é treinado apenas com pares texto-imagem e vídeos não rotulados.
A página do projeto hospeda amostras de demonstração para comandos texto-para-4D como "um corgi brincando com uma bola" e conversões imagem-para-4D a partir de fotos estáticas. É uma vitrine de pesquisa, não um produto comercial com API pública ou cadastro. Pesquisadores e artistas 3D interessados em geração dinâmica de cenas baseada em NeRF podem explorar o artigo e as saídas de exemplo no site.
Gera cenas dinâmicas 3D a partir de prompts de texto via MAV3D (Make-A-Video3D)
NeRF dinâmico 4D otimizado para aparência, densidade e consistência de movimento
Visualize cenas geradas de qualquer localização e ângulo de câmera
Modo Imagem-para-4D converte fotos fixas em cenas de vídeo dinâmicas
Treinado apenas com pares de texto-imagem e vídeos não rotulados, sem necessidade de dados 3D/4D
Artigo de pesquisa publicado no arXiv (2301.11280) com amostras de demonstração interativas
Abordagem pioneira para gerar cenas dinâmicas 3D completas a partir de texto
Sem necessidade de dados de treinamento 3D ou 4D para o modelo subjacente
Visualização do output de qualquer ângulo de câmera e compatível com ambientes 3D
Demonstração de pesquisa gratuita com amostras interativas
Demonstração de pesquisa apenas, sem API ou ferramenta pública de geração
Artigo publicado em 2023 sem indicação de desenvolvimento comercial contínuo
Site simples com apenas amostras de demonstração, sem documentação ou suporte ao usuário
Necessita de conhecimento técnico para reproduzir resultados do artigo
O que é Text-To-4D?
Text-To-4D é um método de pesquisa da Meta AI chamado MAV3D que gera cenas dinâmicas tridimensionais a partir de descrições em texto. Text-To-4D usa um Neural Radiance Field dinâmico 4D otimizado por um modelo de difusão texto-para-vídeo, e a página de demonstração mostra exemplos que você pode explorar.
O Text-To-4D é gratuito?
Text-To-4D é uma demonstração de pesquisa gratuita hospedada no GitHub Pages, sem necessidade de cadastro ou pagamento. Não há API pública nem produto comercial; você pode ver gerações de exemplo e ler o artigo, mas não pode gerar suas próprias cenas pelo site.
Como o Text-To-4D funciona?
Text-To-4D constrói um NeRF dinâmico 4D que consulta um modelo de difusão texto-para-vídeo para aparência, densidade e movimento da cena. O resultado é um vídeo dinâmico visualizável de qualquer ângulo de câmera e que pode ser integrado em ambientes 3D. Text-To-4D também suporta imagem-para-4D a partir de uma única foto.
Quem criou o Text-To-4D?
Text-To-4D foi desenvolvido por pesquisadores da Meta AI, incluindo Uriel Singer, Shelly Sheynin, Adam Polyak e outros. O trabalho foi publicado no arXiv em 2023 como "Text-To-4D Dynamic Scene Generation" (arXiv:2301.11280).
Posso gerar minhas próprias cenas com o Text-To-4D?
A página de demonstração do Text-To-4D mostra amostras pré-geradas como "um panda dançando" e "um ônibus espacial lançando", mas não oferece uma interface pública para geração. Text-To-4D é uma vitrine de pesquisa; implementar o método requer seguir o artigo publicado.
Qual a diferença entre Text-To-4D e Make-A-Video?
Make-A-Video gera vídeos 2D a partir de texto, enquanto Text-To-4D (MAV3D) estende isso para cenas dinâmicas 3D completas visualizáveis de qualquer ângulo. Text-To-4D adiciona uma camada NeRF 4D para que o resultado possa ser integrado em ambientes 3D, não apenas assistido como vídeo plano.
