Text-To-4D

Text-To-4D

Text-To-4D est un projet de recherche de Meta AI (MAV3D) qui génère des scènes dynamiques tridimensionnelles à partir de descriptions textuelles. La méthode utilise un Neural Radiance Field dynamique en 4D optimisé pour la cohérence d'apparence, de densité et de mouvement en interrogeant un modèle de diffusion texte-vidéo.

Contrairement aux générateurs 3D statiques qui produisent un seul maillage, Text-To-4D crée des scènes que l'on peut visualiser sous n'importe quel angle de caméra et intégrer dans d'autres environnements 3D. L'approche ne nécessite pas de données d'entraînement 3D ou 4D ; le modèle texte-vidéo sous-jacent est entraîné uniquement sur des paires texte-image et des vidéos non étiquetées.

La page du projet propose des exemples de démonstration pour des invites texte-vers-4D comme « un corgi jouant avec une balle » et des conversions image-vers-4D à partir de photos fixes. Il s'agit d'une vitrine de recherche, non d'un produit commercial avec une API publique ou une inscription. Les chercheurs et artistes 3D intéressés par la génération de scènes dynamiques basées sur NeRF peuvent consulter l'article et les exemples sur le site.

Fonctionnalités principales:
  1. Génère des scènes 3D dynamiques à partir de prompts textuels via MAV3D (Make-A-Video3D)

  2. NeRF dynamique 4D optimisé pour l'apparence, la densité et la cohérence du mouvement

  3. Visualisez les scènes générées sous n'importe quelle position et angle de caméra

  4. Mode Image-vers-4D convertit des photos fixes en scènes vidéo dynamiques

  5. Entraîné uniquement sur des paires texte-image et des vidéos non étiquetées, sans données 3D/4D nécessaires

  6. Article de recherche publié sur arXiv (2301.11280) avec échantillons de démo interactifs

Pros:
  1. Approche pionnière pour générer des scènes 3D dynamiques complètes à partir de texte seul

  2. Aucune donnée d'entraînement 3D ou 4D requise pour le modèle sous-jacent

  3. Vue accessible sous n'importe quel angle de caméra et intégrable dans des environnements 3D

  4. Démo de recherche gratuite avec échantillons interactifs

Cons:
  1. Démo de recherche uniquement, sans API ou outil de génération public

  2. Article publié en 2023 sans indication de développement commercial en cours

  3. Site léger avec seulement des échantillons de démo, sans documentation ni support utilisateur

  4. Nécessite des connaissances techniques pour reproduire les résultats de l'article

FAQ:

Qu'est-ce que Text-To-4D ?

Text-To-4D est une méthode de recherche de Meta AI appelée MAV3D qui génère des scènes dynamiques tridimensionnelles à partir de descriptions textuelles. Text-To-4D utilise un Neural Radiance Field dynamique 4D optimisé par un modèle de diffusion texte-vidéo, et la page de démonstration montre des exemples que vous pouvez explorer.

Text-To-4D est-il gratuit ?

Text-To-4D est une démo de recherche gratuite hébergée sur GitHub Pages sans inscription ni paiement requis. Il n'y a pas d'API publique ni de produit commercial ; vous pouvez voir des exemples générés et lire l'article, mais vous ne pouvez pas créer vos propres scènes via le site.

Comment fonctionne Text-To-4D ?

Text-To-4D construit un NeRF dynamique 4D qui interroge un modèle de diffusion texte-vidéo pour l'apparence, la densité et le mouvement de la scène. Le résultat est une vidéo dynamique visible sous n'importe quel angle de caméra et intégrable dans des environnements 3D. Text-To-4D prend aussi en charge la conversion image vers 4D à partir d'une seule photo.

Qui a créé Text-To-4D ?

Text-To-4D a été développé par des chercheurs de Meta AI, notamment Uriel Singer, Shelly Sheynin, Adam Polyak et d'autres. Ce travail a été publié sur arXiv en 2023 sous le titre « Text-To-4D Dynamic Scene Generation » (arXiv:2301.11280).

Puis-je générer mes propres scènes avec Text-To-4D ?

La page de démonstration de Text-To-4D montre des exemples pré-générés comme « un panda qui danse » et « une navette spatiale qui décolle » mais n'offre pas d'interface publique de génération. Text-To-4D est une vitrine de recherche ; pour implémenter la méthode, il faut suivre l'article publié.

Quelle est la différence entre Text-To-4D et Make-A-Video ?

Make-A-Video génère des vidéos 2D à partir de texte, tandis que Text-To-4D (MAV3D) étend cela à des scènes dynamiques 3D complètes visibles sous tous les angles. Text-To-4D ajoute une couche NeRF 4D pour que le résultat puisse être intégré dans des environnements 3D, pas seulement regardé comme une vidéo plate.

Catégorie:

Tarification:

Gratuit

Tags:

NeRF
Dynamic Scenes
Text to Video
Meta AI Research
4D Generation
Computer Vision
AI Videos
3D

Technologie utilisée:

GitHub
Tailwind CSS

Note globale:

5.0 🏆

Commentaires:

Give your opinion on Text-To-4D :-

Overall rating

Thanks

Join thousands of AI enthusiasts in the World of AI!

Meilleur Gratuit Text-To-4D Alternatives (et Payées)

By Rishit