
Última actualización 08-14-2026
Categoría:
Calificación general:
5.0 🏆
Reviews:
Join thousands of AI enthusiasts in the World of AI!
Text-To-4D
Text-To-4D es un proyecto de investigación de Meta AI (MAV3D) que genera escenas dinámicas tridimensionales a partir de descripciones de texto. El método utiliza un Campo Neural de Radiancia dinámico 4D optimizado para la apariencia, densidad y consistencia del movimiento mediante la consulta a un modelo de difusión de texto a video.
A diferencia de los generadores 3D estáticos que producen una sola malla, Text-To-4D crea escenas que se pueden ver desde cualquier ángulo de cámara y componer en otros entornos 3D. El enfoque no requiere datos de entrenamiento 3D o 4D; el modelo subyacente de texto a video se entrena solo con pares de texto-imagen y videos sin etiquetar.
La página del proyecto aloja muestras de demostración para indicaciones de texto a 4D como "un corgi jugando con una pelota" y conversiones de imagen a 4D a partir de fotos fijas. Es una muestra de investigación, no un producto comercial con API pública o registro. Investigadores y artistas 3D interesados en la generación de escenas dinámicas basadas en NeRF pueden explorar el artículo y las muestras en el sitio.
Genera escenas dinámicas 3D a partir de indicaciones de texto mediante MAV3D (Make-A-Video3D)
NeRF dinámico 4D optimizado para apariencia, densidad y coherencia de movimiento
Visualiza escenas generadas desde cualquier ubicación y ángulo de cámara
Modo Imagen-a-4D convierte fotos fijas en escenas de video dinámico
Entrenado solo con pares de texto-imagen y videos sin etiquetar, no se requiere datos 3D/4D
Artículo de investigación publicado en arXiv (2301.11280) con muestras de demostración interactiva
Enfoque pionero para generar escenas dinámicas completas en 3D solo a partir de texto
No se requieren datos de entrenamiento 3D o 4D para el modelo subyacente
Salida visible desde cualquier ángulo de cámara y combinable en entornos 3D
Demostración de investigación gratuita con muestras interactivas
Solo demostración de investigación sin API o herramienta pública de generación
Artículo publicado en 2023 sin indicios de desarrollo comercial en curso
Sitio web escaso con solo muestras de demostración, sin documentación ni soporte para usuarios
Requiere conocimientos técnicos para reproducir resultados del artículo
¿Qué es Text-To-4D?
Text-To-4D es un método de investigación de Meta AI llamado MAV3D que genera escenas dinámicas tridimensionales a partir de descripciones de texto. Text-To-4D utiliza un campo neural de radiancia dinámico 4D optimizado por un modelo de difusión de texto a video, y la página de demostración muestra ejemplos que puedes explorar.
¿Text-To-4D es gratis?
Text-To-4D es una demostración de investigación gratuita alojada en GitHub Pages sin necesidad de registro ni pago. No hay una API pública ni un producto comercial; puedes ver ejemplos generados y leer el artículo, pero no puedes crear tus propias escenas a través del sitio.
¿Cómo funciona Text-To-4D?
Text-To-4D construye un NeRF dinámico 4D que consulta un modelo de difusión de texto a video para la apariencia, densidad y movimiento de la escena. El resultado es un video dinámico que se puede ver desde cualquier ángulo de cámara y se puede integrar en entornos 3D. Text-To-4D también soporta imagen a 4D a partir de una sola foto de entrada.
¿Quién creó Text-To-4D?
Text-To-4D fue desarrollado por investigadores de Meta AI, incluyendo a Uriel Singer, Shelly Sheynin, Adam Polyak y otros. El trabajo fue publicado en arXiv en 2023 como "Text-To-4D Dynamic Scene Generation" (arXiv:2301.11280).
¿Puedo generar mis propias escenas con Text-To-4D?
La página de demostración de Text-To-4D muestra ejemplos pre-generados como "un panda bailando" y "un transbordador espacial despegando", pero no ofrece una interfaz pública para generar. Text-To-4D es una muestra de investigación; implementar el método requiere seguir el artículo publicado.
¿Cuál es la diferencia entre Text-To-4D y Make-A-Video?
Make-A-Video genera videos 2D a partir de texto, mientras que Text-To-4D (MAV3D) extiende eso a escenas dinámicas 3D completas que se pueden ver desde cualquier ángulo. Text-To-4D añade una capa NeRF 4D para que el resultado pueda integrarse en entornos 3D, no solo verse como video plano.
