
Última actualización 07-30-2026
Categoría:
Reviews:
Join thousands of AI enthusiasts in the World of AI!
Phenaki
Phenaki es un modelo de texto a video de Google Research que genera clips de dominio abierto a partir de secuencias de indicaciones, de modo que la historia puede cambiar a medida que llega nuevo texto con el tiempo. Su codificador C-ViViT comprime el metraje en tokens discretos con atención temporal causal, lo que permite al sistema manejar longitudes variables de clips en lugar de ráfagas fijas de dos segundos. Un transformador enmascarado convierte tokens de texto en tokens de video, luego el decodificador reconstruye los píxeles para demostraciones que duran más de dos minutos cuando las indicaciones están encadenadas.
Los generadores de video para consumidores suelen pedir una indicación por clip. El artículo y el sitio de demostración de Phenaki se centran en cadenas de indicaciones que varían en el tiempo, continuación condicionada por imagen a partir de un primer cuadro y entrenamiento conjunto en pares imagen-texto además de conjuntos más pequeños de video-texto para ir más allá de los conjuntos de datos limitados de video. Se pueden explorar historias de ejemplo en la página del proyecto en lugar de registrarse para un editor alojado.
Investigadores, ingenieros de ML y tecnólogos creativos estudian Phenaki para la síntesis narrativa de larga duración y el diseño de tokenizadores. El sitio phenaki.github.io aloja ejemplos interactivos de astronautas, continuaciones de imagen más indicación y muestras publicadas de historias de dos a dos minutos y medio con listas de indicaciones documentadas junto a cada clip.
Genera videos a partir de secuencias de indicaciones de texto que pueden cambiar con el tiempo dentro de una misma historia
Los clips de demostración publicados incluyen una historia de motocicleta de 2:28 minutos y una narrativa futurista de 2 minutos
El tokenizador C-ViViT comprime video con atención causal en el tiempo para generación de longitud variable
El sitio interactivo permite combinar palabras de contexto para renderizar videos de astronautas a partir de ejemplos entrenados
Soporta generación condicionada por imagen donde el primer cuadro más una indicación impulsan el siguiente movimiento
El entrenamiento conjunto en pares de imagen-texto y ejemplos de video-texto mejora la generalización en dominio abierto
El documento de investigación enlazado en OpenReview documenta la pipeline de transformadores MaskGIT de texto a video
Soporta secuencias de indicaciones que evolucionan a mitad del video, lo cual la mayoría de generadores de una sola indicación no demuestran.
Las muestras publicadas incluyen historias coherentes de varios minutos con cadenas de indicaciones documentadas.
El modo condicionado por imagen permite que un cuadro fijo sirva de semilla para el siguiente movimiento generado.
Sitio de investigación gratuito con ejemplos interactivos y referencias a artículos.
No hay API pública ni flujo de registro para generar videos personalizados con tus propias indicaciones.
El dominio phenaki.video almacenado está muerto; la demostración en vivo sigue en phenaki.github.io.
Las muestras reflejan la calidad de la era de investigación y pueden quedar atrás respecto a los últimos modelos comerciales de video.
¿Phenaki es gratis para usar?
Sí. El sitio del proyecto Phenaki en phenaki.github.io es una demostración gratuita de Google Research que publica videos de muestra y ejemplos interactivos. No hay registro, pago ni API de generación alojada para usuarios públicos en la página.
¿Qué genera Phenaki?
Phenaki genera videos de dominio abierto a partir de texto, incluyendo historias construidas con múltiples indicaciones que cambian con el tiempo. El modelo se enfoca en movimiento realista en lugar de generadores de clips con indicación única y duraciones fijas.
¿Cuánto pueden durar los videos de Phenaki?
Las historias de demostración de Phenaki en el sitio del proyecto alcanzan aproximadamente entre dos y dos minutos y medio cuando se alimenta al modelo una secuencia larga de indicaciones y un paso opcional de superresolución, como las narrativas publicadas de motocicletas y ciudades.
¿Phenaki puede usar múltiples indicaciones de texto?
Sí. Phenaki está diseñado para indicaciones que varían en el tiempo, lo que significa que puedes proporcionar una secuencia de oraciones y el modelo continúa el video a medida que llega cada nueva línea, que es cómo se construyen las historias de muestra de varios minutos.
¿Phenaki es una aplicación pública de video?
No. Phenaki es una demostración de investigación con ejemplos prerenderizados e interactivos en phenaki.github.io, no un SaaS de consumo donde los visitantes suben indicaciones y reciben renders nuevos bajo demanda.
¿Quién desarrolló Phenaki?
Phenaki fue desarrollado por autores de Google Research incluyendo a Ruben Villegas y colegas, con el artículo titulado Variable Length Video Generation From Open Domain Textual Description publicado en OpenReview.
