Phenaki

Phenaki

Phenaki es un modelo de texto a video de Google Research que genera clips de dominio abierto a partir de secuencias de indicaciones, de modo que la historia puede cambiar a medida que llega nuevo texto con el tiempo. Su codificador C-ViViT comprime el metraje en tokens discretos con atención temporal causal, lo que permite al sistema manejar longitudes variables de clips en lugar de ráfagas fijas de dos segundos. Un transformador enmascarado convierte tokens de texto en tokens de video, luego el decodificador reconstruye los píxeles para demostraciones que duran más de dos minutos cuando las indicaciones están encadenadas.

Los generadores de video para consumidores suelen pedir una indicación por clip. El artículo y el sitio de demostración de Phenaki se centran en cadenas de indicaciones que varían en el tiempo, continuación condicionada por imagen a partir de un primer cuadro y entrenamiento conjunto en pares imagen-texto además de conjuntos más pequeños de video-texto para ir más allá de los conjuntos de datos limitados de video. Se pueden explorar historias de ejemplo en la página del proyecto en lugar de registrarse para un editor alojado.

Investigadores, ingenieros de ML y tecnólogos creativos estudian Phenaki para la síntesis narrativa de larga duración y el diseño de tokenizadores. El sitio phenaki.github.io aloja ejemplos interactivos de astronautas, continuaciones de imagen más indicación y muestras publicadas de historias de dos a dos minutos y medio con listas de indicaciones documentadas junto a cada clip.

Funciones principales:
  1. Genera videos a partir de secuencias de indicaciones de texto que pueden cambiar con el tiempo dentro de una misma historia

  2. Los clips de demostración publicados incluyen una historia de motocicleta de 2:28 minutos y una narrativa futurista de 2 minutos

  3. El tokenizador C-ViViT comprime video con atención causal en el tiempo para generación de longitud variable

  4. El sitio interactivo permite combinar palabras de contexto para renderizar videos de astronautas a partir de ejemplos entrenados

  5. Soporta generación condicionada por imagen donde el primer cuadro más una indicación impulsan el siguiente movimiento

  6. El entrenamiento conjunto en pares de imagen-texto y ejemplos de video-texto mejora la generalización en dominio abierto

  7. El documento de investigación enlazado en OpenReview documenta la pipeline de transformadores MaskGIT de texto a video

Pros:
  1. Soporta secuencias de indicaciones que evolucionan a mitad del video, lo cual la mayoría de generadores de una sola indicación no demuestran.

  2. Las muestras publicadas incluyen historias coherentes de varios minutos con cadenas de indicaciones documentadas.

  3. El modo condicionado por imagen permite que un cuadro fijo sirva de semilla para el siguiente movimiento generado.

  4. Sitio de investigación gratuito con ejemplos interactivos y referencias a artículos.

Cons:
  1. No hay API pública ni flujo de registro para generar videos personalizados con tus propias indicaciones.

  2. El dominio phenaki.video almacenado está muerto; la demostración en vivo sigue en phenaki.github.io.

  3. Las muestras reflejan la calidad de la era de investigación y pueden quedar atrás respecto a los últimos modelos comerciales de video.

Preguntas frecuentes:

¿Phenaki es gratis para usar?

Sí. El sitio del proyecto Phenaki en phenaki.github.io es una demostración gratuita de Google Research que publica videos de muestra y ejemplos interactivos. No hay registro, pago ni API de generación alojada para usuarios públicos en la página.

¿Qué genera Phenaki?

Phenaki genera videos de dominio abierto a partir de texto, incluyendo historias construidas con múltiples indicaciones que cambian con el tiempo. El modelo se enfoca en movimiento realista en lugar de generadores de clips con indicación única y duraciones fijas.

¿Cuánto pueden durar los videos de Phenaki?

Las historias de demostración de Phenaki en el sitio del proyecto alcanzan aproximadamente entre dos y dos minutos y medio cuando se alimenta al modelo una secuencia larga de indicaciones y un paso opcional de superresolución, como las narrativas publicadas de motocicletas y ciudades.

¿Phenaki puede usar múltiples indicaciones de texto?

Sí. Phenaki está diseñado para indicaciones que varían en el tiempo, lo que significa que puedes proporcionar una secuencia de oraciones y el modelo continúa el video a medida que llega cada nueva línea, que es cómo se construyen las historias de muestra de varios minutos.

¿Phenaki es una aplicación pública de video?

No. Phenaki es una demostración de investigación con ejemplos prerenderizados e interactivos en phenaki.github.io, no un SaaS de consumo donde los visitantes suben indicaciones y reciben renders nuevos bajo demanda.

¿Quién desarrolló Phenaki?

Phenaki fue desarrollado por autores de Google Research incluyendo a Ruben Villegas y colegas, con el artículo titulado Variable Length Video Generation From Open Domain Textual Description publicado en OpenReview.

Categoría:

Tarificación:

Gratis

Etiquetas:

Text to Video
Story Generation
Long Form Video
Research Demo
Prompt Chains
Open Domain Video
Content Generation
SEO Optimization

Tecnología utilizada:

Bootstrap
jQuery
Google Analytics
Google Tag Manager
Tailwind CSS

Reseñas:

Give your opinion on Phenaki :-

Overall rating

Join thousands of AI enthusiasts in the World of AI!

Mejor Gratis Phenaki Alternativas (y Pagadas)

By Rishit