NAiOS Wiki

Texto a vídeo

También: Texto a vídeo · T2V · xeración de vídeo · text2video

Xerar vídeo a partir dunha descrición de texto

1 min de lectura

A xeración text-to-video consiste en producir secuencias de vídeo a partir dunha descrición textual, coñecida como prompt. O sistema interpreta o texto e sintetiza fotogramas coherentes entre si, xerando movemento, transicións e consistencia temporal sen necesidade de filmar nin animar manualmente. Apóiase en modelos xerativos avanzados, habitualmente de difusión combinados con arquitecturas de tipo transformer, adestrados con grandes volumes de vídeo e as súas descricións asociadas.

A súa importancia radica en que reduce drasticamente o custo e o tempo de produción audiovisual, abrindo a creación de vídeo a persoas sen coñecementos técnicos de edición ou animación. Resulta útil para prototipado de ideas, contido publicitario, prototipos de animación, material educativo e efectos visuais.

Convén ter presentes algunhas limitacións prácticas:

  • Duración: moitos modelos xeran clips curtos, de poucos segundos.
  • Coherencia: poden aparecer artefactos ou inconsistencias entre fotogramas.
  • Control: axustar detalles concretos do movemento ou da escena segue sendo difícil.

Exemplos destacados son Sora de OpenAI, Veo de Google e Runway Gen-3.

¿Quieres profundizar?

Lee nuestros artículos sobre IA aplicada en el blog de NAiOS.

Ir al Blog