A xeración text-to-video consiste en producir secuencias de vídeo a partir dunha descrición textual, coñecida como prompt. O sistema interpreta o texto e sintetiza fotogramas coherentes entre si, xerando movemento, transicións e consistencia temporal sen necesidade de filmar nin animar manualmente. Apóiase en modelos xerativos avanzados, habitualmente de difusión combinados con arquitecturas de tipo transformer, adestrados con grandes volumes de vídeo e as súas descricións asociadas.
A súa importancia radica en que reduce drasticamente o custo e o tempo de produción audiovisual, abrindo a creación de vídeo a persoas sen coñecementos técnicos de edición ou animación. Resulta útil para prototipado de ideas, contido publicitario, prototipos de animación, material educativo e efectos visuais.
Convén ter presentes algunhas limitacións prácticas:
- Duración: moitos modelos xeran clips curtos, de poucos segundos.
- Coherencia: poden aparecer artefactos ou inconsistencias entre fotogramas.
- Control: axustar detalles concretos do movemento ou da escena segue sendo difícil.
Exemplos destacados son Sora de OpenAI, Veo de Google e Runway Gen-3.