La generació text-to-video consisteix a produir seqüències de vídeo a partir d'una descripció textual, coneguda com a prompt. El sistema interpreta el text i sintetitza fotogrames coherents entre si, generant moviment, transicions i consistència temporal sense necessitat de filmar ni animar manualment. Es basa en models generatius avançats, habitualment de difusió combinats amb arquitectures de tipus transformer, entrenats amb grans volums de vídeo i les seves descripcions associades.
La seva importància rau en el fet que redueix dràsticament el cost i el temps de producció audiovisual, obrint la creació de vídeo a persones sense coneixements tècnics d'edició o animació. Resulta útil per al prototipatge d'idees, contingut publicitari, prototips d'animació, material educatiu i efectes visuals.
Convé tenir presents algunes limitacions pràctiques:
- Durada: molts models generen clips curts, de pocs segons.
- Coherència: poden aparèixer artefactes o inconsistències entre fotogrames.
- Control: ajustar detalls concrets del moviment o l'escena continua sent difícil.
Exemples destacats són Sora d'OpenAI, Veo de Google i Runway Gen-3.