La génération text-to-video consiste à produire des séquences vidéo à partir d'une description textuelle, appelée prompt. Le système interprète le texte et synthétise des images cohérentes entre elles, générant du mouvement, des transitions et une cohérence temporelle sans qu'il soit nécessaire de filmer ou d'animer manuellement. Elle s'appuie sur des modèles génératifs avancés, généralement de diffusion combinés à des architectures de type transformer, entraînés sur de grands volumes de vidéos et leurs descriptions associées.
Son importance réside dans le fait qu'elle réduit considérablement les coûts et les temps de production audiovisuelle, ouvrant la création vidéo aux personnes sans connaissances techniques en montage ou en animation. Elle s'avère utile pour le prototypage d'idées, le contenu publicitaire, les prototypes d'animation, le matériel pédagogique et les effets visuels.
Il convient de garder à l'esprit certaines limites pratiques :
- Durée : de nombreux modèles génèrent des clips courts, de quelques secondes seulement.
- Cohérence : des artefacts ou des incohérences peuvent apparaître entre les images.
- Contrôle : l'ajustement de détails concrets du mouvement ou de la scène reste difficile.
Des exemples notables sont Sora d'OpenAI, Veo de Google et Runway Gen-3.