NAiOS IconNAiOS Logo
NAiOS Wiki

Text a vídeo

También: Text a vídeo · T2V · generació de vídeo · text2video

Generar vídeo a partir d'una descripció de text

1 min de lectura

La generació text-to-video consisteix a produir seqüències de vídeo a partir d'una descripció textual, coneguda com a prompt. El sistema interpreta el text i sintetitza fotogrames coherents entre si, generant moviment, transicions i consistència temporal sense necessitat de filmar ni animar manualment. Es basa en models generatius avançats, habitualment de difusió combinats amb arquitectures de tipus transformer, entrenats amb grans volums de vídeo i les seves descripcions associades.

La seva importància rau en el fet que redueix dràsticament el cost i el temps de producció audiovisual, obrint la creació de vídeo a persones sense coneixements tècnics d'edició o animació. Resulta útil per al prototipatge d'idees, contingut publicitari, prototips d'animació, material educatiu i efectes visuals.

Convé tenir presents algunes limitacions pràctiques:

  • Durada: molts models generen clips curts, de pocs segons.
  • Coherència: poden aparèixer artefactes o inconsistències entre fotogrames.
  • Control: ajustar detalls concrets del moviment o l'escena continua sent difícil.

Exemples destacats són Sora d'OpenAI, Veo de Google i Runway Gen-3.

¿Quieres profundizar?

Lee nuestros artículos sobre IA aplicada en el blog de NAiOS.

Ir al Blog