NAiOS IconNAiOS Logo
NAiOS Wiki

Multimodal

También: IA multimodale · modèles multimodaux · multimodalité

Modèles qui comprennent et génèrent du texte, des images, de l'audio et de la vidéo

1 min de lectura

Un système multimodal est capable de traiter et de combiner des informations provenant de différents types de données — ou modalités — telles que le texte, les images, l'audio ou la vidéo. Contrairement aux modèles traditionnels, qui se limitaient à une seule entrée (par exemple, uniquement du texte), ces modèles intègrent plusieurs sources dans une représentation commune, ce qui leur permet de raisonner sur celles-ci de manière conjointe.

Leur importance réside dans le fait que le monde réel n'est pas unimodal : nous comprenons une scène en combinant ce que nous voyons, entendons et lisons. Cette capacité rapproche l'IA d'une compréhension plus riche et contextuelle, et permet des tâches qui nécessitaient auparavant plusieurs systèmes distincts. Quelques exemples pratiques :

  • Décrire le contenu d'une photographie avec du texte.
  • Répondre à des questions sur un graphique ou un document numérisé.
  • Générer des images à partir d'une description écrite.

Une nuance importante est que le terme « multimodal » n'implique pas de maîtriser toutes les modalités de la même manière. De nombreux modèles excellent dans la combinaison texte-image, tandis que l'audio ou la vidéo restent plus limités ou sont intégrés de manière partielle.

¿Quieres profundizar?

Lee nuestros artículos sobre IA aplicada en el blog de NAiOS.

Ir al Blog