Un système multimodal est capable de traiter et de combiner des informations provenant de différents types de données — ou modalités — telles que le texte, les images, l'audio ou la vidéo. Contrairement aux modèles traditionnels, qui se limitaient à une seule entrée (par exemple, uniquement du texte), ces modèles intègrent plusieurs sources dans une représentation commune, ce qui leur permet de raisonner sur celles-ci de manière conjointe.
Leur importance réside dans le fait que le monde réel n'est pas unimodal : nous comprenons une scène en combinant ce que nous voyons, entendons et lisons. Cette capacité rapproche l'IA d'une compréhension plus riche et contextuelle, et permet des tâches qui nécessitaient auparavant plusieurs systèmes distincts. Quelques exemples pratiques :
- Décrire le contenu d'une photographie avec du texte.
- Répondre à des questions sur un graphique ou un document numérisé.
- Générer des images à partir d'une description écrite.
Une nuance importante est que le terme « multimodal » n'implique pas de maîtriser toutes les modalités de la même manière. De nombreux modèles excellent dans la combinaison texte-image, tandis que l'audio ou la vidéo restent plus limités ou sont intégrés de manière partielle.