Ein multimodales System ist in der Lage, Informationen aus verschiedenen Datentypen – oder Modalitäten – wie Text, Bildern, Audio oder Video zu verarbeiten und zu kombinieren. Im Gegensatz zu traditionellen Modellen, die auf eine einzige Eingabe beschränkt waren (zum Beispiel nur Text), integrieren diese Modelle verschiedene Quellen in eine gemeinsame Repräsentation, was es ihnen ermöglicht, diese gemeinsam zu analysieren.
Ihre Bedeutung liegt darin, dass die reale Welt nicht unimodal ist: Wir verstehen eine Szene, indem wir das kombinieren, was wir sehen, hören und lesen. Diese Fähigkeit bringt die KI einem reichhaltigeren und kontextbezogeneren Verständnis näher und ermöglicht Aufgaben, die zuvor mehrere separate Systeme erforderten. Einige praktische Beispiele:
- Den Inhalt einer Fotografie mit Text beschreiben.
- Fragen zu einer Grafik oder einem gescannten Dokument beantworten.
- Bilder aus einer schriftlichen Beschreibung generieren.
Eine relevante Nuance ist, dass „multimodal“ nicht bedeutet, alle Modalitäten gleichermaßen zu beherrschen. Viele Modelle zeichnen sich durch die Kombination von Text und Bild aus, während Audio oder Video weiterhin eingeschränkter sind oder nur teilweise integriert werden.