Um sistema multimodal é aquele capaz de processar e combinar informação proveniente de diferentes tipos de dados — ou modalidades — como texto, imagens, áudio ou vídeo. Ao contrário dos modelos tradicionais, que se limitavam a uma única entrada (por exemplo, apenas texto), estes modelos integram várias fontes numa representação comum, o que lhes permite raciocinar sobre elas de forma conjunta.
A sua importância reside no facto de o mundo real não ser unimodal: compreendemos uma cena combinando o que vemos, ouvimos e lemos. Esta capacidade aproxima a IA de uma compreensão mais rica e contextual, e permite tarefas que anteriormente exigiam vários sistemas separados. Alguns exemplos práticos:
- Descrever o conteúdo de uma fotografia com texto.
- Responder a perguntas sobre um gráfico ou um documento digitalizado.
- Gerar imagens a partir de uma descrição escrita.
Uma nuance relevante é que «multimodal» não implica dominar todas as modalidades por igual. Muitos modelos destacam-se na combinação texto-imagem, enquanto o áudio ou o vídeo continuam a ser mais limitados ou são incorporados de forma parcial.