Un sistema multimodal é aquel capaz de procesar e combinar información procedente de distintos tipos de datos —ou modalidades— como texto, imaxes, audio ou vídeo. A diferenza dos modelos tradicionais, que se limitaban a unha soa entrada (por exemplo, só texto), estes modelos integran varias fontes nunha representación común, o que lles permite razoar sobre elas de forma conxunta.
A súa importancia radica en que o mundo real non é unimodal: entendemos unha escena combinando o que vemos, oímos e lemos. Esta capacidade achega a IA a unha comprensión máis rica e contextual, e habilita tarefas que antes requirían varios sistemas separados. Algúns exemplos prácticos:
- Describir o contido dunha fotografía con texto.
- Responder preguntas sobre un gráfico ou un documento escaneado.
- Xerar imaxes a partir dunha descrición escrita.
Un matiz relevante é que «multimodal» non implica dominar todas as modalidades por igual. Moitos modelos destacan na combinación texto-imaxe, mentres que o audio ou o vídeo seguen sendo máis limitados ou incorpóranse de forma parcial.