NAiOS Wiki

Multimodal

También: IA multimodal · modelos multimodais · multimodalidade

Modelos que entienden y generan texto, imagen, audio y vídeo

1 min de lectura

Un sistema multimodal é aquel capaz de procesar e combinar información procedente de distintos tipos de datos —ou modalidades— como texto, imaxes, audio ou vídeo. A diferenza dos modelos tradicionais, que se limitaban a unha soa entrada (por exemplo, só texto), estes modelos integran varias fontes nunha representación común, o que lles permite razoar sobre elas de forma conxunta.

A súa importancia radica en que o mundo real non é unimodal: entendemos unha escena combinando o que vemos, oímos e lemos. Esta capacidade achega a IA a unha comprensión máis rica e contextual, e habilita tarefas que antes requirían varios sistemas separados. Algúns exemplos prácticos:

  • Describir o contido dunha fotografía con texto.
  • Responder preguntas sobre un gráfico ou un documento escaneado.
  • Xerar imaxes a partir dunha descrición escrita.

Un matiz relevante é que «multimodal» non implica dominar todas as modalidades por igual. Moitos modelos destacan na combinación texto-imaxe, mentres que o audio ou o vídeo seguen sendo máis limitados ou incorpóranse de forma parcial.

¿Quieres profundizar?

Lee nuestros artículos sobre IA aplicada en el blog de NAiOS.

Ir al Blog