NAiOS IconNAiOS Logo
NAiOS Wiki

Multimodal

También: IA multimodal · modelos multimodais · multimodalidade

Modelos que compreendem e geram texto, imagem, áudio e vídeo

1 min de lectura

Um sistema multimodal é aquele capaz de processar e combinar informação proveniente de diferentes tipos de dados — ou modalidades — como texto, imagens, áudio ou vídeo. Ao contrário dos modelos tradicionais, que se limitavam a uma única entrada (por exemplo, apenas texto), estes modelos integram várias fontes numa representação comum, o que lhes permite raciocinar sobre elas de forma conjunta.

A sua importância reside no facto de o mundo real não ser unimodal: compreendemos uma cena combinando o que vemos, ouvimos e lemos. Esta capacidade aproxima a IA de uma compreensão mais rica e contextual, e permite tarefas que anteriormente exigiam vários sistemas separados. Alguns exemplos práticos:

  • Descrever o conteúdo de uma fotografia com texto.
  • Responder a perguntas sobre um gráfico ou um documento digitalizado.
  • Gerar imagens a partir de uma descrição escrita.

Uma nuance relevante é que «multimodal» não implica dominar todas as modalidades por igual. Muitos modelos destacam-se na combinação texto-imagem, enquanto o áudio ou o vídeo continuam a ser mais limitados ou são incorporados de forma parcial.

¿Quieres profundizar?

Lee nuestros artículos sobre IA aplicada en el blog de NAiOS.

Ir al Blog