NAiOS IconNAiOS Logo
NAiOS Wiki

Multimodal

También: IA multimodal · models multimodals · multimodalitat

Models que entenen i generen text, imatge, àudio i vídeo

1 min de lectura

Un sistema multimodal és aquell capaç de processar i combinar informació procedent de diferents tipus de dades —o modalitats— com ara text, imatges, àudio o vídeo. A diferència dels models tradicionals, que es limitaven a una sola entrada (per exemple, només text), aquests models integren diverses fonts en una representació comuna, la qual cosa els permet raonar sobre elles de forma conjunta.

La seva importància rau en el fet que el món real no és unimodal: entenem una escena combinant el que veiem, sentim i llegim. Aquesta capacitat apropa la IA a una comprensió més rica i contextual, i habilita tasques que abans requerien diversos sistemes separats. Alguns exemples pràctics:

  • Descriure el contingut d'una fotografia amb text.
  • Respondre preguntes sobre un gràfic o un document escanejat.
  • Generar imatges a partir d'una descripció escrita.

Un matís rellevant és que «multimodal» no implica dominar totes les modalitats per igual. Molts models destaquen en la combinació text-imatge, mentre que l'àudio o el vídeo continuen sent més limitats o s'incorporen de forma parcial.

¿Quieres profundizar?

Lee nuestros artículos sobre IA aplicada en el blog de NAiOS.

Ir al Blog