Os embeddings son representacións numéricas que capturan o significado dun dato (unha palabra, unha frase, un documento ou unha imaxe) en forma dun vector de centos ou miles de dimensións. A clave é que estes vectores se constrúen de xeito que elementos con significados parecidos quedan próximos no espazo vectorial, mentres que os moi distintos quedan afastados. Así, o modelo non traballa con texto en bruto, senón con coordenadas que codifican relacións semánticas.
A súa importancia reside en que permiten que os ordenadores comparen significados de forma matemática, medindo, por exemplo, a distancia ou o coseno entre dous vectores. Isto habilita tarefas como:
- Busca semántica: atopar resultados por sentido, non por palabras exactas.
- Sistemas de recomendación e agrupación (clustering) de contidos similares.
- RAG, onde se recuperan fragmentos relevantes para alimentar un modelo de linguaxe.
Un matiz práctico: un mesmo termo pode ter embeddings distintos segundo o modelo que os xere, polo que convén usar sempre o mesmo modelo para indexar e consultar, garantindo que os vectores sexan comparables entre si.