Embeddings sind numerische Repräsentationen, die die Bedeutung eines Datums (eines Wortes, eines Satzes, eines Dokuments oder eines Bildes) in Form eines Vektors mit Hunderten oder Tausenden von Dimensionen erfassen. Der entscheidende Punkt ist, dass diese Vektoren so konstruiert werden, dass Elemente mit ähnlicher Bedeutung im Vektorraum nah beieinander liegen, während sich stark voneinander abweichende Elemente in großer Entfernung befinden. So arbeitet das Modell nicht mit Rohtext, sondern mit Koordinaten, die semantische Beziehungen kodieren.
Ihre Bedeutung liegt darin, dass sie es Computern ermöglichen, Bedeutungen mathematisch zu vergleichen, indem sie beispielsweise den Abstand oder den Kosinus zwischen zwei Vektoren messen. Dies ermöglicht Aufgaben wie:
- Semantische Suche: Ergebnisse nach Sinngehalt finden, nicht nach exakten Wörtern.
- Empfehlungssysteme und Gruppierung (Clustering) ähnlicher Inhalte.
- RAG, wobei relevante Fragmente abgerufen werden, um ein Sprachmodell zu speisen.
Ein praktischer Hinweis: Derselbe Begriff kann je nach erzeugendem Modell unterschiedliche Embeddings aufweisen. Daher empfiehlt es sich, stets dasselbe Modell für die Indexierung und Abfrage zu verwenden, um sicherzustellen, dass die Vektoren untereinander vergleichbar sind.