Die lokale Inferenz besteht darin, ein KI-Modell direkt auf Ihrer eigenen Hardware auszuführen – Computer, Server oder Mobilgerät –, anstatt Anfragen an die Cloud eines externen Anbieters zu senden. Die gesamte Berechnungsphase, von der Eingabe bis zum Erhalt einer Antwort, erfolgt auf Ihrem Gerät, ohne dass die Daten dieses verlassen.
Dies ist aus drei Hauptgründen wichtig:
- Datenschutz: Sensible Informationen verlassen niemals Ihren Rechner, was in Sektoren wie dem Gesundheitswesen oder dem Rechtswesen entscheidend ist.
- Kosten: Sie vermeiden Zahlungen für die API-Nutzung, was sich bei hohen Volumina als rentabel erweist.
- Verfügbarkeit: Es funktioniert ohne Internetverbindung, und Sie sind nicht von Latenzzeiten oder Ausfällen eines Remote-Dienstes abhängig.
In der Praxis ermöglichen Werkzeuge wie Ollama oder LM Studio die Ausführung offener Modelle (zum Beispiel Llama oder Mistral) auf einem Laptop. Der entscheidende Faktor ist die Hardware: Große Modelle erfordern viel RAM- oder VRAM-Speicher, weshalb lokal meist auf kleinere oder quantisierte Versionen zurückgegriffen wird.