NAiOS IconNAiOS Logo
NAiOS Wiki

NPU (Neural Processing Unit)

También: Neural Processing Unit · neuronale Verarbeitungseinheit · neuronaler Prozessor · KI-Beschleuniger · AI-Beschleuniger

Spezialisierter Chip zur Beschleunigung der Inferenz neuronaler Netze mit maximaler Energieeffizienz.

14 min de lectura

Eine NPU (Neural Processing Unit, neuronale Verarbeitungseinheit) ist ein Chip – oder ein Block innerhalb eines Prozessors –, der speziell dafür entwickelt wurde, die für künstliche Intelligenz typischen Berechnungen auszuführen, vor allem die Matrixmultiplikationen, die neuronale Netze tragen. Anders als eine CPU (Allzweck) oder eine GPU (ursprünglich für Grafik entwickelt und später an KI angepasst) ist die NPU von Grund auf für die Inferenz von Modellen optimiert: Sie führt diese Operationen massiv parallel und mit deutlich geringerem Energieverbrauch aus. Ihre reine Leistung wird üblicherweise in TOPS (Billionen Operationen pro Sekunde) angegeben.

Ihre praktische Relevanz ist unmittelbar: Sie macht es möglich, KI lokal auszuführen – auf einem Laptop, einem Smartphone, einem Edge-Gerät oder einem Server in den Räumlichkeiten des Unternehmens – ohne von der Cloud abhängig zu sein. Für eine Organisation bedeutet das geringere Latenz, niedrigere Kosten pro Inferenz und vor allem Datensouveränität: Die Modelle und die Informationen verlassen das Haus physisch nicht.

Die 5 besten NPU-Einheiten von 2026 und 2027

In den Jahren 2026–2027 hat sich der Markt in eine klare Stufenleiter geordnet, von der Hosentasche bis zum Rechenzentrum. Diese fünf Referenzen decken sie vollständig ab.

1. Tiiny AI Pocket Lab — persönliche KI für die Hosentasche

Tiiny AI Pocket Lab
Tiiny AI Pocket Lab · tiiny.ai

Auf der CES 2026 vorgestellt, vereint das Pocket Lab von Tiiny AI auf 300 Gramm eine 12-Kern-ARM-v9.2-CPU, eine dedizierte NPU mit ~160 TOPS (plus ~30 TOPS im SoC), 80 GB LPDDR5X und eine 1-TB-SSD. Es führt LLMs mit bis zu 120B Parametern vollständig offline aus, mit Ein-Klick-Bereitstellung offener Modelle (GPT-OSS, Llama, Qwen, Mistral), für rund 1.400 €.

2. NVIDIA Jetson AGX Orin / Thor — der Embedded-Standard

NVIDIA-Jetson-Orin-Familie
NVIDIA-Jetson-Orin-Familie · nvidia.com

In Robotik, Computer Vision und Industrie bleibt die Jetson-Familie von NVIDIA die Referenz: bis zu 275 TOPS im AGX Orin und ein Generationssprung mit Thor für autonome Maschinen. Ihr Vorteil liegt nicht nur im Silizium, sondern im ausgereiftesten Software-Ökosystem des Marktes (CUDA, TensorRT, Isaac).

3. Hailo-10H — generative KI am Edge mit 3 Watt

M.2-Module mit Hailo-10H
M.2-Module mit Hailo-10H · hailo.ai

Die Hailo-10H liefert 40 TOPS INT8 mit 8 GB dediziertem RAM bei einem Verbrauch von ~3 W. Erhältlich als M.2- und USB-Module sowie als Herzstück des Raspberry Pi AI HAT+ 2, bringt sie kleine LLMs und Vision-Modelle auf Geräte, in die zuvor nur ein Mikrocontroller passte. Heute ist sie das TOPS-pro-Watt-Verhältnis, das es am Edge zu schlagen gilt.

4. Axelera Metis — industrielle Bildverarbeitung mit 214 TOPS

Axelera Metis AIPU
Axelera Metis AIPU · axelera.ai

Das europäische Unternehmen Axelera AI geht die industrielle Bildverarbeitung mit Metis an, einer AIPU im M.2-/PCIe-Format, die bis zu 214 TOPS INT8 bei 3,5–9 W liefert und Latenzen unter 100 ms erreicht, ohne dem Host-System RAM abzunehmen: genau das, was Fertigungslinien, Logistik und Qualitätskontrolle brauchen.

5. Qualcomm AI200 und AI250 — die NPU erreicht den Rack

Qualcomm Dragonfly AI200
Qualcomm Dragonfly AI200 · qualcomm.com

Die Beschleuniger AI200 (2026) und AI250 (2027) von Qualcomm, basierend auf Hexagon-NPUs im Rack-Maßstab, bringen die generative Inferenz ins Rechenzentrum mit 768 GB LPDDR pro Karte, direkter Flüssigkeitskühlung und bis zu 160 kW pro Rack; die AI250 ergänzt Near-Memory-Computing mit mehr als der 10-fachen effektiven Bandbreite.

Die sechste: die NPU-Rack-Einheit von NAiOS

NAiOS Labs bereitet seine eigene individuelle, auf NPUs basierende Einheit im Rack-Format vor, konzipiert für die Installation in eigenen Rechenzentren und zur Bereitstellung des Dedicated on-site-Modus der Plattform: KI-Hardware innerhalb der Infrastruktur des Kunden (oder von NAiOS), wobei die Daten stets unter Kontrolle bleiben.

Kurzer Vergleich

Einheit Format TOPS (INT8) Speicher Leistungsaufnahme Verfügbarkeit
Tiiny AI Pocket Lab Taschenformat ~190 80 GB LPDDR5X ~65 W 2026
NVIDIA Jetson AGX Orin Embedded-Modul 275 64 GB 15–60 W verfügbar
Hailo-10H M.2 / USB 40 8 GB dediziert ~3 W verfügbar
Axelera Metis M.2 / PCIe 214 dediziert auf Karte 3,5–9 W verfügbar
Qualcomm AI200 / AI250 Rechenzentrum-Rack Rack-Skalierung 768 GB/Karte bis zu 160 kW/Rack 2026 / 2027
Tiiny AI Pocket LabHosentasche · 80 GB LPDDR5X · ~65 W · ~1.400 €
TOPS INT8~190
TOPS/Watt~6
NVIDIA Jetson AGX OrinEmbedded-Modul · 64 GB · 15–60 W · ~2.000 €
TOPS INT8275
TOPS/Watt~4,6
Hailo-10HM.2 / USB · 8 GB dediziert · ~3 W · <300 €
TOPS INT840
TOPS/Watt~13
Axelera MetisM.2 / PCIe · industrielle Bildverarbeitung · 3,5–9 W
TOPS INT8214
TOPS/Watt~24
Qualcomm AI200 / AI250Rechenzentrums-Rack · 768 GB/Karte · bis zu 160 kW/Rack · 2026/2027
Andere Liga: Leistung auf Rack-Ebene, nicht vergleichbar in TOPS pro Chip.

Die AI250 verspricht mehr als das 10-Fache der effektiven Bandbreite mit Near-Memory-Computing.

TOPS bei INT8-Präzision gemäß Herstellerangaben (Tiiny: diskrete NPU + SoC-NPU). Ungefähre TOPS/Watt basierend auf der typischen Leistungsaufnahme des Beschleunigers. Erfahren Sie, was TOPS bedeutet und warum dies nicht alles ist.

10 allgemeine Anwendungsfälle

1. Privater Büroassistent

Der unmittelbarste Anwendungsfall: ein Assistent, der E-Mails verfasst, Berichte zusammenfasst, Angebote vorbereitet und interne Fragen beantwortet, während er vollständig innerhalb des Unternehmens ausgeführt wird. Eine Mittelklasse-NPU reicht aus, um ein Modell mit 7–14 Milliarden Parametern für Dutzende von Mitarbeitenden mit Latenzzeiten von weniger als einer Sekunde bereitzustellen. Der Unterschied zu einem Cloud-Dienst liegt nicht nur in der wegfallenden monatlichen Rechnung, sondern darin, dass Vertragsentwürfe, Geschäftszahlen und sensible Mitteilungen niemals den Unternehmensbereich verlassen. Für Abteilungen, die täglich mit vertraulichen Informationen arbeiten – Geschäftsführung, Finanzen, Personalwesen –, ist dies der kürzeste Weg zur Einführung generativer KI, ohne neue Compliance-Risiken einzugehen oder von den Datenspeicherungsrichtlinien Dritter abhängig zu sein.

2. Semantische Suche und RAG für interne Dokumentationen

Jede Organisation sammelt Handbücher, Protokolle, Verträge, Wikis und E-Mails an, die niemand findet, wenn sie benötigt werden. Ein RAG-System (Retrieval-Augmented Generation) indexiert dieses Wissen mit Embeddings und beantwortet Fragen in natürlicher Sprache unter Angabe der Quellen. Dies ist ein idealer Anwendungsfall für NPUs, da er zwei leichte und konstante Arbeitslasten kombiniert: die Vektorisierung von Dokumenten bei deren Eingang und die bedarfsgerechte Generierung kurzer Antworten. Ein Team kann fragen: „Welche Garantie haben wir mit diesem Lieferanten im Jahr 2024 vereinbart?“ und erhält in Sekundenschnelle die exakte Klausel, ohne dass weder die Frage noch der Vertrag über externe Server laufen. Die Hardware-Investition amortisiert sich schnell: Internes Wissen ist nicht mehr vergraben, und die Kosten pro Abfrage liegen nach der Bereitstellung praktisch bei null.

3. Kundenservice mit privaten Chatbots

Ein Support-Chatbot, der den Katalog, die Rückgaberichtlinien und den Verlauf von Vorfällen kennt, kann 60–80 % der wiederkehrenden Anfragen ohne menschliches Eingreifen bearbeiten. Der Betrieb auf eigenen NPUs verändert die Wirtschaftlichkeit des Anwendungsfalls: Die Grenzkosten pro Konversation liegen bei null, sodass er auf der Website, bei WhatsApp und am Telefon angeboten werden kann, ohne den Token-Zähler im Auge behalten zu müssen. Zudem werden Kundendaten – Bestellungen, Adressen, Reklamationen – auf der eigenen Infrastruktur verarbeitet, was die Einhaltung der DSGVO vereinfacht und internationale Datentransfers vermeidet. Mit kleinen Modellen, die auf die historischen Konversationen des Unternehmens abgestimmt sind, erreicht die wahrgenommene Qualität das Niveau wesentlich teurerer Cloud-Lösungen, und die Skalierung bei Kampagnenspitzen ist lediglich eine Frage des Hinzufügens einer weiteren Karte.

4. Transkription und Sitzungsprotokolle

em dash
German: "Der gesamte Workflow –" -> en dash is standard in German for parenthetical thoughts. I will use the en dash (–) as it is the correct typographic equivalent, but if the prompt says "Preserve ALL formatting exactly", I should perhaps use the em dash (—) if that's what was there. The prompt says "Preserve ALL formatting exactly: Markdown syntax...". I will use the em dash (—) to be safe, even if en dash is more common in German.

*Wait, the Spanish text uses em dashes:* "—transcribir la reunión, identificar hablantes, extraer decisiones y tareas, redactar el acta y enviarla—"
I will use em dashes in the German translation to preserve formatting exactly.

*Wait, the Spanish text uses em dashes:* "—contratos en negociación, patentes, ofertas—"
I will use em dashes here too.

*Wait, the Spanish text uses quotes:* "¿cómo van las ventas de la zona este contra el objetivo del trimestre?"
German uses: „Wie entwickeln sich die Umsätze in der Region Ost im Vergleich zum Quartalsziel?“
I will use German quotes.

*Wait, "en local":* "lokal".

*Wait, "en tiempo real":* "in Echtzeit".

*Wait, "precisión profesional":* "professioneller Präzision".

*Wait, "modestas":* "bescheidenen".

*Wait, "portátil

Code-Assistenten sind bereits das Standard-Produktivitätswerkzeug in der Entwicklung, aber das Versenden des Repositorys an Dritte ist für das Bankwesen, die Verteidigung, das Gesundheitswesen oder jedes Unternehmen mit wertvollem geistigem Eigentum in seiner Software unzumutbar. Offene Code-Modelle mit 7–30 Mrd. Parametern bieten Autovervollständigung, Testgenerierung und Code-Erklärung in einer sehr wettbewerbsfähigen Qualität, und eine NPU mit ausreichend Speicher – das Pocket Lab mit seinen 80 GB, ein gut dimensioniertes Jetson – stellt diese einem gesamten Entwicklungsteam zur Verfügung. Der Copilot kennt den proprietären Code, ohne dass dieser das Gebäude verlässt, kann auf die internen Konventionen des Teams abgestimmt werden und funktioniert im Büro ebenso wie in einer isolierten Umgebung ohne Internetzugang.

8. Dokumentenautomatisierung: OCR und Extraktion

Rechnungen, Lieferscheine, Ausweise, Gehaltsabrechnungen, Formulare: die Eingangsbürokratie eines jeden Unternehmens. Die Kombination aus modernem OCR und Sprachmodellen mit Sehvermögen ermöglicht es, das Dokument zu lesen, zu klassifizieren, die relevanten Felder zu extrahieren und sie ohne starre Vorlagen in das ERP zu übertragen, wobei auch nie zuvor gesehene Formate toleriert werden. Dies ist eine perfekte Auslastung für NPUs, da das Volumen hoch, aber jedes einzelne Dokument klein ist, und die nächtliche Stapelverarbeitung Hardware nutzt, die tagsüber für andere Anwendungsfälle dient. Durch die lokale Verarbeitung werden die in diesen Dokumenten enthaltenen personenbezogenen Daten von Kundschaft und Angestellten nicht offengelegt – eine direkte Anforderung, wenn es um besondere Datenkategorien geht. Die Rentabilität gehört zu den messbarsten: Stunden der Dateneingabe, die entfallen.

9. Intelligente Videosicherheit und Zutrittskontrolle

Kameras erzeugen das größte Datenvolumen eines Unternehmens, und fast niemand sieht es sich an. Eine Vision-NPU – eine Metis, eine Hailo – verwandelt diesen Datenstrom in nützliche Ereignisse: Eindringen außerhalb der Geschäftszeiten, fehlende PSA auf der Baustelle, überschrittene Kapazität, unbekanntes Fahrzeug an der Laderampe. Die Videoverarbeitung am Edge, direkt an der Kamera, verhindert eine Netzüberlastung durch das Hochladen von Streams in die Cloud und hält die Bilder – potenzielle, besonders sensible biometrische Daten – innerhalb der Räumlichkeiten. Warnmeldungen erreichen das Sicherheitsteam in Echtzeit mit dem relevanten Clip, und die aggregierte Analytik (Ströme, Belegung, Muster) unterstützt operative Entscheidungen, ohne die Privatsphäre von Angestellten und Besuchenden zu gefährden.

10. Agenten für interne Prozesse

Der nächste Schritt nach dem Chatbot ist der Agent: eine KI, die nicht nur antwortet, sondern ausführt – sie wickelt eine Lieferantenanmeldung ab, gleicht eine Zahlung ab, bereitet das Onboarding einer beschäftigten Person vor – durch die Verkettung von Aufrufen interner Systeme. Gerade weil sie auf ERP, CRM und Datenbanken mit Schreibrechten zugreift, ist dies der Fall, in dem die lokale Ausführung am sinnvollsten ist: Zugangsdaten und operative Daten verlassen niemals das Unternehmensnetzwerk, und jede Aktion wird in der eigenen Infrastruktur auditiert. Eine dedizierte NPU garantiert zudem stabile Latenzen für Workflows mit Dutzenden von Schritten. Dies ist das natürliche Terrain für Plattformen wie NAiOS: Agenten mit gesteuertem Zugriff auf die Werkzeuge des Unternehmens, die auf Hardware laufen, welche das Unternehmen kontrolliert.

10 Nischen-Anwendungsfälle

1. Visuelle Inspektion in der Produktionslinie

In der Fertigung erfordert das Erkennen eines millimeterkleinen Defekts bei Liniengeschwindigkeit eine Inferenz in Millisekunden: Es bleibt keine Zeit für den Weg in die Cloud und zurück. Eine industrielle NPU wie Axelera Metis analysiert hunderte Teile pro Minute direkt an der Kamera und erkennt Risse, Grate, kalte Lötstellen oder falsch bedruckte Etiketten mit einer Präzision, die über der menschlichen Inspektion liegt, und ohne Ermüdung. Das Modell wird mit den eigenen Teilen trainiert und verbessert sich mit jedem neu etikettierten Defekt. Die Auswirkung ist zweifach: Weniger fehlerhafte Produkte erreichen die Kundschaft und die Qualitätsrückverfolgbarkeit wird automatisch dokumentiert. Für Werke mit alten Linien ist die Nachrüstung machbar: Eine Industriekamera, ein M.2-Modul und ein Embedded-PC genügen, um eine Linie aus den neunziger Jahren mit Bildverarbeitung auszustatten.

2. Prädiktive Wartung im Werk

Vibration, Temperatur, Stromverbrauch, Schall: Maschinen kündigen einen Defekt an, bevor sie ausfallen, aber man muss sie kontinuierlich überwachen. Schlanke Zeitreihenmodelle, die auf verbrauchsarmen NPUs direkt am Sensor laufen, erkennen das Abweichen eines Lagers oder die Kavitation einer Pumpe Wochen vor dem Ausfall, wenn die Reparatur noch kostengünstig und planbar ist. Edge-Processing ist entscheidend, da das Volumen der Rohdaten der Sensorik zu groß ist, um alles in die Cloud hochzuladen, und da viele Werke über eine begrenzte oder aus Sicherheitsgründen (OT-Sicherheit) isolierte Konnektivität verfügen. Das Ergebnis bemisst sich an vermiedenen ungeplanten Stillständen: In Industrien mit kontinuierlichen Prozessen amortisiert ein einziger vermiedener Stillstand die gesamte Hardware-Bereitstellung mehrfach.

3. Unterstützung der medizinischen Diagnose am Edge

In der Gesundheitsversorgung sind Patientendaten die am stärksten geschützte Kategorie, die es gibt, und Latenz kann klinisch relevant sein: ein Ultraschallgerät, das Strukturen in Echtzeit hervorhebt, eine Netzhautanalyse direkt in der Praxis, die Priorisierung dringender Röntgenaufnahmen im PACS des Krankenhauses. NPUs ermöglichen die Ausführung dieser zertifizierten Modelle innerhalb des Medizinprodukts oder des Krankenhaus-Rechenzentrums, ohne dass Bilder das Zentrum verlassen, was die Einhaltung der DSGVO und der Medizinprodukteverordnung radikal vereinfacht. Für die ländliche Gesundheitsversorgung und medizinische NGOs bringt ein tragbares Gerät mit NPU Referenzdiagnostik-Kapazitäten in Arztpraxen ohne zuverlässige Konnektivität. Es ersetzt die Ärzteschaft nicht: Es bringt die fachkundige Zweitmeinung direkt an den Point of Care.

4. Präzisionslandwirtschaft

Eine Drohne, die das Flurstück überfliegt, oder ein Traktor mit Multispektralkameras erzeugen Gigabytes pro Stunde, die nicht über die Mobilfunkabdeckung auf dem Feld übertragen werden können. Mit einer NPU an Bord – ein Jetson ist der De-facto-Standard – erfolgt die Analyse während des Fluges: Erkennung von Wasserstress, Zählen von Pflanzen, Identifizierung von Schädlingen und Unkraut Pflanze für Pflanze. Dies ermöglicht die selektive Ausbringung von Pflanzenschutzmitteln, was den Einsatz von Chemikalien um zweistellige Proz

Fortschrittliche Fahrerassistenzsysteme stellen den Extremfall in Bezug auf Latenz dar: Das Bremsen vor einer zu Fuß gehenden Person duldet keine Verzögerung durch eine Serververbindung. Fahrzeug-NPUs – mit Jetson Thor als Referenz im High-End-Bereich – verarbeiten Kameras, Radar und Lidar direkt im Fahrzeug mit Entscheidungen im Millisekundenbereich. In gewerblichen Flotten bietet dieselbe Hardware operativen Mehrwert: Erkennung von Müdigkeit und Ablenkung der fahrenden Person, intelligente Ereignisaufzeichnung, die nur die relevanten Sekunden speichert, und Coaching für effizientes Fahren. Für ein Transportunternehmen bedeutet dies eine geringere Unfallrate, auf Datenbasis neu verhandelbare Versicherungsprämien und Kraftstoffeinsparungen. Das besonders sensible Video aus der Kabine verlässt das Fahrzeug nur bei einem begründeten Anlass.

7. Kollaborative Robotik

Ein Cobot, der den Raum mit Menschen teilt, muss in Echtzeit wahrnehmen und reagieren: die Hand sehen, die in seinen Bereich eindringt, die Kraft anpassen und die Flugbahn neu planen. Diese Wahrnehmung erfolgt über NPUs, die direkt im Roboter verbaut sind, da die funktionale Sicherheit nicht vom WLAN der Werkshalle abhängen darf. Die neue Generation von Manipulationsmodellen – durch Demonstration trainierte visuomotorische Strategien – ermöglicht es zudem, den Cobot umzuprogrammieren, indem ihm die Aufgabe beigebracht statt programmiert wird. Die Ausführung

Anwaltskanzleien, Wirtschaftsprüfungsgesellschaften, Private Banking, Notariate: Berufe, in denen Vertraulichkeit keine Präferenz, sondern eine standesrechtliche und gesetzliche Verpflichtung darstellt. Für diese ist das Versenden von Kundendokumenten an eine externe API in vielen Fällen schlichtweg nicht machbar, ungeachtet der Verschlüsselung während der Übertragung. Eine NPU-Einheit in der Kanzlei – von der Größe eines Buches – ermöglicht Vertragsanalysen, unterstützte Due Diligence, semantische Rechtsprechungsrecherche im eigenen Archiv und das Erstellen von Entwürfen, ohne dass auch nur ein einziges Dokument das Haus verlässt. Das geschäftliche Argument ist überzeugend: Die Kanzlei kann ihrer Mandantschaft schriftlich garantieren, dass deren Informationen die eigenen Räumlichkeiten nie verlassen haben. KI ist somit kein Reputationsrisiko mehr, sondern wird zum Differenzierungsmerkmal.

10. Smart Cities und Verkehr

Modernes Stadtmanagement stützt sich auf Tausende von Kameras und Sensoren, deren kontinuierliche Übertragung an ein zentrales Rechenzentrum extrem kostspielig ist und offensichtliche Datenschutzrisiken birgt. Das Erfolgsmodell ist das Edge-Processing: NPUs direkt in den Verkehrsschaltschränken analysieren Verkehrsflüsse, erkennen Vorfälle, passen Ampelschaltungen adaptiv an, priorisieren Notfälle und zählen Verkehrsarten – Auto, Fahrrad, Fußgänger –, wobei lediglich Ereignisse und anonymisierte Statistiken an

¿Quieres profundizar?

Lee nuestros artículos sobre IA aplicada en el blog de NAiOS.

Ir al Blog