Die Szene wiederholt sich in jeder Demo von NAiOS Labs: Jemand aus dem Team, mit mehr Energie als ein Wissenschaftler aus einem Film, der kurz davor ist zu schreien "Das ist es!", zeigt auf ein Rack voller glänzender Module und nennt eine Zahl: "vierzig TOPSTOPS (Tera-Operationen pro Sekunde)Einheit zur Messung der Bruttoleistung eines KI-Beschleunigers: Billionen Operationen pro Sekunde bei drei Watt". Und die halbe Halle nickt, während die andere Hälfte denkt: Was zur Hölle ist ein TOPS? Heute beantworten wir diese Hälfte, die absolut recht hat zu fragen.
Die Definition in einem Satz
TOPS bedeutet Tera Operations Per Second: Billionen von Operationen pro Sekunde. Es ist die Einheit, mit der die Rohleistung von KI-Beschleunigern gemessen wird, insbesondere von NPUs. Ein Chip "mit 40 TOPS" führt vierzig Billionen elementare Multiplikationen und Additionen pro Sekunde aus, was genau die Art von Arithmetik ist, aus der neuronale Netzwerke bestehen. Es ist für die KI-Hardware, was Pferdestärken für ein Auto sind: die Zahl, die unvollkommen zusammenfasst, wie viel Leistung unter der Haube steckt.
Das Kleingedruckte: INT8, Spitzen und Speicher
Drei Nuancen trennen den informierten Käufer von dem, der den falschen Chip kauft. Erstens, die Genauigkeit: Die TOPS werden fast immer in INT8 (8-Bit-Ganzzahlen) angegeben; derselbe Siliziumchip liefert das Doppelte in INT4 und die Hälfte in FP16, sodass der Vergleich von Zahlen ohne Berücksichtigung der Genauigkeit Äpfel mit Birnen vergleicht. Zweitens, es handelt sich um einen theoretischen Peak: Die Zahl setzt voraus, dass die Recheneinheiten niemals auf Daten warten, was in der Praxis ständig der Fall ist. Und drittens, das, was bei LLMs am meisten schmerzt: der Speicher. Ein großes Modell muss in den Speicher passen und durch ihn mit voller Geschwindigkeit fließen; deshalb kann ein Chip mit weniger TOPS, aber 80 GB gut versorgtem Speicher ein Modell bewegen, das ein nominal leistungsstärkeres Modell erdrückt. Bei großen Modellen ist die Bandbreite ebenso wichtig wie die Rechenleistung.
Reale Referenzen von 2026
Um das Auge zu kalibrieren: Die NPUNPU (Neural Processing Unit)Spezialisierter Chip zur Beschleunigung der Inferenz neuronaler Netze mit maximaler Energieeffizienz. eines "AI PC"-Laptops liegt bei etwa 40–50 TOPS (40 ist die Schwelle für CopilotKI-CopilotIn Arbeitswerkzeuge integrierte KI-Assistenz+), eine Hailo-10H liefert 40 TOPS bei einem Verbrauch von 3 Watt, eine Axelera Metis erreicht 214, ein NVIDIA Jetson AGX Orin 275 und das Tiiny AI Pocket Lab kombiniert ~190 TOPS mit 80 GB Speicher. Im Datacenter-Maßstab verliert die Zahl pro Chip an Bedeutung und es wird von Leistung pro Rack gesprochen, wie bei den Qualcomm AI200/AI250. Du findest die fünf analysierten Einheiten in unserem Top 5 der NPUs 2026–2027.
Die Zahl, die wirklich Generationen trennt
Wenn du nur eine Metrik betrachten kannst, schaue auf TOPS pro Watt. Die Effizienz ist es, die es ermöglicht hat, die KI aus dem Rechenzentrum in die Tasche zu bringen, und es ist die Metrik, nach der wir im NAiOS Labs unsere NPU-Einheit im Rack-Format für eigene Rechenzentren entwerfen: Maximierung der Inferenz pro Watt bedeutet mehr souveräne KISouveräne KIStrategische Priorität der Länder, über eigene KI-Infrastrukturen zu verfügen für jeden Euro Stromrechnung. Die praktische Regel zur Auswahl der Hardware besteht aus drei Fragen zusammen: Kann es das Modell (TOPS)?, Passt das Modell (Speicher)? und Zu welchem Preis (TOPS/Watt)?
Weiter in der Wiki
Wir haben den Eintrag TOPS in der NAiOS Wiki mit der Referenzbeschreibung veröffentlicht, und sein Pendant NPU mit dem vollständigen Vergleich der Einheiten und zwanzig Anwendungsfällen. Und wenn du wissen möchtest, was in deinem Fall passt — von einem privaten Büroassistenten bis zur industriellen Vision —, lass uns sprechen: im NAiOS Labs haben wir genug TOPS und Enthusiasmus.






