NAiOS IconNAiOS Logo
NAiOS Wiki

TOPS (Tera-Operationen pro Sekunde)

También: Tera Operations Per Second · Tera-Operationen pro Sekunde · TOPS INT8 · TOPS pro Watt · NPU-Leistung

Einheit zur Messung der Bruttoleistung eines KI-Beschleunigers: Billionen Operationen pro Sekunde

4 min de lectura

TOPS (Tera Operations Per Second, Billionen Operationen pro Sekunde) ist die Einheit, mit der die Rohleistung von KI-Beschleunigern gemessen wird, insbesondere von NPUs. Ein Chip mit „40 TOPS" kann 40 Billionen elementare arithmetische Operationen – Multiplikationen und Additionen, der Rohstoff neuronaler Netze – pro Sekunde ausführen. Es verhält sich zur KI-Hardware wie die Pferdestärken zum Auto: die Marketing-Zahl, die in unvollkommener Weise zusammenfasst, wie viel Leistung unter der Haube steckt.

Wie sie gemessen wird (und warum fast immer in INT8)

Die TOPS hängen vollständig von der numerischen Präzision ab, mit der gerechnet wird. Moderne Inferenz arbeitet mit auf 8-Bit-Ganzzahlen (INT8) quantisierten Modellen, weshalb dies die Zahl ist, die Hersteller angeben; dasselbe Silizium leistet in INT4 ungefähr das Doppelte und in FP16 die Hälfte:

Präzision Typische Anwendung Relative Leistung
INT4 stark quantisierte LLMs, maximale Geschwindigkeit ~2× der INT8-Wert
INT8 quantisierte Standard-Inferenz (der angegebene Wert)
FP16 nicht quantisierte Modelle, leichtes Training ~0,5×
FP32 volle Präzision, bei NPUs so gut wie nie ~0,25×

TOPS-Werte verschiedener Hersteller ohne Berücksichtigung der Präzision zu vergleichen, heißt Äpfel mit Birnen zu vergleichen. Und Vorsicht mit dem Verwandten: TFLOPS misst Gleitkommaoperationen (Domäne von GPUs und Training); TOPS misst Ganzzahloperationen (Domäne von NPUs und Inferenz). Sie sind nicht austauschbar.

Theoretisches Maximum vs. reale Leistung

TOPS sind ein Labor-Höchstwert: Sie setzen voraus, dass die Recheneinheiten nie auf Daten warten. In der Praxis ist der begrenzende Faktor meist die Speicherbandbreite – 200 TOPS nützen nichts, wenn die Modellgewichte nicht rechtzeitig ankommen. Bei LLMs ist dies entscheidend: Ein Chip mit weniger TOPS, aber viel schnellem und gut angebundenem Speicher kann ein Modell flüssig bewegen, das einen nominell überlegenen Chip erstickt. Deshalb rühmt sich das Tiiny AI Pocket Lab ebenso seiner 80 GB LPDDR5X wie seiner ~190 TOPS, und deshalb setzt die Qualcomm AI250 auf Near-Memory-Computing mit 10× effektiver Bandbreite.

TOPS pro Watt: die Metrik, die Generationen trennt

Die Energieeffizienz hat es ermöglicht, KI vom Rechenzentrum in die Hosentasche zu bringen. Eine Hailo-10H liefert ~13 TOPS pro Watt; eine Axelera Metis ~24; eine Desktop-GPU von vor einigen Jahren weniger als 1. Für ein Unternehmen übersetzt sich TOPS/Watt direkt in Betriebskosten: mehr Inferenz pro Euro Stromrechnung. Es ist die Metrik, auf deren Grundlage NAiOS Labs seine NPU-Einheit im Rack-Format für eigene Rechenzentren entwirft.

Referenzwerte 2026: Wie viele TOPS hat welches Gerät

Hardware TOPS (INT8) Verbrauch Klasse
High-End-Smartphone 35–45 <5 W In das SoC integrierte NPU
„AI PC“-Laptop (Copilot+ erfordert 40) 40–50 ~10 W Integrierte NPU
Hailo-10H 40 ~3 W Edge-Modul M.2/USB
Tiiny AI Pocket Lab ~190 ~30 W (TDP) Mini-PC im Taschenformat
Axelera Metis 214 3,5–9 W M.2/PCIe-Beschleuniger
NVIDIA Jetson AGX Orin 275 15–60 W Embedded-Modul
Qualcomm AI200/AI250 Rack-Skalierung bis zu 160 kW/Rack Rechenzentrum

Wie viele TOPS benötigt Ihr Anwendungsfall?

  • Sprachtranskription und grundlegende Bildverarbeitung (Kameras, OCR): 5–15 TOPS genügen; dies ist der Bereich integrierter NPUs und Edge-Module.
  • Assistent mit kleinem LLM (quantisiertes 7B), dokumentenbasiertes RAG: 40+ TOPS und vor allem 8–16 GB Speicher für das Modell.
  • Industrielle Bildverarbeitung in Liniengeschwindigkeit: 100–200 TOPS mit garantierter Latenz (Metis, Jetson).
  • Mittelgroße bis große LLMs lokal (30B–120B): Der Speicher ist entscheidend – 48–80 GB oder mehr; die ~190 TOPS des Pocket Lab unterstützen dies, aber ohne die 80 GB wäre der Anwendungsfall nicht realisierbar.
  • Mehrbenutzer-generative-Inferenz (Dutzende gleichzeitige Nutzende): Rack-Skalierung – hier zählen nicht mehr TOPS pro Chip, sondern Token pro Sekunde pro Rack und pro Watt.

Die Faustregel für die Hardwarewahl umfasst drei kombinierte Fragen: Schafft sie das Modell (TOPS)? Passt das Modell hinein (Speicher)? Zu welchen Kosten (TOPS/Watt)? Sie finden den vollständigen Überblick über die Einheiten im Eintrag NPU sowie die Analyse in unserem Blogbeitrag.

¿Quieres profundizar?

Lee nuestros artículos sobre IA aplicada en el blog de NAiOS.

Ir al Blog