TOPS (Tera Operations Per Second, milliers de milliards d'opérations par seconde) est l'unité qui mesure la performance brute des accélérateurs d'IA, en particulier les NPU. Une puce de « 40 TOPS » peut exécuter 40 000 milliards d'opérations arithmétiques élémentaires — multiplications et additions, la matière première des réseaux neuronaux — chaque seconde. C'est au matériel d'IA ce que les chevaux sont à une voiture : le chiffre marketing qui résume, de manière imparfaite, la puissance sous le capot.
Comment on la mesure (et pourquoi presque toujours en INT8)
Les TOPS dépendent entièrement de la précision numérique avec laquelle le calcul est effectué. L'inférence moderne travaille avec des modèles quantifiés en entiers 8 bits (INT8), c'est donc ce chiffre qu'annoncent les fabricants ; le même silicium délivre environ le double en INT4 et la moitié en FP16 :
| Précision | Usage typique | Performance relative |
|---|---|---|
| INT4 | LLM fortement quantifiés, vitesse maximale | ~2× le chiffre INT8 |
| INT8 | inférence quantifiée standard (le chiffre annoncé) | 1× |
| FP16 | modèles non quantifiés, entraînement léger | ~0,5× |
| FP32 | pleine précision, presque jamais sur NPU | ~0,25× |
Comparer les TOPS de fabricants différents sans tenir compte de la précision, c'est comparer des poires et des pommes. Et attention au cousin : les TFLOPS mesurent les opérations en virgule flottante (le terrain des GPU et de l'entraînement) ; les TOPS, les opérations sur entiers (le terrain des NPU et de l'inférence). Ils ne sont pas interchangeables.
Pic théorique vs. performance réelle
Les TOPS sont un maximum de laboratoire : ils supposent que les unités de calcul n'attendent jamais de données. En pratique, le facteur limitant est généralement la bande passante mémoire — 200 TOPS ne servent à rien si les poids du modèle n'arrivent pas à temps. Avec les LLM, c'est décisif : une puce avec moins de TOPS mais beaucoup de mémoire rapide et bien connectée peut faire tourner avec fluidité un modèle qui étouffe une autre puce nominalement supérieure. C'est pourquoi le Tiiny AI Pocket Lab met autant en avant ses 80 Go de LPDDR5X que ses ~190 TOPS, et c'est pourquoi la Qualcomm AI250 mise sur le calcul near-memory avec une bande passante effective 10× supérieure.
TOPS par watt : la métrique qui sépare les générations
L'efficacité énergétique est ce qui a permis de faire descendre l'IA du datacenter jusqu'à la poche. Une Hailo-10H délivre ~13 TOPS par watt ; une Axelera Metis, ~24 ; un GPU de bureau d'il y a quelques années, moins de 1. Pour une entreprise, les TOPS/watt se traduisent directement en coût d'exploitation : plus d'inférence pour chaque euro de facture électrique. C'est la métrique sur laquelle NAiOS Labs conçoit son unité NPU au format rack pour ses propres datacenters.
Références 2026 : combien de TOPS pour quoi
| Matériel | TOPS (INT8) | Consommation | Classe |
|---|---|---|---|
| Mobile haut de gamme | 35–45 | <5 W | NPU intégrée au SoC |
| Ordinateur portable « AI PC » (Copilot+ exige 40) | 40–50 | ~10 W | NPU intégrée |
| Hailo-10H | 40 | ~3 W | module edge M.2/USB |
| Tiiny AI Pocket Lab | ~190 | ~30 W (TDP) | mini-PC de poche |
| Axelera Metis | 214 | 3,5–9 W | accélérateur M.2/PCIe |
| NVIDIA Jetson AGX Orin | 275 | 15–60 W | module embarqué |
| Qualcomm AI200/AI250 | échelle rack | jusqu'à 160 kW/rack | centre de données |
De combien de TOPS votre cas d'usage a-t-il besoin ?
- Transcription vocale et vision de base (caméras, OCR) : 5–15 TOPS suffisent ; c'est le domaine des NPU intégrées et des modules edge.
- Assistant avec petit LLM (7B quantifié), RAG documentaire : 40+ TOPS et, surtout, 8–16 Go de mémoire pour le modèle.
- Vision industrielle à vitesse de ligne : 100–200 TOPS avec latence garantie (Metis, Jetson).
- LLM moyens à grands en local (30B–120B) : la mémoire prime — 48–80 Go ou plus ; les ~190 TOPS du Pocket Lab accompagnent, mais sans ses 80 Go, cela ne serait pas possible.
- Inférence générative multi-utilisateur (dizaines d'utilisateurs simultanés) : échelle rack — on ne compte plus les TOPS par puce mais les tokens par seconde par rack et par watt.
La règle pratique pour choisir votre matériel repose sur trois questions conjointes : est-il capable de gérer le modèle (TOPS) ? le modèle tient-il en mémoire (mémoire) ? à quel coût (TOPS/watt) ? Vous trouverez le panorama complet des unités dans l'article NPU et l'analyse dans notre article de blog.