La scène se répète à chaque démo de NAiOS Labs : quelqu'un de l'équipe, avec plus d'énergie qu'un scientifique de film sur le point de crier "c'est ça!", pointe un rack rempli de modules brillants et lâche un chiffre : "quarante TOPS pour trois watts". Et la moitié de la salle acquiesce tandis que l'autre moitié pense : et qu'est-ce que c'est qu'un TOPS ? Aujourd'hui, nous répondons à cette moitié, qui a tout à fait raison de demander.
La définition en une phrase
TOPS signifie Tera Operations Per Second : billions d'opérations par seconde. C'est l'unité avec laquelle on mesure la puissance brute des accélérateurs d'IA, en particulier les NPU. Une puce "de 40 TOPS" exécute quarante billions de multiplications et d'additions élémentaires chaque seconde, ce qui est exactement le type d'arithmétique dont sont faites les réseaux neuronaux. C'est pour le matériel d'IA ce que les chevaux sont pour une voiture : le chiffre qui résume, de manière imparfaite, combien de puissance il y a sous le capot.
Les petites lignes : INT8, pics et mémoire
Trois nuances séparent l'acheteur informé de celui qui se retrouve avec la mauvaise puce. D'abord, la précision : les TOPS sont presque toujours annoncés en INT8 (entiers de 8 bits) ; le même silicium donne le double en INT4 et la moitié en FP16, donc comparer des chiffres sans regarder la précision, c'est comparer des poires avec des pommes. Deuxièmement, ce sont un pic théorique : le nombre suppose que les unités de calcul n'attendent jamais de données, ce qui, dans la pratique, se produit constamment. Et troisièmement, celui qui fait le plus mal avec les LLMs : la mémoire. Un grand modèle doit tenir en mémoire et y circuler à toute vitesse ; c'est pourquoi une puce avec moins de TOPS mais 80 Go bien alimentés peut faire fonctionner un modèle qui étouffe un autre nominalement plus puissant. Dans les grands modèles, la bande passante compte autant que le calcul.
Références réelles de 2026
Pour calibrer l'œil : la NPU d'un ordinateur portable "AI PC" tourne autour de 40–50 TOPS (40 est le seuil de Copilot+), une Hailo-10H donne 40 TOPS en consommant 3 watts, une Axelera Metis atteint 214, un NVIDIA Jetson AGX Orin à 275 et le Tiiny AI Pocket Lab combine ~190 TOPS avec 80 Go de mémoire. À l'échelle des centres de données, le chiffre par puce perd son sens et on parle de performance par rack, comme dans les Qualcomm AI200/AI250. Vous avez les cinq unités analysées dans notre top 5 des NPU 2026–2027.
Le nombre qui sépare vraiment les générations
Si vous ne pouvez regarder qu'une seule métrique, regardez TOPS par watt. L'efficacité est ce qui a rendu possible de faire passer l'IA du datacenter à la poche, et c'est la métrique sur laquelle nous concevons dans les laboratoires NAiOS notre unité NPU au format rack pour des datacenters propres : maximiser l'inférence par watt signifie plus d'IA souveraine pour chaque euro de facture électrique. La règle pratique pour choisir le matériel repose sur trois questions ensemble : peut-il gérer le modèle (TOPS) ?, le modèle tient-il (mémoire) ? et à quel coût (TOPS/watt) ?
Continuez sur le wiki
Nous avons publié l'entrée TOPS dans le Wiki NAiOS avec l'explication de référence, et sa compagne NPU avec la comparaison complète des unités et vingt cas d'utilisation. Et si vous voulez savoir ce qui convient à votre cas — d'un assistant bureautique privé à la vision industrielle —, parlons-en : dans les laboratoires NAiOS, nous avons des TOPS et de l'enthousiasme à revendre.






