Si 2024 a été l'année des "PC AI" et 2025 celle des agents, 2026 est en train de devenir l'année où l'inférence locale devient une décision d'achat sérieuse. La raison a un nom de trois lettres : NPU (Unité de Traitement Neural), la puce spécialisée qui exécute des réseaux neuronaux avec une fraction de la consommation d'un GPU. Dans ce guide, nous passons en revue les cinq unités NPU les plus pertinentes de 2026 et 2027, classées du portefeuille au datacenter, et ce que chacune signifie pour une entreprise qui veut de l'IA sans céder ses données.
1. Tiiny AI Pocket Lab : un superordinateur IA de 300 grammes
Présenté au CES 2026, le Pocket Lab de Tiiny AI est la démonstration la plus radicale de jusqu'où la miniaturisation a progressé : un CPU ARM v9.2 à 12 cœurs accompagné d'un NPU discret de ~160 TOPS, 80 Go de LPDDR5X et 1 To de SSD dans un dispositif de 300 grammes qui consomme environ 65 W. Le titre ? Il exécute des LLMs de jusqu'à 120.000 millions de paramètres complètement hors ligne, avec déploiement en un clic de modèles ouverts comme GPT-OSS, Llama, Qwen ou Mistral. Avec un prix de départ autour de 1.400 €, il met un "laboratoire IA privé" à la portée de tout professionnel.
2. NVIDIA Jetson AGX Orin / Thor : la référence embarquée
En robotique, vision par ordinateur et industrie, la famille Jetson reste la référence : jusqu'à 275 TOPS dans l'AGX Orin et un saut générationnel avec Thor pour les robots et machines autonomes. Son avantage n'est pas seulement le silicium, mais l'écosystème logiciel (CUDA, TensorRT, Isaac) le plus mature du marché. C'est l'option sûre lorsque l'IA doit vivre à l'intérieur d'une machine.
3. Hailo-10H : IA générative en edge avec 3 watts
La société israélienne Hailo a réalisé quelque chose de remarquable avec la Hailo-10H : 40 TOPS INT8 avec 8 Go de RAM dédiée consommant environ 3 W. Disponible en modules M.2, USB et comme cerveau de la Raspberry Pi AI HAT+ 2 de 2026, elle amène des LLMs petits et des modèles de vision à des dispositifs où auparavant seul un microcontrôleur pouvait tenir. Pour l'IoT industriel et le retail, c'est, aujourd'hui, la relation TOPS/watt à battre.
4. Axelera AI Metis : vision industrielle à 214 TOPS
La société européenne Axelera AI attaque le créneau de la vision industrielle avec Metis, un accélérateur au format M.2/PCIe qui délivre jusqu'à 214 TOPS INT8 consommant entre 3,5 et 9 W. Latences inférieures à 100 ms sans voler de RAM au système hôte : exactement ce que demandent les lignes de production, la logistique et le contrôle qualité automatisé.
5. Qualcomm AI200 et AI250 : la NPU arrive dans le rack
Le mouvement le plus important pour le datacenter vient de Qualcomm : ses accélérateurs AI200 (2026) et AI250 (2027), basés sur des NPUs Hexagon à échelle de rack. L'AI200 est équipé de 768 Go de mémoire LPDDR par carte avec refroidissement liquide direct ; l'AI250 introduit une architecture near-memory qui promet plus de 10 fois la bande passante effective. L'objectif déclaré : le meilleur coût par inférence par watt du marché, rivalisant à armes égales avec les racks de NVIDIA et AMD.
Et la sixième : l'unité NPU en rack de NAiOS
Chez NAiOS, nous croyons que cette vague change les règles de l'IA d'entreprise, et nous ne voulons pas nous limiter à l'observer : NAiOS Labs prépare sa propre unité personnalisée basée sur des NPUs au format rack, conçue pour être installée dans des datacenters propres. C'est l'évolution naturelle de notre modalité Dédié sur site : matériel d'IA moderne (GPU/NPU) à l'intérieur des installations — du client ou de NAiOS —, évalué au cas par cas par NAiOS Labs, avec une souveraineté maximale : l'IA et les données ne sortent physiquement pas de l'entreprise.
Conclusion
Des 300 grammes du Pocket Lab aux 160 kW d'un rack AI200, les NPUs ont couvert en deux ans tout le spectre entre la poche et le datacenter. Pour l'entreprise, le message est clair : l'IA souveraine n'est plus un luxe. Si vous voulez comprendre le terme en profondeur, vous avez l'entrée NPU dans la NAiOS Wiki ; et si vous voulez explorer quelle modalité correspond à votre organisation, parlons-en.






