Si el 2024 va ser l'any dels "AI PC" i el 2025 el dels agents, el 2026 està sent l'any en què la inferència local esdevé una decisió de compra seriosa. El motiu té nom de tres lletres: NPU (Neural Processing Unit), el xip especialitzat que executa xarxes neuronals amb una fracció del consum d'una GPU. En aquesta guia repassem les cinc unitats NPU més rellevants de 2026 i 2027, ordenades de la butxaca al datacenter, i què significa cadascuna per a una empresa que vol IA sense cedir les seves dades.
1. Tiiny AI Pocket Lab: un superordinador d'IA en 300 grams
Presentat al CES 2026, el Pocket Lab de Tiiny AI és la demostració més radical de fins on ha arribat la miniaturització: una CPU ARM v9.2 de 12 nuclis acompanyada d'una NPU discreta de ~160 TOPS, 80 GB de LPDDR5X i 1 TB d'SSD en un dispositiu de 300 grams que consumeix uns 65 W. El titular? Executa LLMs de fins a 120.000 milions de paràmetres completament offline, amb desplegament en un clic de models oberts com GPT-OSS, Llama, Qwen o Mistral. Amb un preu de sortida al voltant dels 1.400 €, posa un "laboratori d'IA privat" a l'abast de qualsevol professional.
2. NVIDIA Jetson AGX Orin / Thor: l'estàndard embedded
En robòtica, visió per computador i indústria, la família Jetson continua sent la referència: fins a 275 TOPS a l'AGX Orin i un salt generacional amb Thor per a robots i màquines autònomes. El seu avantatge no és només el silici, sinó l'ecosistema de software (CUDA, TensorRT, Isaac) més madur del mercat. És l'opció segura quan la IA ha de viure dins d'una màquina.
3. Hailo-10H: IA generativa a l'edge amb 3 watts
La israeliana Hailo ha aconseguit una cosa notable amb la Hailo-10H: 40 TOPS INT8 amb 8 GB de RAM dedicada consumint uns 3 W. Disponible en mòduls M.2, USB i com a cervell de la Raspberry Pi AI HAT+ 2 de 2026, porta LLMs petits i models de visió a dispositius on abans només hi cabia un microcontrolador. Per a IoT industrial i retail és, avui, la relació TOPS/watt a batre.
4. Axelera AI Metis: visió industrial a 214 TOPS
L'europea Axelera AI ataca el nínxol de la visió industrial amb Metis, una acceleradora en format M.2/PCIe que lliura fins a 214 TOPS INT8 consumint entre 3,5 i 9 W. Latències per sota dels 100 ms sense robar RAM al sistema amfitrió: exactament el que demanen les línies de producció, la logística i el control de qualitat automatitzat.
5. Qualcomm AI200 i AI250: la NPU arriba al rack
El moviment més important per al datacenter ve de Qualcomm: les seves acceleradores AI200 (2026) i AI250 (2027), basades en NPUs Hexagon a escala de rack. L'AI200 munta 768 GB de memòria LPDDR per targeta amb refrigeració líquida directa; l'AI250 introdueix una arquitectura near-memory que promet més de 10 vegades l'ample de banda efectiu. L'objectiu declarat: el millor cost per inferència per watt del mercat, competint de tu a tu amb els racks de NVIDIA i AMD.
I la sisena: la unitat NPU en rack de NAiOS
A NAiOS creiem que aquesta onada canvia les regles de la IA empresarial, i no volem limitar-nos a observar-la: NAiOS Labs està preparant la seva pròpia unitat personalitzada basada en NPUs en format rack, dissenyada per muntar-se en datacenters propis. És l'evolució natural de la nostra modalitat Dedicat on-site: hardware d'IA modern (GPU/NPU) dins de les instal·lacions —del client o de NAiOS—, avaluat cas a cas per NAiOS Labs, amb màxima sobirania: la IA i les dades no surten físicament de l'empresa.
Conclusió
Dels 300 grams del Pocket Lab als 160 kW d'un rack AI200, les NPUs han cobert en dos anys tot l'espectre entre la butxaca i el datacenter. Per a l'empresa el missatge és clar: la IA sobirana ja no és un luxe. Si vols entendre el terme a fons, tens l'entrada NPU a la NAiOS Wiki; i si vols explorar quina modalitat encaixa amb la teva organització, parlem.






