TOPS (Tera Operations Per Second, bilions d'operacions per segon) és la unitat amb què es mesura el rendiment brut dels acceleradors d'IA, especialment les NPUs. Un xip de "40 TOPS" pot executar 40 bilions d'operacions aritmètiques elementals —multiplicacions i sumes, la matèria primera de les xarxes neuronals— cada segon. És al maquinari d'IA el que els cavalls a un cotxe: la xifra de màrqueting que resumeix, de manera imperfecta, quanta potència hi ha sota el capó.
Com es mesura (i per què gairebé sempre en INT8)
Els TOPS depenen completament de la precisió numèrica amb què es calcula. La inferència moderna treballa amb models quantitzats a enters de 8 bits (INT8), així que aquesta és la xifra que anuncien els fabricants; el mateix silici rendeix aproximadament el doble en INT4 i la meitat en FP16:
| Precisió | Ús típic | Rendiment relatiu |
|---|---|---|
| INT4 | LLMs molt quantitzats, màxima velocitat | ~2× la xifra INT8 |
| INT8 | inferència estàndard quantitzada (la xifra anunciada) | 1× |
| FP16 | models sense quantitzar, entrenament lleuger | ~0,5× |
| FP32 | precisió completa, gairebé mai en NPUs | ~0,25× |
Comparar TOPS de fabricants diferents sense fixar-se en la precisió és comparar peres amb pomes. I compte amb el parent: TFLOPS mesura operacions en coma flotant (terreny de GPUs i entrenament); TOPS, operacions enteres (terreny de NPUs i inferència). No són intercanviables.
Pic teòric vs. rendiment real
Els TOPS són un màxim de laboratori: suposen que les unitats de càlcul mai no esperen per dades. A la pràctica, el factor limitant sol ser l'amplada de banda de memòria — de res no serveixen 200 TOPS si els pesos del model no arriben a temps. Amb LLMs això és decisiu: un xip amb menys TOPS però molta memòria ràpida i ben connectada pot moure amb fluïdesa un model que ofega un altre nominalment superior. Per això el Tiiny AI Pocket Lab presumeix tant dels seus 80 GB de LPDDR5X com dels seus ~190 TOPS, i per això la Qualcomm AI250 aposta per computació near-memory amb 10× d'amplada de banda efectiva.
TOPS per watt: la mètrica que separa generacions
L'eficiència energètica és el que ha permès baixar la IA del datacenter a la butxaca. Una Hailo-10H lliura ~13 TOPS per watt; una Axelera Metis, ~24; una GPU d'escriptori de fa uns anys, menys d'1. Per a una empresa, TOPS/watt es tradueix directament en cost d'operació: més inferència per cada euro de factura elèctrica. És la mètrica sobre la qual NAiOS Labs està dissenyant la seva unitat NPU en format rack per a datacenters propis.
Referències 2026: quants TOPS té cada cosa
| Hardware | TOPS (INT8) | Consum | Classe |
|---|---|---|---|
| Mòbil de gamma alta | 35–45 | <5 W | NPU integrada al SoC |
| Portàtil "AI PC" (Copilot+ exigeix 40) | 40–50 | ~10 W | NPU integrada |
| Hailo-10H | 40 | ~3 W | mòdul edge M.2/USB |
| Tiiny AI Pocket Lab | ~190 | ~30 W (TDP) | mini-PC de butxaca |
| Axelera Metis | 214 | 3,5–9 W | acceleradora M.2/PCIe |
| NVIDIA Jetson AGX Orin | 275 | 15–60 W | mòdul embedded |
| Qualcomm AI200/AI250 | escala rack | fins a 160 kW/rack | datacenter |
Quants TOPS necessita el teu cas d'ús?
- Transcripció de veu i visió bàsica (càmeres, OCR): 5–15 TOPS en tenen prou; és terreny de NPUs integrades i mòduls edge.
- Assistent amb LLM petit (7B quantitzat), RAG documental: 40+ TOPS i, sobretot, 8–16 GB de memòria per al model.
- Visió industrial a velocitat de línia: 100–200 TOPS amb latència garantida (Metis, Jetson).
- LLMs mitjans-grans en local (30B–120B): la memòria mana — 48–80 GB o més; els ~190 TOPS del Pocket Lab acompanyen, però sense els seus 80 GB no hi hauria cas.
- Inferència generativa multiusuari (desenes d'usuaris simultanis): escala rack — ja no es compten TOPS per xip sinó tokens per segon per rack i per watt.
La regla pràctica per triar hardware són tres preguntes juntes: pot amb el model (TOPS)? hi cap el model (memòria)? a quin cost (TOPS/watt)? Tens el panorama complet d'unitats a l'entrada NPU i l'anàlisi al nostre post del blog.