NAiOS IconNAiOS Logo
NAiOS Wiki

TOPS (Teraoperacions per segon)

También: Tera Operations Per Second · teraoperacions per segon · TOPS INT8 · TOPS per watt · rendiment NPU

Unitat que mesura el rendiment brut d'un accelerador d'IA: bilions d'operacions per segon

4 min de lectura

TOPS (Tera Operations Per Second, bilions d'operacions per segon) és la unitat amb què es mesura el rendiment brut dels acceleradors d'IA, especialment les NPUs. Un xip de "40 TOPS" pot executar 40 bilions d'operacions aritmètiques elementals —multiplicacions i sumes, la matèria primera de les xarxes neuronals— cada segon. És al maquinari d'IA el que els cavalls a un cotxe: la xifra de màrqueting que resumeix, de manera imperfecta, quanta potència hi ha sota el capó.

Com es mesura (i per què gairebé sempre en INT8)

Els TOPS depenen completament de la precisió numèrica amb què es calcula. La inferència moderna treballa amb models quantitzats a enters de 8 bits (INT8), així que aquesta és la xifra que anuncien els fabricants; el mateix silici rendeix aproximadament el doble en INT4 i la meitat en FP16:

Precisió Ús típic Rendiment relatiu
INT4 LLMs molt quantitzats, màxima velocitat ~2× la xifra INT8
INT8 inferència estàndard quantitzada (la xifra anunciada)
FP16 models sense quantitzar, entrenament lleuger ~0,5×
FP32 precisió completa, gairebé mai en NPUs ~0,25×

Comparar TOPS de fabricants diferents sense fixar-se en la precisió és comparar peres amb pomes. I compte amb el parent: TFLOPS mesura operacions en coma flotant (terreny de GPUs i entrenament); TOPS, operacions enteres (terreny de NPUs i inferència). No són intercanviables.

Pic teòric vs. rendiment real

Els TOPS són un màxim de laboratori: suposen que les unitats de càlcul mai no esperen per dades. A la pràctica, el factor limitant sol ser l'amplada de banda de memòria — de res no serveixen 200 TOPS si els pesos del model no arriben a temps. Amb LLMs això és decisiu: un xip amb menys TOPS però molta memòria ràpida i ben connectada pot moure amb fluïdesa un model que ofega un altre nominalment superior. Per això el Tiiny AI Pocket Lab presumeix tant dels seus 80 GB de LPDDR5X com dels seus ~190 TOPS, i per això la Qualcomm AI250 aposta per computació near-memory amb 10× d'amplada de banda efectiva.

TOPS per watt: la mètrica que separa generacions

L'eficiència energètica és el que ha permès baixar la IA del datacenter a la butxaca. Una Hailo-10H lliura ~13 TOPS per watt; una Axelera Metis, ~24; una GPU d'escriptori de fa uns anys, menys d'1. Per a una empresa, TOPS/watt es tradueix directament en cost d'operació: més inferència per cada euro de factura elèctrica. És la mètrica sobre la qual NAiOS Labs està dissenyant la seva unitat NPU en format rack per a datacenters propis.

Referències 2026: quants TOPS té cada cosa

Hardware TOPS (INT8) Consum Classe
Mòbil de gamma alta 35–45 <5 W NPU integrada al SoC
Portàtil "AI PC" (Copilot+ exigeix 40) 40–50 ~10 W NPU integrada
Hailo-10H 40 ~3 W mòdul edge M.2/USB
Tiiny AI Pocket Lab ~190 ~30 W (TDP) mini-PC de butxaca
Axelera Metis 214 3,5–9 W acceleradora M.2/PCIe
NVIDIA Jetson AGX Orin 275 15–60 W mòdul embedded
Qualcomm AI200/AI250 escala rack fins a 160 kW/rack datacenter

Quants TOPS necessita el teu cas d'ús?

  • Transcripció de veu i visió bàsica (càmeres, OCR): 5–15 TOPS en tenen prou; és terreny de NPUs integrades i mòduls edge.
  • Assistent amb LLM petit (7B quantitzat), RAG documental: 40+ TOPS i, sobretot, 8–16 GB de memòria per al model.
  • Visió industrial a velocitat de línia: 100–200 TOPS amb latència garantida (Metis, Jetson).
  • LLMs mitjans-grans en local (30B–120B): la memòria mana — 48–80 GB o més; els ~190 TOPS del Pocket Lab acompanyen, però sense els seus 80 GB no hi hauria cas.
  • Inferència generativa multiusuari (desenes d'usuaris simultanis): escala rack — ja no es compten TOPS per xip sinó tokens per segon per rack i per watt.

La regla pràctica per triar hardware són tres preguntes juntes: pot amb el model (TOPS)? hi cap el model (memòria)? a quin cost (TOPS/watt)? Tens el panorama complet d'unitats a l'entrada NPU i l'anàlisi al nostre post del blog.

¿Quieres profundizar?

Lee nuestros artículos sobre IA aplicada en el blog de NAiOS.

Ir al Blog