NAiOS IconNAiOS Logo
NAiOS Wiki

TOPS (Tera Operations Per Second)

También: Tera Operations Per Second · teraoperaciones por segundo · TOPS INT8 · TOPS por vatio · rendimiento NPU

Unidad que mide el rendimiento bruto de un acelerador de IA: billones de operaciones por segundo

4 min de lectura

TOPS (Tera Operations Per Second, billones de operaciones por segundo) es la unidad con la que se mide el rendimiento bruto de los aceleradores de IA, especialmente las NPUs. Un chip de "40 TOPS" puede ejecutar 40 billones de operaciones aritméticas elementales —multiplicaciones y sumas, la materia prima de las redes neuronales— cada segundo. Es al hardware de IA lo que los caballos a un coche: la cifra de marketing que resume, de forma imperfecta, cuánta potencia hay bajo el capó.

Cómo se mide (y por qué casi siempre en INT8)

Los TOPS dependen por completo de la precisión numérica con la que se calcula. La inferencia moderna trabaja con modelos cuantizados a enteros de 8 bits (INT8), así que esa es la cifra que anuncian los fabricantes; el mismo silicio rinde aproximadamente el doble en INT4 y la mitad en FP16:

Precisión Uso típico Rendimiento relativo
INT4 LLMs muy cuantizados, máxima velocidad ~2× la cifra INT8
INT8 inferencia estándar cuantizada (la cifra anunciada)
FP16 modelos sin cuantizar, entrenamiento ligero ~0,5×
FP32 precisión completa, casi nunca en NPUs ~0,25×

Comparar TOPS de fabricantes distintos sin fijarse en la precisión es comparar peras con manzanas. Y ojo con el pariente: TFLOPS mide operaciones en coma flotante (terreno de GPUs y entrenamiento); TOPS, operaciones enteras (terreno de NPUs e inferencia). No son intercambiables.

Pico teórico vs. rendimiento real

Los TOPS son un máximo de laboratorio: suponen que las unidades de cálculo nunca esperan por datos. En la práctica, el factor limitante suele ser el ancho de banda de memoria — de nada sirven 200 TOPS si los pesos del modelo no llegan a tiempo. Con LLMs esto es decisivo: un chip con menos TOPS pero mucha memoria rápida y bien conectada puede mover con fluidez un modelo que ahoga a otro nominalmente superior. Por eso el Tiiny AI Pocket Lab presume tanto de sus 80 GB de LPDDR5X como de sus ~190 TOPS, y por eso la Qualcomm AI250 apuesta por computación near-memory con 10× de ancho de banda efectivo.

TOPS por vatio: la métrica que separa generaciones

La eficiencia energética es lo que ha permitido bajar la IA del datacenter al bolsillo. Una Hailo-10H entrega ~13 TOPS por vatio; una Axelera Metis, ~24; una GPU de sobremesa de hace unos años, menos de 1. Para una empresa, TOPS/vatio se traduce directamente en coste de operación: más inferencia por cada euro de factura eléctrica. Es la métrica sobre la que NAiOS Labs está diseñando su unidad NPU en formato rack para datacenters propios.

Referencias 2026: cuántos TOPS tiene cada cosa

Hardware TOPS (INT8) Consumo Clase
Móvil de gama alta 35–45 <5 W NPU integrada en el SoC
Portátil "AI PC" (Copilot+ exige 40) 40–50 ~10 W NPU integrada
Hailo-10H 40 ~3 W módulo edge M.2/USB
Tiiny AI Pocket Lab ~190 ~30 W (TDP) mini-PC de bolsillo
Axelera Metis 214 3,5–9 W aceleradora M.2/PCIe
NVIDIA Jetson AGX Orin 275 15–60 W módulo embedded
Qualcomm AI200/AI250 escala rack hasta 160 kW/rack datacenter

¿Cuántos TOPS necesita tu caso de uso?

  • Transcripción de voz y visión básica (cámaras, OCR): 5–15 TOPS bastan; es terreno de NPUs integradas y módulos edge.
  • Asistente con LLM pequeño (7B cuantizado), RAG documental: 40+ TOPS y, sobre todo, 8–16 GB de memoria para el modelo.
  • Visión industrial a velocidad de línea: 100–200 TOPS con latencia garantizada (Metis, Jetson).
  • LLMs medianos-grandes en local (30B–120B): la memoria manda — 48–80 GB o más; los ~190 TOPS del Pocket Lab acompañan, pero sin sus 80 GB no habría caso.
  • Inferencia generativa multiusuario (decenas de usuarios simultáneos): escala rack — ya no se cuentan TOPS por chip sino tokens por segundo por rack y por vatio.

La regla práctica para elegir hardware son tres preguntas juntas: ¿puede con el modelo (TOPS)? ¿cabe el modelo (memoria)? ¿a qué coste (TOPS/vatio)? Tienes el panorama completo de unidades en la entrada NPU y el análisis en nuestro post del blog.

¿Quieres profundizar?

Lee nuestros artículos sobre IA aplicada en el blog de NAiOS.

Ir al Blog