TOPS (Tera Operations Per Second, billones de operaciones por segundo) es la unidad con la que se mide el rendimiento bruto de los aceleradores de IA, especialmente las NPUs. Un chip de "40 TOPS" puede ejecutar 40 billones de operaciones aritméticas elementales —multiplicaciones y sumas, la materia prima de las redes neuronales— cada segundo. Es al hardware de IA lo que los caballos a un coche: la cifra de marketing que resume, de forma imperfecta, cuánta potencia hay bajo el capó.
Cómo se mide (y por qué casi siempre en INT8)
Los TOPS dependen por completo de la precisión numérica con la que se calcula. La inferencia moderna trabaja con modelos cuantizados a enteros de 8 bits (INT8), así que esa es la cifra que anuncian los fabricantes; el mismo silicio rinde aproximadamente el doble en INT4 y la mitad en FP16:
| Precisión | Uso típico | Rendimiento relativo |
|---|---|---|
| INT4 | LLMs muy cuantizados, máxima velocidad | ~2× la cifra INT8 |
| INT8 | inferencia estándar cuantizada (la cifra anunciada) | 1× |
| FP16 | modelos sin cuantizar, entrenamiento ligero | ~0,5× |
| FP32 | precisión completa, casi nunca en NPUs | ~0,25× |
Comparar TOPS de fabricantes distintos sin fijarse en la precisión es comparar peras con manzanas. Y ojo con el pariente: TFLOPS mide operaciones en coma flotante (terreno de GPUs y entrenamiento); TOPS, operaciones enteras (terreno de NPUs e inferencia). No son intercambiables.
Pico teórico vs. rendimiento real
Los TOPS son un máximo de laboratorio: suponen que las unidades de cálculo nunca esperan por datos. En la práctica, el factor limitante suele ser el ancho de banda de memoria — de nada sirven 200 TOPS si los pesos del modelo no llegan a tiempo. Con LLMs esto es decisivo: un chip con menos TOPS pero mucha memoria rápida y bien conectada puede mover con fluidez un modelo que ahoga a otro nominalmente superior. Por eso el Tiiny AI Pocket Lab presume tanto de sus 80 GB de LPDDR5X como de sus ~190 TOPS, y por eso la Qualcomm AI250 apuesta por computación near-memory con 10× de ancho de banda efectivo.
TOPS por vatio: la métrica que separa generaciones
La eficiencia energética es lo que ha permitido bajar la IA del datacenter al bolsillo. Una Hailo-10H entrega ~13 TOPS por vatio; una Axelera Metis, ~24; una GPU de sobremesa de hace unos años, menos de 1. Para una empresa, TOPS/vatio se traduce directamente en coste de operación: más inferencia por cada euro de factura eléctrica. Es la métrica sobre la que NAiOS Labs está diseñando su unidad NPU en formato rack para datacenters propios.
Referencias 2026: cuántos TOPS tiene cada cosa
| Hardware | TOPS (INT8) | Consumo | Clase |
|---|---|---|---|
| Móvil de gama alta | 35–45 | <5 W | NPU integrada en el SoC |
| Portátil "AI PC" (Copilot+ exige 40) | 40–50 | ~10 W | NPU integrada |
| Hailo-10H | 40 | ~3 W | módulo edge M.2/USB |
| Tiiny AI Pocket Lab | ~190 | ~30 W (TDP) | mini-PC de bolsillo |
| Axelera Metis | 214 | 3,5–9 W | aceleradora M.2/PCIe |
| NVIDIA Jetson AGX Orin | 275 | 15–60 W | módulo embedded |
| Qualcomm AI200/AI250 | escala rack | hasta 160 kW/rack | datacenter |
¿Cuántos TOPS necesita tu caso de uso?
- Transcripción de voz y visión básica (cámaras, OCR): 5–15 TOPS bastan; es terreno de NPUs integradas y módulos edge.
- Asistente con LLM pequeño (7B cuantizado), RAG documental: 40+ TOPS y, sobre todo, 8–16 GB de memoria para el modelo.
- Visión industrial a velocidad de línea: 100–200 TOPS con latencia garantizada (Metis, Jetson).
- LLMs medianos-grandes en local (30B–120B): la memoria manda — 48–80 GB o más; los ~190 TOPS del Pocket Lab acompañan, pero sin sus 80 GB no habría caso.
- Inferencia generativa multiusuario (decenas de usuarios simultáneos): escala rack — ya no se cuentan TOPS por chip sino tokens por segundo por rack y por vatio.
La regla práctica para elegir hardware son tres preguntas juntas: ¿puede con el modelo (TOPS)? ¿cabe el modelo (memoria)? ¿a qué coste (TOPS/vatio)? Tienes el panorama completo de unidades en la entrada NPU y el análisis en nuestro post del blog.