NAiOS Wiki

Computación no tempo de inferencia

También: cómputo en inferencia · test-time compute · cómputo en tiempo de inferencia · escalado en inferencia Wait · I should correct my output: the source text is a list of terms · all of which should be translated into Galician. Here is the translation: computación en inferencia · test-time compute · computación en tempo de inferencia · escalado en inferencia

Dedicar máis capacidade de cómputo durante a resposta, non no adestramento

1 min de lectura

El inference time compute (ou cómputo en tempo de inferencia) fai referencia á estratexia de asignar máis recursos de cálculo no momento en que o modelo xera a resposta, en lugar de investilos únicamente na fase de adestramento. A idea de fondo é que un modelo pode «pensar máis» ante unha consulta concreta, dedicando ciclos adicionais a explorar, verificar ou refinar a súa saída antes de entregala.

Este enfoque importa porque permite mellorar a calidade das respostas sen necesidade de readestrar o modelo nin aumentar o seu tamaño. En tarefas de razoamento complexo —matemáticas, lóxica ou programación— adoita compensar máis deixar que o modelo razoe durante máis tempo que escalar os seus parámetros. Algunhas técnicas habituais son:

  • Xerar varias solucións e escoller a mellor por votación (self-consistency).
  • Despregar cadeas de razoamento extensas paso a paso.
  • Usar bucles de verificación e autocorrección.

O matiz práctico é que este cómputo extra ten un custo real: máis latencia e maior gasto por consulta, polo que convén reservalo para problemas que realmente o xustifiquen.

¿Quieres profundizar?

Lee nuestros artículos sobre IA aplicada en el blog de NAiOS.

Ir al Blog