El inference time compute (ou cómputo en tempo de inferencia) fai referencia á estratexia de asignar máis recursos de cálculo no momento en que o modelo xera a resposta, en lugar de investilos únicamente na fase de adestramento. A idea de fondo é que un modelo pode «pensar máis» ante unha consulta concreta, dedicando ciclos adicionais a explorar, verificar ou refinar a súa saída antes de entregala.
Este enfoque importa porque permite mellorar a calidade das respostas sen necesidade de readestrar o modelo nin aumentar o seu tamaño. En tarefas de razoamento complexo —matemáticas, lóxica ou programación— adoita compensar máis deixar que o modelo razoe durante máis tempo que escalar os seus parámetros. Algunhas técnicas habituais son:
- Xerar varias solucións e escoller a mellor por votación (self-consistency).
- Despregar cadeas de razoamento extensas paso a paso.
- Usar bucles de verificación e autocorrección.
O matiz práctico é que este cómputo extra ten un custo real: máis latencia e maior gasto por consulta, polo que convén reservalo para problemas que realmente o xustifiquen.