L'inference time compute (ou calcul au moment de l'inférence) fait référence à la stratégie consistant à allouer davantage de ressources de calcul au moment où le modèle génère la réponse, plutôt que de les investir uniquement dans la phase d'entraînement. L'idée de fond est qu'un modèle peut « réfléchir davantage » face à une requête concrète, en consacrant des cycles supplémentaires à explorer, vérifier ou affiner sa sortie avant de la livrer.
Cette approche est importante car elle permet d'améliorer la qualité des réponses sans avoir besoin de réentraîner le modèle ni d'augmenter sa taille. Dans les tâches de raisonnement complexe — mathématiques, logique ou programmation — il est souvent plus rentable de laisser le modèle raisonner plus longtemps que d'augmenter l'échelle de ses paramètres. Certaines techniques habituelles sont :
- Générer plusieurs solutions et choisir la meilleure par vote (self-consistency).
- Déployer des chaînes de raisonnement étendues étape par étape.
- Utiliser des boucles de vérification et d'autocorrection.
La nuance pratique est que ce calcul supplémentaire a un coût réel : plus de latence et une dépense accrue par requête, il convient donc de le réserver aux problèmes qui le justifient réellement.