NAiOS IconNAiOS Logo
NAiOS Wiki

Inférence locale

También: Inférence locale · Inférence en local · IA on-premise · Exécution locale de modèles

Exécuter des modèles d'IA sur votre propre matériel

1 min de lectura

L'inférence locale consiste à exécuter un modèle d'IA directement sur votre propre matériel — ordinateur, serveur ou appareil mobile — au lieu d'envoyer les requêtes vers le cloud d'un fournisseur externe. Toute la phase de calcul, depuis la saisie d'une entrée jusqu'à l'obtention d'une réponse, se déroule sur votre équipement sans que les données n'en sortent.

Cela importe pour trois raisons principales :

  • Confidentialité : les informations sensibles ne quittent jamais votre machine, ce qui est critique dans des secteurs tels que la santé ou le domaine juridique.
  • Coût : vous évitez de payer pour l'utilisation d'API, ce qui s'avère rentable pour des volumes élevés.
  • Disponibilité : cela fonctionne sans connexion internet et vous ne dépendez pas de la latence ou des interruptions d'un service distant.

En pratique, des outils comme Ollama ou LM Studio permettent d'exécuter des modèles ouverts (par exemple, Llama ou Mistral) sur un ordinateur portable. La nuance réside dans le matériel : les grands modèles exigent beaucoup de mémoire RAM ou VRAM, c'est pourquoi, en local, on a souvent recours à des versions plus petites ou quantifiées.

¿Quieres profundizar?

Lee nuestros artículos sobre IA aplicada en el blog de NAiOS.

Ir al Blog