A inferencia local consiste en executar un modelo de IA directamente no teu propio hardware —ordenador, servidor ou dispositivo móbil— en lugar de enviar as peticións á nube dun provedor externo. Toda a fase de cálculo, desde que introduces unha entrada ata que obtés unha resposta, ocorre no teu equipo sen que os datos saian del.
Isto importa por tres motivos principais:
- Privacidade: a información sensible nunca abandona a túa máquina, algo crítico en sectores como a sanidade ou o ámbito legal.
- Custo: evitas pagar polo uso de API, o que resulta rendible en volumes altos.
- Dispoñibilidade: funciona sen conexión a internet e non dependes da latencia nin das caídas dun servizo remoto.
Na práctica, ferramentas como Ollama ou LM Studio permiten executar modelos abertos (por exemplo, Llama ou Mistral) nun portátil. O matiz é o hardware: os modelos grandes esixen moita memoria RAM ou VRAM, polo que en local adoitase recorrer a versións máis pequenas ou cuantizadas.