A inferência local consiste em executar um modelo de IA diretamente no seu próprio hardware — computador, servidor ou dispositivo móvel — em vez de enviar os pedidos para a nuvem de um fornecedor externo. Toda a fase de cálculo, desde que introduz uma entrada até obter uma resposta, ocorre no seu equipamento sem que os dados saiam dele.
Isto é importante por três motivos principais:
- Privacidade: a informação sensível nunca abandona a sua máquina, algo crítico em setores como a saúde ou o âmbito jurídico.
- Custo: evita pagar pelo uso de API, o que resulta rentável em volumes elevados.
- Disponibilidade: funciona sem ligação à internet e não depende da latência ou das quebras de um serviço remoto.
Na prática, ferramentas como Ollama ou LM Studio permitem executar modelos abertos (por exemplo, Llama ou Mistral) num portátil. A nuance é o hardware: os modelos grandes exigem muita memória RAM ou VRAM, pelo que, localmente, se costuma recorrer a versões mais pequenas ou quantizadas.