NAiOS IconNAiOS Logo
NAiOS Wiki

Inferência local

También: Inferência Local · Inferência em local · IA on-premise · Execução local de modelos

Executar modelos de IA no seu próprio hardware

1 min de lectura

A inferência local consiste em executar um modelo de IA diretamente no seu próprio hardware — computador, servidor ou dispositivo móvel — em vez de enviar os pedidos para a nuvem de um fornecedor externo. Toda a fase de cálculo, desde que introduz uma entrada até obter uma resposta, ocorre no seu equipamento sem que os dados saiam dele.

Isto é importante por três motivos principais:

  • Privacidade: a informação sensível nunca abandona a sua máquina, algo crítico em setores como a saúde ou o âmbito jurídico.
  • Custo: evita pagar pelo uso de API, o que resulta rentável em volumes elevados.
  • Disponibilidade: funciona sem ligação à internet e não depende da latência ou das quebras de um serviço remoto.

Na prática, ferramentas como Ollama ou LM Studio permitem executar modelos abertos (por exemplo, Llama ou Mistral) num portátil. A nuance é o hardware: os modelos grandes exigem muita memória RAM ou VRAM, pelo que, localmente, se costuma recorrer a versões mais pequenas ou quantizadas.

¿Quieres profundizar?

Lee nuestros artículos sobre IA aplicada en el blog de NAiOS.

Ir al Blog