Os Small Language Models são modelos de linguagem com um número reduzido de parâmetros, normalmente entre algumas centenas de milhões e alguns milhares de milhões, face às centenas de milhares de milhões dos grandes modelos (LLM). Esta menor escala torna-os leves, rápidos e eficientes, capazes de serem executados localmente em computadores portáteis, telemóveis ou dispositivos edge sem depender de servidores na nuvem.
A sua relevância reside em vários fatores práticos:
- Privacidade: os dados podem ser processados no próprio dispositivo, sem serem enviados para terceiros.
- Custo e latência: requerem menos recursos de computação e respondem com maior rapidez.
- Sustentabilidade: consomem menos energia durante o treino e a inferência.
Em contrapartida, costumam oferecer um desempenho mais limitado em tarefas complexas ou de conhecimento abrangente. Por isso, muitos SLM especializam-se ou são ajustados para domínios concretos, onde igualam ou superam modelos maiores. Exemplos conhecidos incluem as famílias Phi da Microsoft, Gemma da Google ou Llama nas suas versões mais pequenas.