Els Small Language Models són models de llenguatge amb un nombre reduït de paràmetres, normalment entre uns pocs centenars de milions i uns pocs milers de milions, en comparació amb els centenars de milers de milions dels grans models (LLM). Aquesta escala menor els fa lleugers, ràpids i eficients, capaços d'executar-se en local sobre portàtils, mòbils o dispositius de vora sense dependre de servidors al núvol.
La seva rellevància rau en diversos factors pràctics:
- Privacitat: les dades es poden processar al mateix dispositiu, sense enviar-se a tercers.
- Cost i latència: requereixen menys recursos de còmput i responen amb més rapidesa.
- Sostenibilitat: consumeixen menys energia durant l'entrenament i la inferència.
A canvi, solen oferir un rendiment més limitat en tasques complexes o de coneixement ampli. Per això, molts SLM s'especialitzen o s'afinen per a dominis concrets, on igualen o superen models més grans. Exemples coneguts inclouen les famílies Phi de Microsoft, Gemma de Google o Llama en les seves versions més petites.