Les guardrails (ou garde-fous) sont l'ensemble des restrictions, filtres et règles appliqués à un système d'intelligence artificielle pour encadrer son comportement et éviter qu'il ne génère des réponses malveillantes, illégales ou inappropriées. Ils fonctionnent comme une couche de contrôle qui délimite ce que le modèle peut et ne peut pas faire, tant au niveau des entrées reçues que des sorties produites.
Leur importance réside dans le fait que les modèles génératifs ne distinguent pas d'eux-mêmes un usage légitime d'un usage dangereux. Les guardrails aident à atténuer des risques tels que :
- La génération de contenu violent, discriminatoire ou illégal.
- La fuite de données sensibles ou personnelles.
- Les tentatives de manipulation par prompt injection ou jailbreaking.
En pratique, ils sont mis en œuvre à plusieurs niveaux : ajustements lors de l'entraînement du modèle, filtres sur les requêtes de l'utilisateur et validations des sorties avant leur affichage. Il convient de rappeler qu'aucun guardrail n'est infaillible : il s'agit d'une mesure de réduction des risques, et non d'une garantie absolue, et ils doivent être révisés et mis à jour en continu.