Os guardrails (ou barreiras de protección) son o conxunto de restricións, filtros e regras que se aplican a un sistema de intelixencia artificial para delimitar o seu comportamento e evitar que xere respostas danosas, ilegais ou inapropiadas. Funcionan como unha capa de control que delimita o que o modelo pode e non pode facer, tanto no que recibe como entrada como no que produce.
A súa importancia reside en que os modelos xerativos non distinguen por si mesmos entre un uso lexítimo e un perigoso. Os guardrails axudan a mitigar riscos como:
- A xeración de contido violento, discriminatorio ou ilegal.
- A filtración de datos sensibles ou persoais.
- Os intentos de manipulación mediante prompt injection ou jailbreaking.
Na práctica, impleméntanse en varios niveis: axustes no adestramento do modelo, filtros sobre as peticións do usuario e validacións sobre as saídas antes de mostralas. Convén lembrar que ningún guardrail é infalible: son unha medida de redución de risco, non unha garantía absoluta, e deben revisarse e actualizarse de forma continua.