NAiOS Wiki

Barreiras de seguridade

También: barandas de seguridade · límites de IA · restricións de IA · controis de seguridade

Restricións e límites que se impoñen á IA para evitar danos

1 min de lectura

Os guardrails (ou barreiras de protección) son o conxunto de restricións, filtros e regras que se aplican a un sistema de intelixencia artificial para delimitar o seu comportamento e evitar que xere respostas danosas, ilegais ou inapropiadas. Funcionan como unha capa de control que delimita o que o modelo pode e non pode facer, tanto no que recibe como entrada como no que produce.

A súa importancia reside en que os modelos xerativos non distinguen por si mesmos entre un uso lexítimo e un perigoso. Os guardrails axudan a mitigar riscos como:

  • A xeración de contido violento, discriminatorio ou ilegal.
  • A filtración de datos sensibles ou persoais.
  • Os intentos de manipulación mediante prompt injection ou jailbreaking.

Na práctica, impleméntanse en varios niveis: axustes no adestramento do modelo, filtros sobre as peticións do usuario e validacións sobre as saídas antes de mostralas. Convén lembrar que ningún guardrail é infalible: son unha medida de redución de risco, non unha garantía absoluta, e deben revisarse e actualizarse de forma continua.

¿Quieres profundizar?

Lee nuestros artículos sobre IA aplicada en el blog de NAiOS.

Ir al Blog