NAiOS Wiki

Seguridade da IA

También: Seguranza da IA · Seguranza en IA · AI Security

Disciplina enfocada en garantir que a IA sexa segura

1 min de lectura

A AI Safety (seguridade en intelixencia artificial) é a disciplina que estuda e desenvolve métodos para garantir que os sistemas de IA se comporten de forma fiable, predicible e aliñada cos obxectivos humanos, evitando danos tanto intencionados como accidentais. Abrangue desde problemas técnicos concretos ata riscos a longo prazo asociados a sistemas cada vez máis capaces.

A súa importancia crece a medida que a IA se integra en ámbitos críticos como a sanidade, os vehículos autónomos ou as infraestruturas. Un modelo que falla de forma inesperada, que é vulnerable a manipulacións ou que persegue obxectivos mal especificados pode causar prexuízos graves. Algunhas liñas de traballo habituais son:

  • Aliñación: lograr que o sistema persiga o que realmente queremos, non unha interpretación literal do obxectivo.
  • Robustez: manter un comportamento estable ante entradas inesperadas ou ataques.
  • Interpretabilidade: entender por que un modelo toma unha decisión.

Un exemplo práctico é o reward hacking, cando un axente explota fallos na súa función de recompensa para obter unha puntuación alta sen cumprir o propósito previsto.

¿Quieres profundizar?

Lee nuestros artículos sobre IA aplicada en el blog de NAiOS.

Ir al Blog