NAiOS Wiki

Clonación de voz

También: Clonación de voz · Síntesis de voz · Voice Synthesis · Clonado de voz con IA

Clonar unha voz humana con IA a partir de poucos segundos de audio

1 min de lectura

O voice cloning (clonación de voz) é unha técnica de IA que reproduce as características vocais dunha persoa —timbre, entoación, ritmo— a partir dunha mostra de audio moi breve, en ocasións de apenas uns segundos. Os modelos modernos, baseados en redes neuronais profundas, aprenden a "pegada" sonora do falante e poden despois sintetizar calquera texto coa mesma voz.

A súa importancia reside na versatilidade de aplicacións que habilita:

  • Dobraxe e localización de contidos audiovisuais sen recorrer a novos actores.
  • Accesibilidade, recuperando a voz de persoas que a perderon por enfermidade.
  • Asistentes e narración personalizados para audiolibros ou videoxogos.

O principal matiz é ético e legal. Ao bastar cunha mostra mínima, resulta sinxelo clonar a voz de alguén sen o seu consentimento, o que abre a porta a fraudes, suplantación de identidade e desinformación (os chamados audio deepfakes). Por iso, convén esixir autorización expresa do titular da voz e, cando sexa posible, recorrer a sistemas de marcado ou verificación que permitan detectar audios xerados artificialmente.

¿Quieres profundizar?

Lee nuestros artículos sobre IA aplicada en el blog de NAiOS.

Ir al Blog