O voice cloning (clonación de voz) é unha técnica de IA que reproduce as características vocais dunha persoa —timbre, entoación, ritmo— a partir dunha mostra de audio moi breve, en ocasións de apenas uns segundos. Os modelos modernos, baseados en redes neuronais profundas, aprenden a "pegada" sonora do falante e poden despois sintetizar calquera texto coa mesma voz.
A súa importancia reside na versatilidade de aplicacións que habilita:
- Dobraxe e localización de contidos audiovisuais sen recorrer a novos actores.
- Accesibilidade, recuperando a voz de persoas que a perderon por enfermidade.
- Asistentes e narración personalizados para audiolibros ou videoxogos.
O principal matiz é ético e legal. Ao bastar cunha mostra mínima, resulta sinxelo clonar a voz de alguén sen o seu consentimento, o que abre a porta a fraudes, suplantación de identidade e desinformación (os chamados audio deepfakes). Por iso, convén esixir autorización expresa do titular da voz e, cando sexa posible, recorrer a sistemas de marcado ou verificación que permitan detectar audios xerados artificialmente.