O voice cloning (clonagem de voz) é uma técnica de IA que reproduz as características vocais de uma pessoa —timbre, entonação, ritmo— a partir de uma amostra de áudio muito breve, por vezes de apenas alguns segundos. Os modelos modernos, baseados em redes neuronais profundas, aprendem a "pegada" sonora do locutor e podem depois sintetizar qualquer texto com essa mesma voz.
A sua importância reside na versatilidade de aplicações que permite:
- Dobragem e localização de conteúdos audiovisuais sem recorrer a novos atores.
- Acessibilidade, recuperando a voz de pessoas que a perderam devido a doença.
- Assistentes e narração personalizados para audiolivros ou videojogos.
A principal nuance é ética e legal. Como basta uma amostra mínima, torna-se simples clonar a voz de alguém sem o seu consentimento, o que abre a porta a fraudes, usurpação de identidade e desinformação (os chamados audio deepfakes). Por isso, convém exigir autorização expressa do titular da voz e, quando possível, recorrer a sistemas de marcação ou verificação que permitam detetar áudios gerados artificialmente.