El voice cloning (clonació de veu) és una tècnica d'IA que reprodueix les característiques vocals d'una persona —timbre, entonació, ritme— a partir d'una mostra d'àudio molt breu, de vegades de només uns segons. Els models moderns, basats en xarxes neuronals profundes, aprenen la "petjada" sonora de qui parla i poden després sintetitzar qualsevol text amb aquesta mateixa veu.
La seva importància rau en la versatilitat d'aplicacions que habilita:
- Doblatge i localització de continguts audiovisuals sense recórrer a nous actors.
- Accessibilitat, recuperant la veu de persones que l'han perduda per malaltia.
- Assistents i narració personalitzats per a audiollibres o videojocs.
El principal matís és ètic i legal. Com que n'hi ha prou amb una mostra mínima, resulta senzill clonar la veu d'algú sense el seu consentiment, fet que obre la porta a fraus, suplantació d'identitat i desinformació (els anomenats audio deepfakes). Per això, convé exigir l'autorització expressa del titular de la veu i, quan sigui possible, recórrer a sistemes de marcatge o verificació que permetin detectar àudios generats artificialment.