NAiOS IconNAiOS Logo
NAiOS Wiki

Clonació de veu

También: Clonació de veu · Síntesi de veu · Voice Synthesis · Clonatge de veu amb IA

Clonar una veu humana amb IA a partir de pocs segons d'àudio

1 min de lectura

El voice cloning (clonació de veu) és una tècnica d'IA que reprodueix les característiques vocals d'una persona —timbre, entonació, ritme— a partir d'una mostra d'àudio molt breu, de vegades de només uns segons. Els models moderns, basats en xarxes neuronals profundes, aprenen la "petjada" sonora de qui parla i poden després sintetitzar qualsevol text amb aquesta mateixa veu.

La seva importància rau en la versatilitat d'aplicacions que habilita:

  • Doblatge i localització de continguts audiovisuals sense recórrer a nous actors.
  • Accessibilitat, recuperant la veu de persones que l'han perduda per malaltia.
  • Assistents i narració personalitzats per a audiollibres o videojocs.

El principal matís és ètic i legal. Com que n'hi ha prou amb una mostra mínima, resulta senzill clonar la veu d'algú sense el seu consentiment, fet que obre la porta a fraus, suplantació d'identitat i desinformació (els anomenats audio deepfakes). Per això, convé exigir l'autorització expressa del titular de la veu i, quan sigui possible, recórrer a sistemes de marcatge o verificació que permetin detectar àudios generats artificialment.

¿Quieres profundizar?

Lee nuestros artículos sobre IA aplicada en el blog de NAiOS.

Ir al Blog