NAiOS IconNAiOS Logo
NAiOS Wiki

Stimmenklonen

También: Sprachklonen · Sprachsynthese · Voice Synthesis · KI-Sprachklonen

Eine menschliche Stimme mit KI aus nur wenigen Sekunden Audio klonen

1 min de lectura

Voice Cloning (Stimmenklonen) ist eine KI-Technik, die die stimmlichen Merkmale einer Person – Klangfarbe, Intonation, Rhythmus – auf der Grundlage einer sehr kurzen Audioprobe reproduziert, manchmal von nur wenigen Sekunden. Moderne Modelle, die auf tiefen neuronalen Netzen basieren, erlernen den klanglichen „Fingerabdruck“ der sprechenden Person und können anschließend beliebigen Text mit derselben Stimme synthetisieren.

Ihre Bedeutung liegt in der Vielseitigkeit der Anwendungen, die sie ermöglicht:

  • Synchronisation und Lokalisierung von audiovisuellen Inhalten, ohne auf neue Schauspielende zurückgreifen zu müssen.
  • Barrierefreiheit, indem die Stimme von Personen wiederhergestellt wird, die diese aufgrund einer Erkrankung verloren haben.
  • Personalisierte Assistenzsysteme und Narration für Hörbücher oder Videospiele.

Der entscheidende Aspekt ist ethischer und rechtlicher Natur. Da eine minimale Probe ausreicht, ist es einfach, die Stimme von jemandem ohne deren Zustimmung zu klonen, was Tür und Tor für Betrug, Identitätsdiebstahl und Desinformation (sogenannte Audio-Deepfakes) öffnet. Daher ist es ratsam, die ausdrückliche Genehmigung der inhabenden Person der Stimme einzuholen und, wann immer möglich, auf Markierungs- oder Verifizierungssysteme zurückzugreifen, die die Erkennung künstlich erzeugter Audios ermöglichen.

¿Quieres profundizar?

Lee nuestros artículos sobre IA aplicada en el blog de NAiOS.

Ir al Blog