Voice Cloning: Wenn die vertraute Stimme zum Betrugswerkzeug wird
04.10.2026 um 07:28 Uhr, von Anne

- Voice Cloning ermöglicht es, vertraute Stimmen mit KI täuschend echt nachzuahmen und für Betrugsversuche wie den digitalen Enkeltrick oder CEO-Fraud einzusetzen.
- Besonders gefährlich wird die Technik, weil öffentlich verfügbare Sprachaufnahmen aus Social Media, Podcasts oder Videos als Ausgangsmaterial dienen können.
- Für Privatpersonen und Unternehmen gilt deshalb: Eine bekannte Stimme ist kein sicherer Identitätsnachweis, sensible Anfragen sollten immer über einen unabhängigen Kommunikationsweg überprüft werden.
Inhaltsverzeichnis
Ein Anruf von einem Familienmitglied, eine kurze Sprachnachricht des Geschäftsführers oder die Bitte eines langjährigen Geschäftspartners um eine dringende Überweisung: Die Stimme eines Menschen gehört zu den stärksten Identitätssignalen unserer Kommunikation. Genau diese Gewissheit wird durch generative KI zunehmend infrage gestellt.
Beim sogenannten Voice Cloning wird künstliche Intelligenz eingesetzt, um die charakteristischen Merkmale einer Stimme synthetisch nachzubilden. Das Ergebnis kann so überzeugend sein, dass am Telefon oder in einer Sprachnachricht der Eindruck entsteht, tatsächlich mit einer bekannten Person zu sprechen. ENISA warnte bereits davor, dass wenige Sekunden Audiomaterial für eine brauchbare Nachbildung einer Stimme ausreichen können. Das FBI beschreibt inzwischen konkrete Betrugskampagnen, bei denen KI-generierte Stimmen verwendet werden, um sich als bekannte Kontakte oder hochrangige Personen auszugeben.
Damit bekommt eine der ältesten Betrugsmaschen ein technologisches Upgrade. Aus dem klassischen Enkeltrick kann ein Anruf mit der vermeintlich echten Stimme eines Angehörigen werden. Im Unternehmensumfeld wird daraus möglicherweise eine Nachricht des Geschäftsführers, Kunden oder Geschäftspartners. Die entscheidende Veränderung lautet: Eine bekannte Stimme ist kein zuverlässiger Identitätsnachweis mehr.
Was ist Voice Cloning?
Beim Voice Cloning analysiert ein KI-System vorhandene Sprachaufnahmen und versucht daraus typische Eigenschaften einer Stimme abzuleiten. Dazu gehören beispielsweise Klangfarbe, Aussprache, Sprechtempo und andere charakteristische Merkmale. Anschließend kann synthetische Sprache erzeugt werden, die wie die ursprüngliche Person klingt, obwohl diese den jeweiligen Satz niemals gesprochen hat. Die Technologie hat zahlreiche legitime Einsatzmöglichkeiten. Sie kann beispielsweise bei Sprachassistenten, Übersetzungen, Medienproduktionen oder Barrierefreiheit eingesetzt werden. Problematisch wird sie, wenn eine Stimme ohne Zustimmung kopiert und zur Täuschung anderer Menschen verwendet wird. Das BSI warnt ausdrücklich davor, dass Cyberkriminelle KI einsetzen können, um Stimmen anderer Personen am Telefon zu imitieren. Gleichzeitig weist die Behörde darauf hin, dass KI-generierte Imitationen zunehmend schwieriger zu erkennen sind.
Genau deshalb ist Voice Cloning für Social Engineering so interessant. Der Angreifer muss nicht mehr nur behaupten, eine bestimmte Person zu sein. Er kann versuchen, wie diese Person zu klingen.
Der digitale Enkeltrick
Der klassische Enkeltrick basiert auf einer emotionalen Ausnahmesituation. Ein vermeintlicher Angehöriger befindet sich angeblich in Schwierigkeiten und benötigt dringend Geld. Die Geschichte kann sich um einen Unfall, eine Kaution, eine Krankenhausrechnung oder einen anderen Notfall drehen. Voice Cloning verstärkt genau diesen psychologischen Mechanismus. Statt einer fremden Stimme, die erklärt, ein Angehöriger zu sein, kann die Stimme zumindest oberflächlich tatsächlich wie die Tochter, der Sohn oder ein enger Freund klingen. ENISA beschreibt solche Szenarien bereits in seiner Threat Landscape. Cyberkriminelle können Voice Cloning einsetzen, um Freunde oder Familienmitglieder zu imitieren und Geld zu verlangen. Dokumentiert wurden unter anderem Betrugsversuche, bei denen vermeintliche Angehörige eine Notsituation schilderten.
Auch die aktuellen Zahlen des FBI zeigen, dass KI-gestützte Betrugsformen inzwischen messbare finanzielle Schäden verursachen. Im IC3-Jahresbericht für 2025 wurden mehr als 22.000 Beschwerden mit Bezug zu KI und bereinigte Verluste von über 893 Millionen US-Dollar erfasst. Darunter befinden sich verschiedene Betrugsformen, die Zahlen beziehen sich also ausdrücklich nicht ausschließlich auf Voice Cloning. Für sogenannte Distress Scams, zu denen auch Varianten des Grandparent Scams mit Voice Cloning gehören können, nennt das FBI für 2025 gemeldete Verluste von mehr als fünf Millionen US-Dollar.
Social Media liefert das Ausgangsmaterial
Für die Nachbildung einer Stimme wird Audiomaterial benötigt. Genau davon steht im Internet inzwischen eine enorme Menge zur Verfügung. Instagram Reels, TikTok, YouTube, Podcasts, Webinare, Interviews und LinkedIn-Videos sorgen dafür, dass Menschen ihre Stimme öffentlich zugänglich machen. Bei Unternehmern, Influencern, Moderatoren und anderen Personen mit einer starken digitalen Präsenz können Stunden an Sprachmaterial vorhanden sein. Aus Sicht des Online-Marketings entsteht dadurch ein interessantes Spannungsfeld. Persönliche Sichtbarkeit ist ein wichtiger Bestandteil moderner Markenkommunikation. CEOs treten in Podcasts auf, Mitarbeiter werden zu Corporate Influencern und Experten veröffentlichen Videos auf LinkedIn oder YouTube. Genau diese authentische Kommunikation schafft Vertrauen. Dasselbe Material kann jedoch grundsätzlich auch missbraucht werden.
Die Konsequenz sollte nicht sein, auf Video oder Audio zu verzichten. Unternehmen müssen vielmehr verstehen, dass öffentlich verfügbare Stimmen heute ähnlich wie Bilder oder Logos Teil einer digitalen Identität sind, die kopiert und missbraucht werden kann.
Besonders gefährdet sind Menschen mit hoher digitaler Sichtbarkeit
Voice Cloning bekommt damit eine unmittelbare Verbindung zum Personal Branding. Je stärker eine Person öffentlich kommuniziert, desto mehr Material ist möglicherweise verfügbar. Das betrifft nicht nur Prominente. Geschäftsführer, Marketingverantwortliche, Vertriebsexperten, Influencer, Podcaster, YouTuber und öffentlich auftretende Mitarbeiter können ebenfalls umfangreiche digitale Spuren hinterlassen.
Die Situation ähnelt damit dem bereits bekannten Missbrauch von Markenlogos oder Bildern. Ein Unternehmen investiert jahrelang in Bekanntheit und Vertrauen. Betrüger versuchen anschließend, genau dieses Vertrauen für ihre eigenen Zwecke zu verwenden. Im Zusammenhang mit Deepfakes lässt sich diese Entwicklung bereits beobachten. Europol berichtet beispielsweise von betrügerischen Werbekampagnen, die bekannte Medien, Prominente und Politiker imitieren und dabei teilweise Deepfake-Technologien einsetzen. Voice Cloning erweitert diese Möglichkeit um eine besonders persönliche Ebene.
Ein Logo kann kopiert werden. Ein Gesicht kann manipuliert werden. Jetzt kann auch die Stimme einer Marke oder Person synthetisch nachgebildet werden.
Vom Enkeltrick zum CEO-Fraud
Für Unternehmen ist vor allem die Übertragung des Prinzips auf geschäftliche Kommunikation relevant. Der klassische CEO-Fraud basiert darauf, dass sich ein Angreifer als Führungskraft ausgibt und einen Mitarbeiter beispielsweise zu einer dringenden Überweisung bewegt. Voice Cloning kann diese Geschichte wesentlich glaubwürdiger machen. Statt einer ungewöhnlichen E-Mail könnte ein Mitarbeiter einen Anruf erhalten. Die Stimme klingt wie der Geschäftsführer. Der vermeintliche Chef kennt möglicherweise sogar Namen, Projekte oder Geschäftspartner und erklärt, eine vertrauliche Transaktion müsse noch heute durchgeführt werden. Dass dieses Szenario nicht rein theoretisch ist, zeigt ENISA anhand eines bereits 2019 bekannt gewordenen Falls. Damals wurde die Stimme eines CEOs imitiert und ein Mitarbeiter beziehungsweise Manager eines Unternehmens zu einer Überweisung von 243.000 US-Dollar bewegt. ENISA erwartete schon damals eine Zunahme vergleichbarer Angriffe.
Der FBI-Jahresbericht für 2025 nennt Voice Cloning inzwischen ausdrücklich als mögliches Werkzeug für Business Email Compromise und vergleichbare Betrugsszenarien. Unternehmen meldeten demnach 2025 mehr als 30 Millionen US-Dollar Verluste durch BEC-Betrugsfälle mit KI-Bezug. Auch hier gilt: Nicht sämtliche dieser Schäden entstanden durch Voice Cloning.
Warum Marketingabteilungen besonders aufmerksam sein sollten
Auf den ersten Blick klingt CEO-Fraud nach einem Thema für Buchhaltung und IT-Security. Für Marketingabteilungen ist die Entwicklung jedoch ebenfalls relevant. Marketingteams kommunizieren regelmäßig mit Agenturen, Freelancern, Influencern, Plattformen, Medienpartnern und Kunden. Gleichzeitig verwalten sie häufig erhebliche Budgets und besitzen Zugänge zu Werbekonten, Social-Media-Profilen, Content-Management-Systemen und Analyseplattformen. Hinzu kommt die zunehmende Verwendung von Sprachnachrichten. Gerade bei schnellen Abstimmungen über Messenger oder Collaboration-Tools kann eine kurze Audioaufnahme weniger ungewöhnlich wirken als ein förmlicher Telefonanruf. Ein vermeintlicher Vorgesetzter könnte beispielsweise darum bitten, einer Agentur kurzfristig Zugriff auf ein Werbekonto zu geben. Ein angeblicher Kunde könnte die Freigabe einer Kampagne verlangen. Ein vermeintlicher Geschäftsführer könnte auf die schnelle Zahlung einer Rechnung drängen.
Der finanzielle Schaden muss also nicht mit einer direkten Überweisung beginnen. Auch die Vergabe eines Zugangs oder einer Berechtigung kann das eigentliche Ziel sein.
Voice Cloning und Phishing wachsen zusammen
Besonders wirkungsvoll werden solche Angriffe, wenn mehrere Kommunikationsformen kombiniert werden. Eine personalisierte Phishing-Mail kann zunächst den Kontext herstellen. Anschließend folgt eine Sprachnachricht der vermeintlichen Führungskraft. Eine gefälschte Website oder ein manipuliertes Dokument liefert weitere Informationen. Jeder einzelne Kontakt verstärkt dabei möglicherweise die Glaubwürdigkeit des vorherigen. Das FBI warnte 2025 konkret vor Kampagnen, bei denen hochrangige US-Beamte durch Textnachrichten und KI-generierte Sprachnachrichten imitiert wurden. Ziel war es zunächst, Vertrauen aufzubauen und anschließend Zugang zu persönlichen Konten zu erhalten. Die Behörde weist darauf hin, dass KI-generierte Stimmen inzwischen nahezu identisch zu bekannten Stimmen klingen können. Im Dezember 2025 erneuerte das FBI diese Warnung und empfahl ausdrücklich, die Identität über unabhängig recherchierte Kontaktdaten zu überprüfen.
Das zeigt einen wichtigen Unterschied zum klassischen Betrugsanruf: Die Stimme muss nicht unbedingt sofort nach Geld fragen. Sie kann zunächst lediglich dazu dienen, Vertrauen für den nächsten Schritt aufzubauen.
KI macht Social Engineering multimedial
Betrug sollte deshalb nicht mehr getrennt nach E-Mail, Telefon und Video betrachtet werden. Generative KI verbindet diese Formate zunehmend miteinander. Ein Angreifer kann theoretisch einen überzeugenden Text erstellen, eine passende Stimme synthetisieren und dazu Bilder oder Videos erzeugen. Öffentlich verfügbare Informationen liefern den notwendigen Kontext. Dadurch entsteht eine konsistente digitale Identität, obwohl die vermeintliche Person an keiner Stelle tatsächlich beteiligt ist. ENISA dokumentiert inzwischen auch den Einsatz KI-gestützter Stimmen bei Desinformations- und Impersonationskampagnen. Im Threat Landscape 2025 beschreibt die Behörde beispielsweise den Einsatz von Voice Cloning zur Steigerung der Glaubwürdigkeit manipulierter Videos, darunter 2025 auch die geklonte Stimme eines EU-Offiziellen.
Damit verschwimmen die Grenzen zwischen Voice Cloning, Deepfakes, Phishing und klassischem Social Engineering.
„Ich habe seine Stimme erkannt“ reicht nicht mehr
Die größte Veränderung betrifft deshalb weniger die Technologie als unser Vertrauen in Kommunikation. Menschen sind daran gewöhnt, eine bekannte Stimme als starken Identitätsbeweis zu betrachten. Wenn ein langjähriger Kollege anruft, wird normalerweise nicht bei jedem Gespräch überprüft, ob tatsächlich diese Person am anderen Ende sitzt. Voice Cloning schwächt genau dieses Signal. Das bedeutet nicht, dass künftig jeder Telefonanruf verdächtig ist. Unternehmen und Privatpersonen sollten allerdings für ungewöhnliche Handlungen andere Maßstäbe anlegen als für gewöhnliche Kommunikation. Ein Gespräch über den nächsten Urlaub erfordert keine Identitätsprüfung. Eine kurzfristige Änderung einer Bankverbindung möglicherweise schon. Die entscheidende Frage lautet deshalb nicht: Klingt die Stimme echt?
Sondern: Passt die verlangte Handlung zum üblichen Prozess und kann ich sie unabhängig bestätigen?
Wie lässt sich ein geklonter Anruf erkennen?
Es gibt weiterhin technische und sprachliche Auffälligkeiten, die auf synthetische Stimmen hindeuten können. Das FBI nennt unter anderem ungewöhnliche Verzögerungen sowie Abweichungen bei Tonfall und Wortwahl als mögliche Hinweise. Gleichzeitig warnt die Behörde ausdrücklich davor, dass moderne KI-generierte Stimmen nahezu identisch zu echten Kontakten klingen können. Genau deshalb sollte die Erkennung nicht ausschließlich auf akustischen Fehlern beruhen. Ein ungewöhnliches Sprechtempo, merkwürdige Betonung oder unpassende Formulierungen können Verdacht auslösen. Das Fehlen solcher Auffälligkeiten beweist jedoch nicht, dass eine Stimme echt ist.
Ähnlich wie bei KI-generiertem Phishing verschiebt sich die Sicherheitsstrategie damit von der Erkennung der Fälschung zur Verifikation der Identität.
Rückruf statt Stimmvergleich
Eine der wirkungsvollsten Maßnahmen ist überraschend einfach. Bei ungewöhnlichen Geldforderungen oder sensiblen Anfragen sollte das Gespräch beendet und die betreffende Person über eine bereits bekannte Telefonnummer zurückgerufen werden. Wichtig ist dabei, nicht einfach eine Nummer zu verwenden, die während des verdächtigen Kontakts mitgeteilt wurde. Die Kontaktdaten sollten bereits bekannt sein oder unabhängig recherchiert werden. Genau dieses Vorgehen empfiehlt auch das FBI bei möglichen Impersonationsangriffen. Im privaten Umfeld können Familien zusätzlich ein persönliches Kennwort oder eine Frage vereinbaren, deren Antwort nicht öffentlich bekannt ist. In Unternehmen ist ein standardisierter Freigabeprozess meist die robustere Lösung.
Eine hohe Überweisung sollte nicht deshalb möglich sein, weil eine Stimme überzeugend klingt.
Unternehmen brauchen Prozesse, die auch gegen perfekte Fälschungen funktionieren
Voice Cloning zeigt besonders deutlich, warum Cybersecurity nicht ausschließlich auf das Erkennen schlechter Fälschungen setzen sollte. Ein guter Sicherheitsprozess muss auch dann funktionieren, wenn der Angriff perfekt aussieht und perfekt klingt. Änderungen von Bankverbindungen, größere Zahlungen, neue Administratorrechte, Passwort-Resets oder die Herausgabe vertraulicher Daten sollten deshalb klar definierte Freigabewege besitzen. Bei besonders sensiblen Vorgängen können beispielsweise zwei Personen beteiligt werden. Dadurch verliert die Qualität des Deepfakes an Bedeutung. Selbst wenn die Stimme des Geschäftsführers perfekt kopiert wurde, kann der Angreifer den vorgeschriebenen zweiten Freigabeschritt nicht automatisch umgehen.
Prozesse werden damit zu einem stärkeren Sicherheitsmerkmal als Wahrnehmung.
Voice Cloning wird auch zum Markenrisiko
Für Online-Marketing entsteht darüber hinaus ein Problem, das über direkten Betrug hinausgeht. Stimmen werden zunehmend Teil einer Markenidentität. Podcasts, Videos, Social-Media-Formate und virtuelle Events schaffen Wiedererkennung. Manche CEOs oder Unternehmensgründer sind eng mit der Marke verbunden und verfügen über eine charakteristische öffentliche Stimme. Wird diese Stimme für Fake-Werbung, betrügerische Investmentangebote oder gefälschte Statements verwendet, kann daraus ein Reputationsproblem entstehen. Nutzer unterscheiden möglicherweise nicht unmittelbar zwischen echter und gefälschter Kommunikation. Brand Monitoring sollte deshalb langfristig nicht nur Logos, Domains und Social-Media-Profile berücksichtigen. Auch synthetische Audio- und Videoinhalte können Bestandteil von Markenmissbrauch werden.
Das gilt besonders für Unternehmen, deren Führungskräfte oder Experten regelmäßig öffentlich auftreten.
Authentizität wird zum Bestandteil des Marketings
Die Entwicklung führt zu einem grundlegenden Problem digitaler Kommunikation. Viele Elemente, mit denen Marken bislang Vertrauen aufgebaut haben, lassen sich zunehmend synthetisch reproduzieren. Professionelle Texte können generiert werden. Produktbilder können künstlich entstehen. Gesichter können durch Deepfakes manipuliert werden. Stimmen können geklont werden. Damit verliert die reine Qualität eines Mediums an Bedeutung als Vertrauenssignal.
Für Unternehmen wird deshalb wichtiger, Kommunikation über überprüfbare offizielle Kanäle aufzubauen. Klare Domains, verifizierte Profile, konsistente Ansprechpartner und bekannte Kommunikationswege helfen Nutzern und Geschäftspartnern dabei, Aussagen einzuordnen. Eine vertraute Stimme kann kopiert werden. Eine langfristig etablierte und sauber abgesicherte digitale Identität ist wesentlich schwieriger vollständig zu imitieren.
Mein Fazit: Die Stimme ist kein Passwort
Voice Cloning macht einen fundamentalen Schwachpunkt menschlicher Kommunikation sichtbar. Wir vertrauen Stimmen, weil sie bislang schwer zu imitieren waren. Generative KI verändert diese Voraussetzung. Die Technologie kann klassische Betrugsmaschen wie den Enkeltrick überzeugender machen und gleichzeitig neue Varianten im Unternehmensumfeld ermöglichen. Besonders relevant wird das dort, wo vertraute Personen Geld, Zugangsdaten oder außergewöhnliche Handlungen verlangen. Für Marketing und Unternehmenskommunikation kommt eine weitere Dimension hinzu. Je stärker Menschen öffentlich als Gesicht und Stimme einer Marke auftreten, desto wichtiger wird der Schutz ihrer digitalen Identität. Die Konsequenz sollte nicht weniger persönliche Kommunikation sein. Sie sollte bessere Verifikation sein.
Denn im Zeitalter von Voice Cloning gilt zunehmend:
Eine Stimme kann Vertrauen schaffen. Identität beweisen kann sie allein nicht mehr.
Quellen:
- ENISA: Threat Landscape 2023 – Voice Cloning, Deepfakes und Social Engineering
- ENISA: Threat Landscape 2025 – KI-gestützte Cyberangriffe und Voice Cloning
- FBI: 2025 IC3 Annual Report – KI-Betrug, Voice Cloning und finanzielle Schäden
- FBI: Warnung vor KI-generierten Stimmen bei Impersonation-Angriffen
- FBI: Erneute Warnung vor Voice Cloning und gefälschten Nachrichten
- BSI: Künstliche Intelligenz – Chancen, Risiken, Deepfakes und Voice Cloning
- Europol: Internationaler Schlag gegen ein großes Netzwerk für Krypto-Betrug




















