Die Macht der Stimme

KI-Stimme: Vertrauen wird zum Parameter

KI Stimme

Ob wir einer Stimme glauben, entscheidet sich in einer halben Sekunde. Die Stimmforschung kann diese Wirkung inzwischen berechnen und in jede synthetische Stimme einbauen. Damit wird Vertrauen zum Parameter im Produkt und zur Aufgabe für Governance, nicht für die Tontechnik.

Ein Anruf beginnt mit „Guten Tag“. Bevor der zweite Satz gesprochen ist, hat das Gehirn des Angerufenen ein Urteil gefällt: vertrauenswürdig oder nicht, dominant oder nicht. Forscher der Universität Glasgow und der Princeton University haben das 2014 mit einem einzigen Wort gezeigt: „hello“, kürzer als eine halbe Sekunde. Die Hörer waren sich in ihren Urteilen erstaunlich einig und diese Urteile ließen sich auf zwei Achsen abbilden: Vertrauen und Dominanz. Der Inhalt eines Gesprächs kommt später, das Urteil steht vorher.

Anzeige

Der Regler existiert bereits

Lange galt das als Kuriosität der Psychologie. Seit 2018 ist es eine Bauanleitung. Ein Team um Jean-Julien Aucouturier und Pascal Belin hat per Umkehrkorrelation herausgearbeitet, welcher Tonhöhenverlauf ein Wort vertrauenswürdig klingen lässt und welcher dominant. Das Ergebnis war eine Kurve mit einer Auflösung unter hundert Millisekunden, stabil über das Geschlecht von Sprecher und Hörer hinweg. Und die Autoren zeigten, dass sich diese Kurve wie ein Filter auf neue Aufnahmen legen lässt. Sie nannten das „soziales Make-up“.

Was damals ein Laborwerkzeug war, ist heute eine API. Eine Stimme zu klonen dauert Minuten. Tonhöhe, Tempo, Wärme, Pausen: alles Schieberegler. Wer heute ein Sprachsystem baut, entscheidet über die Vertrauenswürdigkeit seiner Stimme so beiläufig wie über die Farbe eines Buttons. Nur dass der Button erst wirkt, wenn jemand liest, was darauf steht. Die Stimme wirkt vorher.

Wo Gestaltung endet

Genau hier verschiebt sich das Thema aus dem Tonstudio in die Produkt- und Datenverantwortung. Eine verständliche, ruhige Stimme für den Störungsdienst ist Gestaltung. Eine Stimme, die im Inkasso-Anruf so eingestellt ist, dass Angerufene seltener widersprechen, ist etwas anderes. Der Unterschied liegt nicht in der Technik, es sind dieselben Parameter und dieselbe Software. Er liegt vielmehr im Zweck. Und ein Zweck wird nirgends protokolliert, wenn niemand es verlangt.

Anzeige

Für die IT-Sicherheit hat das Thema eine zweite, härtere Seite. Die Stimme war lange ein Erkennungsmerkmal: Jede Buchhaltung weiß, wie der Chef klingt, jede Hotline, wie die Kollegin aus dem Einkauf klingt. Dieses Merkmal ist wertlos geworden. Geklonte Stimmen von Geschäftsführern, die Überweisungen anweisen, sind kein Szenario mehr, sondern Fallakten. Wer Freigaben noch per Anruf akzeptiert, hat eine Schwachstelle, die keine Firewall schließt.

Der Gesetzgeber hat reagiert, wenn auch grob: Seit August 2026 gilt Artikel 50 der KI-Verordnung. Wer Menschen mit einem KI-System sprechen lässt, muss das offenlegen. Das ist die Untergrenze. Sie sagt nichts darüber aus, wie die Stimme klingen darf, nachdem sie sich offenbart hat.

Newsletter
Newsletter Box

Mit Klick auf den Button "Jetzt Anmelden" stimme ich der Datenschutzerklärung zu.

Was ich selbst gelernt habe

Ich habe meine eigene Stimme klonen lassen. Sie arbeitet unter anderem in meinem Haus in einem Agenten, der Gesprächspartner nach einem Termin anruft und die Kernpunkte des Treffens noch einmal vorträgt. Dafür gelten Regeln, die vor dem ersten Anruf feststanden: Der erste Satz nennt die Maschine als Maschine. Sie fragt nach keinen Daten. Sie bleibt unter drei Minuten. Sie verkauft nichts.

Die wichtigste Erkenntnis daraus: Wer im ersten Satz erfährt, dass eine Maschine spricht, kann den Rest des Anrufs einordnen. Das ist der Unterschied zwischen einer Stimme, die um Vertrauen bittet, und einer, die es sich erschleicht. Das Problem mit einer synthetischen Stimme entsteht, wenn sie so tut, als wäre sie es nicht.

Fünf Regeln für Produkt- und Datenverantwortliche

  1. Ein Stimmregister führen: Welche synthetischen Stimmen sprechen für das Unternehmen, auf wessen Stimme basieren sie, wer hält die Rechte, wer darf sie ändern? Was für Zertifikate selbstverständlich ist, fehlt für Stimmen fast überall.
  2. Stimmparameter zweckgebunden dokumentieren: Verständlichkeit, Ruhe, Tempo: ja. Einstellungen, die Widerspruch senken oder Zustimmung beschleunigen sollen: nur mit schriftlicher Begründung und Freigabe oder gar nicht.
  3. Offenlegung im ersten Satz, nicht im Kleingedruckten: Artikel 50 verlangt die Information; die Stimme selbst sollte sie aussprechen.
  4. Den Weg zum Menschen in einem Satz anbieten: Jede Stimme, die Vertrauen erzeugt, muss auch sagen können: „Ich verbinde Sie mit einer Kollegin.“ Sonst ist das Vertrauen eine Falle.
  5. Die Stimme aus der Authentifizierung streichen: Freigaben, Passwort-Resets, Zahlungsanweisungen brauchen einen zweiten Kanal oder ein vereinbartes Codewort. Wer den Chef am Telefon erkennt, erkennt inzwischen auch seinen Klon.

Vertrauen als Bilanzposten

Unternehmen haben Milliarden in Rechenleistung investiert. Ob diese Leistung angenommen wird, entscheidet sich an einer Stelle, die in keiner Architekturskizze auftaucht: in der halben Sekunde zwischen „Guten Tag“ und dem ersten Satz. Wer die Stimme seiner Systeme als technisches Detail behandelt, hat dort den wertvollsten Parameter des Produkts unbesetzt gelassen. Wer sie als Manipulationswerkzeug einsetzt, verbrennt Vertrauen, das keine Software zurückholt. Dazwischen liegt die Arbeit, die jetzt ansteht und s

Christopher Peterka

Christopher

Peterka

CEO

gannaca

Anzeige

Weitere Artikel

Newsletter
Newsletter Box

Mit Klick auf den Button "Jetzt Anmelden" stimme ich der Datenschutzerklärung zu.