Audio und Sprache

So erstellen Sie KI-Voiceovers für YouTube und Podcasts

Text zu Sprache im Browser ist wirklich nützlich, um ein Skript zu entwerfen und seine Sprechdauer zu messen. Daraus eine Voiceover-Datei zu machen, die Sie veröffentlichen können, ist ein anderes Problem, und es lohnt sich zu verstehen, warum, bevor Sie Ihren Arbeitsablauf darauf aufbauen.

Hinter „Text zu Sprache“ stecken zwei verschiedene Dinge

Der Begriff deckt zwei Technologien ab, die völlig unterschiedlich klingen, und die meiste Verwirrung rund um synthetische Voiceovers beginnt genau hier.

Die erste ist die Sprachsynthese, die in Ihr Betriebssystem eingebaut ist und auf die Webseiten über die Web Speech API zugreifen. Jeder aktuelle Browser stellt sie bereit. Sie ist kostenlos, startet sofort, braucht keinen Download, und die Qualität reicht von ordentlich bis unüberhörbar synthetisch, je nachdem, welche Stimmen auf Ihrem Rechner gerade installiert sind.

Die zweite ist ein neuronales Modell, das aus Text eine Wellenform vorhersagt. Das meinen die Leute, wenn sie von einer KI-Stimme sprechen. Diese Stimme klingt wie ein Mensch, der atmet, und sie läuft entweder auf dem Server von jemand anderem hinter einer kostenpflichtigen API oder als Modelldatei, die so groß ist, dass man sie nicht aus Versehen herunterlädt, sondern nur mit Absicht.

Die Wiedergabe in unserem Tool gehört zur ersten Sorte. Die Stimmenliste stammt nicht von uns. Sie enthält, was Ihr Betriebssystem mitbringt. Deshalb klingt dieselbe Seite unter Windows, macOS, Android und iOS unterschiedlich, und deshalb taucht eine Stimme, die Ihnen ein Kollege empfiehlt, in Ihrem Auswahlmenü womöglich gar nicht auf. Die Regler für Geschwindigkeit und Tonhöhe verändern diese Systemstimme. Sie wechseln nicht die Engine.

Die Einschränkung, die alles entscheidet: Aufnehmen geht nicht

Diesen Teil lassen Artikel über Voiceovers aus dem Browser gern aus. Die Web Speech API gibt einer Seite keine Möglichkeit, ihren eigenen Ton aufzuzeichnen.

Wenn eine Seite speechSynthesis.speak() aufruft, schickt der Browser den Ton direkt an das Ausgabegerät des Systems. Die API liefert keinen Medienstream, keinen Web-Audio-Knoten und keinen Sample-Puffer zurück. Es gibt nichts, woran man einen Rekorder anschließen könnte, und nichts, was sich kodieren ließe. Eine Seite kann die Sprachausgabe starten, pausieren und stoppen. Speichern kann sie sie nicht.

Das hat eine unmissverständliche Folge: Jedes Browser-Tool, das anbietet, eine Web-Speech-Stimme herunterzuladen, gibt Ihnen nicht die Stimme, die Sie gerade gehört haben. Es erzeugt auf anderem Weg Audio und gibt Ihnen stattdessen das.

Der Download-Button auf dieser Website ist keine Ausnahme, und wir sagen das lieber hier, als dass Sie es erst merken, nachdem Sie ein Video auf das Ergebnis geschnitten haben. Die Vorschau spielt die Stimmen Ihres Betriebssystems ab. Der Download schreibt eine WAV-Datei aus einem kleinen Formant-Synthesizer, der in der Seite läuft: eine glottale Quelle, die durch Resonanzfilter geschickt und Buchstabe für Buchstabe zusammengesetzt wird. Das ist echte Signalverarbeitung und keine neuronale Stimme. Behandeln Sie Vorschau und Download als zwei Ausgaben, die nichts miteinander zu tun haben, und hören Sie sich die Datei an, bevor Sie irgendetwas darauf aufbauen.

Wenn Sie genau die Stimme brauchen, die Sie in der Vorschau gehört haben, bleibt nur die Aufnahme außerhalb des Browsers. Unter Windows heißt das meist, in den Soundeinstellungen einen Loopback-Eingang wie Stereomix zu aktivieren. Unter macOS heißt es, ein virtuelles Audiogerät zu installieren und die Systemausgabe in ein Aufnahmeprogramm zu leiten. Beides zeichnet auf, was die Lautsprecher abgespielt hätten, und das ist der einzige Zugang, den überhaupt jemand zu diesen Stimmen hat.

Was Sie laut Lizenz tatsächlich veröffentlichen dürfen

Den Ton aufzunehmen ist eine technische Frage. Ihn zu veröffentlichen ist eine rechtliche, und beides wird ständig vermischt.

Diese Stimmen gehören Microsoft, Apple, Google oder dem Hersteller Ihres Android-Geräts. Sie sind Ihnen als Teil eines Betriebssystems lizenziert, und diese Lizenz regelt die Nutzung Ihres Computers. Sie gibt Ihnen nicht automatisch das Recht, die Ausgabe aufzunehmen und in ein monetarisiertes Video einzubauen. Die Bedingungen unterscheiden sich je nach Hersteller und oft je nach einzelner Stimme, und manche Stimmen sind auf die private Nutzung beschränkt, ohne dass die Oberfläche das je erwähnt. Bevor eine synthetische Lesung in etwas Kommerziellem landet, suchen Sie die Bedingungen für genau die Stimme heraus, die Sie verwendet haben. Kostenpflichtige Text-to-Speech-Dienste verlangen auch deshalb Geld, weil ihre Lizenz diese Frage schriftlich beantwortet.

Die Regeln von YouTube sind ein eigenes Thema und werden oft falsch verstanden. Die Monetarisierungsrichtlinien richten sich gegen massenhaft produzierte, sich wiederholende Inhalte mit wenig eigenem Beitrag, nicht gegen synthetische Sprecherstimmen an sich. Ein gut gemachtes Video wird nicht ausgeschlossen, nur weil es ein synthetisches Voiceover hat. Ein Kanal, der am laufenden Band maschinell vorgelesene Artikel über Stock-Footage legt, hat ein Problem, und ein menschlicher Sprecher würde daran nichts ändern. Die Prüfer fragen, ob das Video etwas beiträgt, nicht, wer die Worte gesprochen hat.

Wo die Sprachausgabe im Browser ihren Platz verdient

Behandeln Sie sie nicht mehr als endgültige Stimme, dann wird sie zu einem richtig guten Werkzeug. Diese Aufgaben erledigt sie gut.

  • Ein Skript timen. Lesezeiten, die aus der Wortzahl geschätzt werden, sind unzuverlässig. Fügen Sie das Skript ein, stellen Sie die Geschwindigkeit ungefähr auf Ihr eigenes Sprechtempo und hören Sie zu. So kennen Sie die echte Dauer, bevor Sie ein Studio buchen oder sich zum Aufnehmen hinsetzen.
  • Sätze finden, die sich nicht vorlesen lassen. Wenn der Synthesizer stolpert, stolpert auch ein Mensch. Lange Nebensätze, Aufzählungen ohne Satzzeichen und Wörter, deren Betonung sich mit der Bedeutung ändert, fallen innerhalb von Sekunden auf.
  • Eine provisorische Tonspur anlegen. Legen Sie eine synthetische Lesung in die Timeline Ihres Schnittprogramms, schneiden Sie das Video darauf und tauschen Sie sie später gegen die echte Aufnahme aus. Die Schnitte passen weiterhin, weil das Tempo schon feststand.
  • Eigene Texte Korrektur lesen. Wenn Sie einen Absatz hören, fallen Ihnen das wiederholte und das fehlende Wort auf, die Ihr Auge beim Lesen unbemerkt zurechtrückt.
  • Die Barrierefreiheit grob prüfen. Wenn Ihr Text verwirrend ist, sobald eine synthetische Stimme ihn vorliest, ist er auch für die Menschen verwirrend, die auf eine solche Stimme angewiesen sind.

Wenn Sie ein Voiceover brauchen, das Sie veröffentlichen können

Nehmen Sie sich selbst auf. Ein einfaches USB-Mikrofon in einem Raum mit Vorhängen, Teppich und Polstermöbeln schlägt jede synthetische Stimme, sobald Persönlichkeit gefragt ist, und die Ausrüstung kostet weniger als ein Jahr der meisten Abos. Was Amateuraufnahmen nach Amateur klingen lässt, ist meistens der Raum, nicht das Mikrofon.

Oder bezahlen Sie einen Text-to-Speech-Dienst. Sie bekommen eine Datei zum Herunterladen, eine Stimme, die auch über Kopfhörer standhält, und eine kommerzielle Lizenz in schriftlicher Form. Für lange Sprechertexte in großer Menge ist das die vernünftige Antwort.

Oder lassen Sie ein neuronales Modell auf Ihrem eigenen Rechner laufen. Mehrere davon funktionieren auf einem gewöhnlichen Computer und erzeugen eine Audiodatei ohne Kosten pro Wort, ohne dass etwas Ihren Schreibtisch verlässt. Sie bezahlen stattdessen mit Zeit für die Einrichtung und mit Speicherplatz.

Unser Tool kommt vor all dem, nicht an dessen Stelle. Es ist der schnellste Weg, zu hören, ob ein Skript laut gelesen funktioniert. Was Sie danach aufnehmen, ist eine eigene Entscheidung, und die sollten Sie bewusst treffen.

Ausprobieren

Text zu Sprache liest Ihren Text in diesem Tab vor und kann ihn als WAV-Datei speichern.

Text zu Sprache öffnen