Audioproduktion

Gesang isolieren und Karaoke-Tracks online erstellen

Ein Browser kann mittig platzierten Gesang mit Arithmetik statt mit einem Modell für maschinelles Lernen aus einem Stereo-Mix entfernen. Bei manchen Platten klappt das weit besser als bei anderen, und es hilft, vorher zu wissen, bei welchen.

Wie die Auslöschung des Mittenkanals funktioniert

Stereo sind zwei Kanäle. Alles, was im Mix genau in der Mitte liegt, also links und rechts identisch platziert wurde, erscheint in beiden Kanälen als dasselbe Signal. Ziehen Sie einen Kanal vom anderen ab, löscht sich identischer Inhalt auf null aus, und übrig bleibt nur, was sich zwischen beiden unterschied. Dieser Unterschied sind die Seiten des Mixes: die breiten Gitarren, die Stereo-Keyboards, die Hallfahnen.

Das ist schon die ganze Technik. Links minus rechts ergibt das Instrumental, links plus rechts die Mitte. Analoge Hardware macht das seit Jahrzehnten, die Berechnung kostet fast nichts, und man braucht weder ein Modell noch Trainingsdaten noch einen Server. Es hängt allerdings auch vollständig davon ab, dass der Gesang wirklich in der Mitte sitzt.

Warum es bei manchen Aufnahmen gut und bei anderen schlecht funktioniert

Am besten funktioniert es bei älteren und einfach gemischten Aufnahmen: ein Leadgesang genau in der Mitte, trocken oder fast trocken, mit der Band drumherum verteilt. Nehmen Sie eine Soulplatte aus den Sechzigern oder eine schnörkellose Akustik-Session, und die Stimme kann fast vollständig verschwinden.

Moderner Pop ist deutlich schwieriger. Produzenten verbreitern routinemäßig den Gesangsbus, doppeln die Leadstimme und verteilen die Kopien im Panorama, oder sie betten die Stimme in einen breiten Stereohall und ein Delay ein. Nichts davon ist in beiden Kanälen identisch, also löscht sich auch nichts davon aus. Statt Stille bleibt ein geisterhafter Rest der Stimme, und der Hall überlebt meistens, selbst wenn die trockene Stimme größtenteils verschwindet.

Was außer dem Gesang noch verschwindet

Das ist der Teil, vor dem Sie niemand warnt. Die Technik hat keine Ahnung, was eine Stimme ist. Sie entfernt alles, was in der Mitte liegt, und in einem herkömmlichen Mix ist die Mitte dicht besetzt. Die Bassdrum liegt in der Mitte. Die Snare liegt in der Mitte. Der Bass liegt fast ausnahmslos in der Mitte, weil tiefe Frequenzen mittig bleiben, damit der Vinylschnitt und große PA-Anlagen keine Probleme machen. Leadinstrumente und Soli sitzen oft ebenfalls dort.

Ein Track, bei dem einfach nur die Mitte ausgelöscht wurde, kommt deshalb oft mit ausgehöhltem Bassfundament und geschwächtem Schlagzeug an. Dieses Tool schützt den untersten Teil davon: Alles unter etwa 120 Hz, wo Bassdrum und Grundtöne des Basses liegen, bleibt von der Auslöschung ausgenommen. Die Snare, der obere Teil des Basses und jedes mittig platzierte Leadinstrument verschwinden trotzdem mit dem Gesang, und bei manchen Aufnahmen ist das Ergebnis schlicht unbrauchbar, weil das Problem im Mix liegt und nicht im Tool.

Was die beiden Dateien wirklich sind

Hier lohnt sich Klartext, denn die Namen versprechen zu viel. Das Instrumental ist jeder ursprüngliche Kanal, von dem die Mitte oberhalb dieser 120-Hz-Grenze abgezogen wurde. Bei voller Intensität löscht sich mittiger Gesang aus. Regeln Sie die Intensität herunter, bleibt ein Teil der Mitte stehen. Dadurch ist noch etwas Gesang zu hören, der Track klingt aber weniger hohl. Die Wiedergabe in Mono bleibt ein Problem: Ein Handylautsprecher oder eine Mono-PA addiert beide Kanäle, die Seiten löschen sich aus, und bei voller Intensität hören Sie kaum mehr als Bass und Bassdrum. Wenn Sie den Track öffentlich abspielen wollen, prüfen Sie ihn vorher in Mono.

Die zweite Datei ist kein isolierter Gesang. Sie ist die Mitte des Mixes oberhalb von 120 Hz: die Stimme und mit ihr alles andere, was mittig liegt, etwa die Snare oder eine Leadgitarre. Sie ist eine nützliche Referenz, um einen Liedtext herauszuhören oder einer Melodie zu folgen. Eine A-cappella-Spur ist sie nicht, und sie hält nicht stand, wenn Sie sie wie eine behandeln.

Beide Dateien kommen als WAV zurück, sind also groß, und über den Trennmodus können Sie auch nur eine davon anfordern. Die Quelle muss in Stereo vorliegen: Eine Mono-Datei hat keine Seiten, mit denen sich arbeiten ließe, und das Tool sagt das, statt so zu tun, als hätte es etwas getan.

Wofür es wirklich taugt

Grobes Karaoke zu älterem Material. Eine Basslinie oder Gesangsmelodie nach Gehör heraushören. Nachhören, was ein Produzent in die Mitte eines Mixes gelegt hat, und das ist wirklich lehrreich. Ein schneller Begleittrack zum Üben zu Hause.

Wofür es nicht taugt: alles, was erscheinen, verkauft oder veröffentlicht werden soll. Die Artefakte sind auf ordentlichen Lautsprechern hörbar, die Balance stimmt nicht, und das Trennen einer Aufnahme verschafft Ihnen keine Rechte daran, die Sie nicht schon vorher hatten.

Wenn Sie eine echte Trennung brauchen

Modelle zur Quellentrennung wie Demucs und Spleeter erledigen eine wirklich andere Aufgabe. Sie wurden mit großen Mengen Musik trainiert und schätzen jedes Instrument einzeln ab. Deshalb können sie Gesang auch aus einem breiten, halligen modernen Mix holen und Ihnen zusätzlich getrennte Stems für Schlagzeug und Bass liefern. Die Ergebnisse spielen in einer anderen Liga, und für alles, was annähernd professionell sein soll, sind sie die einzig vernünftige Antwort.

Der Preis sind Rechenleistung und Bequemlichkeit. Diese Modelle sind schwergewichtig, deshalb laden die meisten Webdienste, die sie anbieten, Ihr Audio auf einen Server hoch, um sie dort laufen zu lassen, und das ist beim Datenschutz etwas völlig anderes als das, was hier passiert. Demucs auf dem eigenen Rechner laufen zu lassen, bedeutet eine Python-Umgebung und etwas Geduld. Wenn Sie saubere Stems für echte Arbeit brauchen, ist das der richtige Weg. Wenn Sie in zehn Sekunden eine Karaoke-Version einer Platte von 1971 möchten, ohne dass die Datei Ihren Laptop verlässt, reicht Arithmetik.

Nichts wird hochgeladen

Dekodieren, Subtrahieren und das Schreiben der WAV-Datei laufen vollständig in der Seite ab, die Sie geöffnet haben. Ihre Musik erreicht nie einen Server, und das zählt, wenn der Track Ihre eigene unveröffentlichte Aufnahme ist und nicht etwas von einem Streamingdienst. Öffnen Sie in den Entwicklertools Ihres Browsers den Tab „Netzwerk“ und starten Sie eine Trennung: Keine Anfrage enthält das Audio, weil keine solche Anfrage gestellt wird.

Ausprobieren

„Gesang entfernen“ trennt in diesem Tab den Gesang von der Begleitung, ohne etwas hochzuladen.

„Gesang entfernen“ öffnen