Audiokonvertierung

So extrahieren Sie MP3 aus MP4-Videos, ohne sie hochzuladen

Holen Sie den Ton eines Videos als echtes MP3 heraus, ohne das Video hochzuladen. So funktioniert das, und so viel kostet es Sie.

Zwei verschiedene Vorgänge heißen Audio extrahieren

Der erste ist das Demuxen. Eine Videodatei ist ein Container, der einzelne Spuren enthält, und die Audiospur darin ist bereits etwas Fertiges und Kodiertes, meist AAC. Beim Demuxen wird diese Spur herausgelöst und in eine eigene Datei gelegt, normalerweise eine .m4a. Dabei wird nichts dekodiert und nichts neu kodiert, es dauert also etwa eine Sekunde und geht ohne jeden Verlust.

Der zweite ist Dekodieren und Neukodieren. Die Audiospur wird zurück in rohe Samples dekodiert, und diese Samples gehen an einen neuen Encoder, der ein anderes Format schreibt. Das brauchen Sie, wenn das Ziel einen Codec verlangt, den das Video nicht verwendet hat, und MP3 ist dafür der übliche Grund.

Was dieses Tool genau macht

Es nimmt die gesamte Videodatei, übergibt sie dem Audio-Decoder des Browsers und reicht die dekodierten Samples an LAME weiter, den MP3-Encoder, der in den meisten Desktop-Audioprogrammen steckt. LAME läuft in einem Worker im Hintergrund, damit die Seite währenddessen bedienbar bleibt, und schreibt ein MP3 in Stereo mit 192 kbit/s. Das ist der zweite der beiden oben genannten Vorgänge: Sie laden also eine frisch kodierte MP3-Fassung des Tons herunter, keine Kopie des Audios, das im Video steckte.

Beim ersten Einsatz lädt die Seite den Encoder selbst herunter, etwa 150 KB. Danach läuft die Arbeit auf Ihrem eigenen Prozessor, mehrfach schneller, als das Video auf den meisten Laptops abspielen würde, und langsamer auf einem Smartphone.

Was Sie diese 192 kbit/s kosten

Für die meisten Hörsituationen sehr wenig. Ein MP3 mit 192 kbit/s braucht etwa 1,4 MB pro Minute, eine 45-minütige Vorlesung kommt also auf rund 65 MB statt der 450 MB, die sie als unkomprimiertes Audio bräuchte. MP3 ist allerdings verlustbehaftet. Der Encoder wirft Details weg, von denen er annimmt, dass Sie sie nicht hören, und war die Tonspur des Videos bereits AAC, ist das Ergebnis eine zweite Generation verlustbehafteter Kodierung. Auf gewöhnlichen Kopfhörern fällt das kaum auf. Bei Audio, das Sie noch bearbeiten und erneut exportieren wollen, summiert es sich.

Es gibt auch einen Speicherkostenpunkt. Die gesamte Videodatei wird eingelesen, und das Audio wird vollständig dekodiert und als 32-Bit-Gleitkomma-Samples gehalten, bevor die Kodierung beginnt, weshalb das Tool Dateien auf 100 MB begrenzt. Ein kurzer Clip ist kein Problem. Bei einer langen Aufnahme vom Smartphone ist der Punkt erreicht, an dem ein Browser-Tab aufgibt.

Wann MP3 das falsche Ziel ist

Geht das Audio in einen Editor, ein DAW oder einen Rauschunterdrückungsschritt, ist unkomprimiert die richtige Eingabe, und ein MP3 müsste bei der Ankunft nur wieder dekodiert werden. Eine verlustbehaftete Datei zu bearbeiten und wieder verlustbehaftet zu speichern, verschenkt eine Generation an Qualität ohne jeden Nutzen. Für diese Art von Arbeit behalten Sie die Originalspur des Videos mit der ffmpeg-Stream-Kopie weiter unten und dekodieren sie in Ihrem Editor.

Bei Transkription ist es ähnlich. Whisper und die Tools, die darauf aufbauen, wollen reines PCM und dekodieren ein MP3 ohnehin, bevor sie beginnen, also hilft ein MP3 nur, wenn die Datei vorher noch irgendwohin transportiert werden muss.

Wo es an seine Grenzen stößt

  • Der Browser muss die Datei dekodieren können. Gewöhnliche MP4s mit AAC-Audio sind kein Problem. Ungewöhnliche Codecs, geschützte Dateien und manche MKV- oder AVI-Container schon.
  • Es kommt nur eine Audiospur heraus. Bei einem Film mit mehreren Sprachspuren bekommen Sie die, die der Decoder auswählt, ohne Möglichkeit zu wählen.
  • Es wird nichts geschnitten. Sie bekommen die volle Länge der Aufnahme und schneiden sie danach in einem Editor zu.
  • Die Bitrate ist fest auf 192 kbit/s eingestellt. Es gibt keine Einstellung für eine kleinere oder eine hochwertigere Datei.
  • Keine Tags, keine Kapitelmarken, kein Cover. Nur Samples, sonst nichts.

Wann Sie stattdessen ffmpeg nehmen sollten

Wollen Sie das Original-Audio unangetastet, ist eine Stream-Kopie die ehrliche Antwort. ffmpeg -i video.mp4 -vn -c:a copy audio.m4a auszuführen holt die AAC-Spur direkt aus dem Container. Das dauert etwa eine Sekunde, die Datei ist klein, und das Audio ist bitidentisch mit dem im Video, weil nichts dekodiert wurde und nichts sich verschlechtern konnte.

Für ein MP3 mit mehr Kontrolle steuert ffmpeg denselben LAME-Encoder an und lässt Sie die Qualität festlegen: ffmpeg -i video.mp4 -vn -q:a 2 audio.mp3 schreibt eine Datei mit variabler Bitrate, die meist zwischen 170 und 210 kbit/s landet. Beide Befehle schlagen einen Browser-Tab bei einer langen Datei, und beide brauchen eine Installation. Für einen fünfminütigen Clip, den Sie lieber keinem Fremden geben möchten, ist der Browser der schnellere Weg.

Das Video verlässt Ihren Rechner nie

Es wird nichts hochgeladen, das ist der Punkt der Sache. Mitschnitte von Besprechungen, Interviews, medizinische Beratungen und private Familienvideos sind genau die Dateien, die Sie am wenigsten in der Warteschlange eines fremden Servers sehen wollen, unter einer Aufbewahrungsrichtlinie, die Sie nicht prüfen können. Öffnen Sie den Netzwerk-Tab der Entwicklertools Ihres Browsers und führen Sie eine Extraktion aus. Beim ersten Mal sehen Sie, wie die MP3-Encoder-Bibliothek heruntergeladen wird. Eine Anfrage, die Ihr Video enthält, sehen Sie nicht, weil keine gestellt wird.

Ausprobieren

MP4 zu MP3 verarbeitet Ihre Dateien in diesem Tab und wandelt sie um, ohne etwas hochzuladen.

MP4 zu MP3 öffnen