Extraire l’audio MP3 d’une vidéo MP4 sans l’envoyer
Extrayez le son d’une vidéo sous la forme d’un vrai MP3, sans envoyer la vidéo. Voici comment cela fonctionne, et ce que cela coûte.
Deux travaux différents portent le nom d’extraction audio
Le premier est le démultiplexage (demuxing). Un fichier vidéo est un conteneur qui regroupe des pistes séparées, et la piste audio qu’il contient est déjà quelque chose de fini et encodé, en général de l’AAC. Le demuxing sort cette piste et la place dans son propre fichier, en général un .m4a. Rien n’est décodé, rien n’est réencodé, donc cela prend environ une seconde et ne perd absolument rien.
Le second consiste à décoder puis à réencoder. La piste audio est décodée jusqu’à redevenir des échantillons bruts, et ces échantillons sont envoyés à un nouvel encodeur qui écrit un format différent. Vous en avez besoin quand la destination demande un codec que la vidéo n’utilisait pas, et le MP3 en est la raison la plus courante.
Ce que fait exactement cet outil
Il prend le fichier vidéo entier, le confie au décodeur audio du navigateur, puis transmet les échantillons décodés à LAME, l’encodeur MP3 présent dans la plupart des logiciels audio de bureau. LAME tourne dans un worker en arrière-plan pour que la page reste utilisable pendant qu’il travaille, et il écrit un MP3 stéréo à 192 kbit/s. C’est le second travail décrit plus haut : ce que vous téléchargez est donc un nouvel encodage MP3 de la bande son, et non une copie de l’audio présent dans la vidéo.
La première fois que vous l’utilisez, la page télécharge l’encodeur lui-même, environ 150 Ko. Ensuite, le travail se fait sur votre propre processeur, plusieurs fois plus vite que la vidéo ne se lirait sur la plupart des ordinateurs portables, et plus lentement sur un téléphone.
Ce que vous coûtent ces 192 kbit/s
Très peu, pour la plupart des écoutes. Un MP3 à 192 kbit/s prend environ 1,4 Mo par minute, donc un cours de 45 minutes ressort à environ 65 Mo au lieu des 450 Mo qu’il prendrait en audio non compressé. Le MP3 reste toutefois un format avec perte. L’encodeur écarte des détails qu’il suppose que vous n’entendrez pas, et si la bande son de la vidéo était déjà en AAC, le résultat est une seconde génération de compression avec perte. Sur un casque ordinaire, cela se voit rarement. Sur un audio que vous comptez monter puis réexporter, cela s’accumule.
Il y a aussi un coût en mémoire. Le fichier vidéo entier est lu, et l’audio est décodé en totalité puis conservé sous forme d’échantillons flottants 32 bits avant que l’encodage ne commence, ce qui explique pourquoi l’outil limite les fichiers à 100 Mo. Un court extrait n’est rien. Un long enregistrement fait au téléphone, c’est là qu’un onglet de navigateur finit par céder.
Quand le MP3 n’est pas le bon objectif
Si l’audio part vers un logiciel de montage, un DAW ou une étape de réduction de bruit, l’entrée correcte est le format non compressé, et un MP3 obligerait seulement à le décoder de nouveau à l’arrivée. Monter un fichier avec perte puis l’enregistrer à nouveau en format avec perte gaspille une génération de qualité sans aucun bénéfice. Pour ce genre de travail, conservez la piste d’origine de la vidéo avec la copie de flux ffmpeg ci-dessous, et décodez-la dans votre logiciel de montage.
La transcription fonctionne de façon similaire. Whisper et les outils construits par-dessus veulent du PCM brut et décodent un MP3 avant de commencer, donc un MP3 n’aide que lorsque le fichier doit d’abord voyager quelque part.
Où cet outil montre ses limites
- Le navigateur doit être capable de décoder le fichier. Les MP4 ordinaires avec de l’audio AAC ne posent pas de problème. Les codecs peu courants, les fichiers protégés et certains conteneurs MKV ou AVI, si.
- Une seule piste audio ressort. Un film avec plusieurs pistes de langue vous donne celle que choisit le décodeur, sans possibilité de choisir.
- Rien n’est découpé. Vous obtenez l’enregistrement entier et vous le coupez ensuite dans un logiciel de montage.
- Le débit est fixé à 192 kbit/s. Il n’existe aucun réglage pour un fichier plus petit ou de meilleure qualité.
- Pas de tags, pas de marques de chapitre, pas de pochette. Seulement des échantillons, rien de plus.
Quand utiliser ffmpeg à la place
Si vous voulez l’audio d’origine intact, une copie de flux est la réponse honnête. Exécuter ffmpeg -i video.mp4 -vn -c:a copy audio.m4a sort la piste AAC directement du conteneur. Cela prend environ une seconde, le fichier est petit, et l’audio est identique bit à bit à celui de la vidéo, car rien n’a été décodé et rien n’a pu se dégrader.
Pour un MP3 avec plus de contrôle, ffmpeg pilote le même encodeur LAME et vous laisse fixer la qualité : ffmpeg -i video.mp4 -vn -q:a 2 audio.mp3 écrit un fichier à débit variable qui se situe en général entre 170 et 210 kbit/s. Les deux commandes battent un onglet de navigateur sur un fichier long, et toutes deux demandent une installation. Pour un extrait de cinq minutes que vous préférez ne pas confier à un inconnu, le navigateur est le chemin le plus rapide.
La vidéo ne quitte jamais votre ordinateur
Rien n’est envoyé, et c’est tout l’intérêt. Les enregistrements de réunions, les entretiens, les consultations médicales et les vidéos de famille sont justement les fichiers que vous aimeriez le moins voir attendre dans la file de traitement de quelqu’un d’autre, sous une politique de conservation que vous ne pouvez pas vérifier. Ouvrez l’onglet réseau des outils de développement de votre navigateur et lancez une extraction. La première fois, vous verrez la bibliothèque de l’encodeur MP3 se télécharger. Vous ne verrez aucune requête transportant votre vidéo, parce qu’aucune n’est faite.
MP4 en MP3 traite vos fichiers dans cet onglet et les convertit sans rien envoyer.
Ouvrir MP4 en MP3