Production audio

Isoler la voix et créer des pistes de karaoké en ligne

Un navigateur peut retirer la voix centrée d’un mixage stéréo avec de l’arithmétique plutôt qu’avec un modèle d’apprentissage automatique. Cela marche bien mieux sur certains disques que sur d’autres, et mieux vaut savoir lesquels avant de commencer.

Comment fonctionne l’annulation du canal central

La stéréo, ce sont deux canaux. Tout ce qui est placé pile au centre du mixage, c’est-à-dire réglé exactement de la même façon à gauche et à droite, apparaît comme le même signal dans les deux. Si vous soustrayez un canal de l’autre, le contenu identique s’annule complètement et il ne reste que ce qui différait entre les deux. Cette différence, ce sont les côtés du mixage : les guitares bien écartées, les claviers en stéréo, les queues de réverbération.

C’est toute la technique. Gauche moins droite donne l’instrumental, gauche plus droite donne le centre. Le matériel analogique le fait depuis des décennies, le calcul ne coûte presque rien, et il ne faut ni modèle, ni données d’entraînement, ni serveur. La méthode dépend aussi entièrement d’une voix vraiment placée au centre.

Pourquoi cela marche bien sur certains disques et mal sur d’autres

La méthode donne le meilleur d’elle-même sur les enregistrements anciens et les mixages simples : une voix principale placée bien au milieu, sèche ou presque, avec le groupe réparti autour. Donnez-lui un disque de soul des années soixante ou une session acoustique sans fioritures, et la voix peut disparaître presque entièrement.

La pop moderne est bien plus difficile. Les producteurs élargissent couramment le bus des voix, doublent la voix principale et écartent les copies dans le panoramique, ou plongent la voix dans une réverbération et un delay stéréo très larges. Rien de tout cela n’est identique dans les deux canaux, donc rien ne s’annule. Vous obtenez un fantôme de la voix plutôt que le silence, et la réverbération survit en général, même quand la voix sèche disparaît en grande partie.

Ce qui disparaît en même temps que la voix

C’est ce dont personne ne vous prévient. La technique ne sait absolument pas ce qu’est une voix. Elle retire tout ce qui est au centre, et dans un mixage classique, le centre est très encombré. La grosse caisse est au centre. La caisse claire est au centre. La basse est au centre presque sans exception, parce qu’on garde les basses fréquences au milieu pour ménager la gravure des vinyles et les grosses sonos. Les instruments solistes et les solos s’y trouvent souvent aussi.

Une piste obtenue par simple annulation du centre arrive donc souvent avec le bas du spectre creusé et une batterie affaiblie. Cet outil protège la partie la plus basse : tout ce qui se trouve sous environ 120 Hz, là où vivent la grosse caisse et les fondamentales de la basse, est exclu de l’annulation. La caisse claire, la partie haute de la basse et tout instrument soliste placé au centre partent quand même avec la voix, et sur certains disques le résultat est tout simplement inutilisable, parce que le problème vient du mixage et non de l’outil.

Ce que sont vraiment les deux fichiers

Autant être franc, car leurs noms en promettent trop. L’instrumental, c’est chaque canal d’origine dont on a soustrait le centre, au-dessus de cette limite de 120 Hz. À pleine intensité, une voix centrée s’annule. Baissez le curseur d’intensité et une partie du centre reste, ce qui laisse un peu de voix mais rend la piste moins creuse. La lecture en mono reste un problème : un haut-parleur de téléphone ou une sono mono additionne les deux canaux, les côtés s’annulent et, à pleine intensité, vous n’entendez guère plus que la basse et la grosse caisse. Si vous comptez passer cette piste en public, écoutez-la d’abord en mono.

Le second fichier n’est pas une voix isolée. C’est le centre du mixage au-dessus de 120 Hz : la voix, et avec elle tout ce qui est au centre, comme la caisse claire ou une guitare solo. C’est une référence utile pour déchiffrer des paroles ou suivre une mélodie. Ce n’est pas une version a cappella, et il ne tiendra pas la route si vous le traitez comme tel.

Les deux fichiers sortent en WAV, donc ils sont volumineux, et le mode de séparation permet de n’en demander qu’un seul. La source doit être en stéréo : un fichier mono n’a pas de côtés sur lesquels travailler, et l’outil vous le dit au lieu de faire semblant d’avoir fait quelque chose.

À quoi cela sert vraiment

Un karaoké approximatif sur des titres anciens. Relever à l’oreille une ligne de basse ou une mélodie de chant. Écouter ce qu’un producteur a placé au centre d’un mixage, ce qui est vraiment instructif. Une piste d’accompagnement vite faite pour s’entraîner à la maison.

Ce à quoi cela ne sert pas : tout ce qui est destiné à sortir, à être vendu ou publié. Les artefacts s’entendent sur une paire d’enceintes correctes, l’équilibre n’est pas bon, et séparer un enregistrement ne vous donne sur lui aucun droit que vous n’aviez pas déjà.

Quand il faut une vraie séparation

Les modèles de séparation de sources comme Demucs et Spleeter font un travail vraiment différent. Entraînés sur de grandes quantités de musique, ils estiment chaque instrument séparément. Ils peuvent donc extraire une voix d’un mixage moderne, large et chargé en réverbération, et vous fournir aussi des stems séparés de batterie et de basse. Les résultats ne jouent pas dans la même catégorie, et pour tout travail qui approche du niveau professionnel, ils sont la seule option raisonnable.

Le prix à payer se compte en puissance de calcul et en commodité. Ces modèles sont lourds, et la plupart des services web qui les proposent envoient donc votre audio sur un serveur pour les faire tourner, ce qui, en matière de confidentialité, n’a rien à voir avec ce qui se passe ici. Faire tourner Demucs sur votre propre machine demande un environnement Python et un peu de patience. Si vous avez besoin de stems propres pour un vrai travail, c’est la voie à suivre. Si vous voulez une version karaoké d’un disque de 1971 en dix secondes sans que le fichier quitte votre ordinateur portable, l’arithmétique suffit.

Rien n’est envoyé

Le décodage, la soustraction et l’écriture du WAV se font tous dans la page que vous avez ouverte. Votre musique n’atteint jamais un serveur, ce qui compte si le morceau est un enregistrement à vous, pas encore sorti, plutôt qu’un titre venu d’un service de streaming. Ouvrez l’onglet Réseau dans les outils de développement de votre navigateur et lancez une séparation : aucune requête ne transporte l’audio, puisqu’aucune requête de ce genre n’est émise.

Essayez

« Suppression de voix » sépare la voix de l’accompagnement dans cet onglet, sans rien envoyer.

Ouvrir « Suppression de voix »