Comment créer une voix off IA pour YouTube et les podcasts
La synthèse vocale du navigateur est vraiment utile pour rédiger un script et en mesurer la durée. En tirer un fichier de voix off publiable est un autre problème, et mieux vaut comprendre pourquoi avant d’organiser votre façon de travailler autour d’elle.
Deux choses différentes qu’on appelle synthèse vocale
Le terme recouvre deux technologies qui ne sonnent pas du tout pareil, et l’essentiel de la confusion autour des voix off synthétiques commence précisément là.
La première est le synthétiseur vocal intégré à votre système d’exploitation, auquel les pages web accèdent par la Web Speech API. Tous les navigateurs actuels y donnent accès. Il est gratuit, démarre instantanément, ne demande aucun téléchargement, et la qualité va de correcte à franchement synthétique selon les voix qui se trouvent installées sur votre machine.
La seconde est un modèle neuronal qui prédit une forme d’onde à partir du texte. C’est ce que les gens entendent par voix IA. C’est celle qui sonne comme une personne qui respire, et elle tourne soit sur le serveur de quelqu’un d’autre, derrière une API payante, soit sous la forme d’un fichier de modèle si volumineux que le télécharger relève d’une décision délibérée et non d’un accident.
La lecture de notre outil relève du premier type. La liste des voix ne vient pas de nous. C’est celle que fournit votre système d’exploitation, ce qui explique que la même page sonne différemment sous Windows, macOS, Android et iOS, et qu’une voix recommandée par un collègue puisse tout simplement ne pas apparaître dans votre liste déroulante. Les curseurs de vitesse et de hauteur règlent cette voix système. Ils ne changent pas de moteur.
La limite qui décide de tout : impossible de l’enregistrer
Voici la partie que les articles sur les voix off dans le navigateur ont tendance à passer sous silence. La Web Speech API ne donne à une page aucun moyen de capturer son propre son.
Quand une page appelle speechSynthesis.speak(), le navigateur envoie le son directement vers le périphérique de sortie du système. L’API ne renvoie ni flux multimédia, ni nœud Web Audio, ni tampon d’échantillons. Il n’y a rien à relier à un enregistreur et rien à encoder. Une page peut lancer la parole, la mettre en pause et l’arrêter. Elle ne peut pas l’enregistrer.
La conséquence est sans appel : tout outil de navigateur qui propose de télécharger une voix Web Speech ne vous donne pas la voix que vous venez d’entendre. Il produit du son par un autre moyen et vous remet ce son-là à la place.
Le bouton de téléchargement de ce site ne fait pas exception, et nous préférons le dire ici plutôt que de vous laisser le découvrir après avoir monté une vidéo sur le résultat. L’aperçu lit les voix de votre système d’exploitation. Le téléchargement écrit un fichier WAV produit par un petit synthétiseur à formants qui tourne dans la page : une source glottale passée dans des filtres résonants et assemblée lettre par lettre. C’est un vrai traitement du signal, et ce n’est pas une voix neuronale. Considérez l’aperçu et le téléchargement comme deux sorties sans rapport entre elles, et écoutez le fichier avant de prévoir quoi que ce soit autour.
Si vous avez besoin exactement de la voix entendue dans l’aperçu, la seule solution est de l’enregistrer en dehors du navigateur. Sous Windows, cela passe généralement par l’activation d’une entrée de bouclage comme Mixage stéréo dans les paramètres de son. Sous macOS, il faut installer un périphérique audio virtuel et envoyer la sortie du système vers un enregistreur. Dans les deux cas, on capture ce que les haut-parleurs auraient diffusé, et c’est le seul accès que quiconque ait à ces voix.
Ce que la licence vous autorise vraiment à publier
Enregistrer le son est une question technique. Le publier est une question juridique, et les deux sont confondues en permanence.
Ces voix appartiennent à Microsoft, Apple, Google ou au fabricant de votre appareil Android. Elles vous sont concédées sous licence avec un système d’exploitation, et cette licence porte sur l’utilisation de votre ordinateur. Elle ne vous donne pas automatiquement le droit d’enregistrer ce qu’elles produisent et de le mettre dans une vidéo monétisée. Les conditions varient selon l’éditeur, et souvent d’une voix à l’autre, et certaines voix sont réservées à un usage personnel sans que l’interface le mentionne jamais. Avant qu’une lecture synthétique se retrouve dans un projet commercial, trouvez les conditions de la voix précise que vous avez utilisée. Les services payants de synthèse vocale facturent en partie parce que leur licence répond à cette question par écrit.
Le règlement de YouTube est une autre affaire, et il est souvent mal compris. Les règles de monétisation visent les contenus produits en masse et répétitifs, avec peu d’apport original, et non la narration synthétique en tant que telle. Une vidéo bien faite n’est pas exclue parce qu’elle a une voix off synthétique. Une chaîne qui enchaîne des articles lus par une machine sur des images de stock a un problème, et engager un narrateur humain ne le réglerait pas. Les évaluateurs se demandent si la vidéo apporte quelque chose, pas qui a prononcé les mots.
Là où la voix du navigateur mérite sa place
Arrêtez de la considérer comme la voix finale et elle devient un très bon outil. Voici les tâches qu’elle fait bien.
- Minuter un script. Les durées de lecture estimées à partir du nombre de mots ne sont pas fiables. Collez le script, réglez la vitesse près de votre propre débit et écoutez. Vous obtenez une durée réelle avant de réserver un studio ou de vous installer pour enregistrer.
- Repérer les phrases impossibles à lire à voix haute. Si le synthétiseur trébuche, un humain trébuchera aussi. Les longues subordonnées, les énumérations sans ponctuation et les mots dont la prononciation change selon le sens se signalent en quelques secondes.
- Préparer une piste témoin. Placez une lecture synthétique dans la timeline de montage, montez la vidéo dessus, puis remplacez-la plus tard par le véritable enregistrement. Les coupes tombent toujours juste, puisque le rythme était déjà fixé.
- Relire vos propres textes. Entendre un paragraphe fait ressortir le mot répété et le mot manquant que votre œil rétablit sans que vous vous en rendiez compte.
- Vérifier rapidement l’accessibilité. Si votre texte est confus quand une voix synthétique le lit, il l’est aussi pour les personnes qui en dépendent.
Si vous avez besoin d’une voix off publiable
Enregistrez-vous. Un micro USB modeste, dans une pièce avec des rideaux, de la moquette et des meubles rembourrés, bat n’importe quelle voix synthétique dès qu’il faut de la personnalité, et le matériel coûte moins cher qu’un an de la plupart des abonnements. Ce qui donne à un son amateur son côté amateur, c’est surtout la pièce, pas le micro.
Ou payez un service de synthèse vocale. Vous obtenez un fichier à télécharger, une voix qui tient la route au casque et une licence commerciale écrite. Pour de longues narrations en grande quantité, c’est la réponse raisonnable.
Ou faites tourner un modèle neuronal sur votre propre machine. Plusieurs fonctionnent sur un ordinateur ordinaire et produisent un fichier audio sans coût par mot, sans que rien ne quitte votre bureau. Vous payez à la place en temps d’installation et en espace disque.
Notre outil intervient avant tout cela, pas à la place. C’est le moyen le plus rapide d’entendre si un script fonctionne à voix haute. Ce que vous enregistrerez ensuite est une autre décision, qui mérite d’être prise en connaissance de cause.
L’outil Synthèse vocale lit votre texte à voix haute dans cet onglet et peut l’enregistrer en fichier WAV.
Ouvrir Synthèse vocale