Cómo crear locuciones con IA para YouTube y podcasts
El texto a voz del navegador es realmente útil para redactar un guion y cronometrarlo. Convertirlo en un archivo de locución que puedas publicar es otro problema, y conviene entender por qué antes de organizar tu forma de trabajar en torno a él.
Dos cosas distintas que se llaman texto a voz
El término abarca dos tecnologías que suenan completamente distintas, y la mayor parte de la confusión en torno a las locuciones sintéticas empieza justo aquí.
La primera es el sintetizador de voz integrado en tu sistema operativo, al que las páginas web acceden a través de la Web Speech API. Todos los navegadores actuales lo incluyen. Es gratis, arranca al instante, no hay que descargar nada, y la calidad va de aceptable a claramente sintética según las voces que tenga instaladas tu equipo.
La segunda es un modelo neuronal que predice una forma de onda a partir del texto. Es a lo que se refiere la gente cuando habla de voz con IA. Es la que suena como una persona que respira, y funciona o bien en el servidor de otro, detrás de una API de pago, o bien como un archivo de modelo tan grande que descargarlo es una decisión deliberada y no un descuido.
La reproducción de nuestra herramienta es del primer tipo. La lista de voces no es nuestra. Es la que proporcione tu sistema operativo, y por eso la misma página suena distinta en Windows, macOS, Android e iOS, y por eso una voz que te recomiende un compañero puede no aparecer siquiera en tu menú desplegable. Los controles deslizantes de velocidad y tono ajustan esa voz del sistema. No cambian de motor.
La limitación que lo decide todo: no se puede grabar
Esta es la parte que los artículos sobre locuciones con el navegador suelen saltarse. La Web Speech API no le da a una página ninguna forma de capturar su propio audio.
Cuando una página llama a speechSynthesis.speak(), el navegador envía el audio directamente al dispositivo de salida del sistema. La API no devuelve ningún flujo de medios, ningún nodo de Web Audio ni ningún búfer de muestras. No hay nada a lo que conectar una grabadora ni nada que codificar. Una página puede iniciar la voz, pausarla y detenerla. Lo que no puede es guardarla.
Eso tiene una consecuencia tajante: cualquier herramienta de navegador que ofrezca descargar una voz de Web Speech no te está dando la voz que acabas de oír. Está generando audio por otros medios y te entrega eso en su lugar.
El botón de descarga de este sitio no es una excepción, y preferimos decirlo aquí antes que dejar que lo descubras después de haber montado un vídeo con ese audio. La vista previa reproduce las voces de tu sistema operativo. La descarga escribe un archivo WAV a partir de un pequeño sintetizador de formantes que funciona dentro de la página: una fuente glotal que pasa por filtros resonantes y se ensambla letra a letra. Es procesamiento de señal de verdad y no es una voz neuronal. Trata la vista previa y la descarga como dos salidas sin ninguna relación, y escucha el archivo antes de planificar nada en torno a él.
Si necesitas exactamente la voz que oíste en la vista previa, la única vía es grabarla fuera del navegador. En Windows, eso suele significar activar en la configuración de sonido una entrada de loopback como Mezcla estéreo. En macOS, significa instalar un dispositivo de audio virtual y enviar la salida del sistema a una grabadora. Las dos opciones capturan lo que habrían reproducido los altavoces, que es el único acceso que tiene cualquiera a esas voces.
Qué te permite publicar realmente la licencia
Grabar el audio es una cuestión técnica. Publicarlo es una cuestión legal, y las dos se confunden constantemente.
Esas voces pertenecen a Microsoft, Apple, Google o al fabricante de tu dispositivo Android. Se te conceden con licencia como parte de un sistema operativo, y esa licencia trata sobre el uso de tu ordenador. No te da automáticamente derecho a grabar esa salida y meterla en un vídeo monetizado. Las condiciones cambian según el fabricante y a menudo según cada voz, y algunas voces tienen restricciones de uso personal que la interfaz nunca menciona. Antes de que una lectura sintética acabe en algo comercial, busca las condiciones de la voz concreta que usaste. Los servicios de texto a voz de pago cobran, en parte, porque su licencia responde a esa pregunta por escrito.
Las normas de YouTube son otro asunto, y mucha gente las interpreta mal. Las políticas de monetización van contra el contenido producido en masa y repetitivo, con poca aportación original, no contra la narración sintética en sí. Un vídeo bien hecho no queda descalificado por tener una locución sintética. Un canal que publica sin parar artículos leídos por una máquina sobre imágenes de stock tiene un problema, y contratar a un narrador humano no lo resolvería. Los revisores se preguntan si el vídeo aporta algo, no quién pronunció las palabras.
Dónde se gana su sitio la voz del navegador
Si dejas de tratarla como la voz final, se convierte en una herramienta realmente buena. Estas son las tareas que hace bien.
- Cronometrar un guion. Calcular el tiempo de lectura a partir del número de palabras no es fiable. Pega el guion, pon la velocidad cerca de tu propio ritmo al hablar y escucha. Tendrás una duración real antes de reservar un estudio o sentarte a grabar.
- Encontrar frases que no se pueden leer en voz alta. Si el sintetizador tropieza, una persona también lo hará. Las subordinadas largas, las enumeraciones sin puntuación y las palabras que se pronuncian distinto según lo que signifiquen se delatan en cuestión de segundos.
- Montar una pista provisional. Coloca una lectura sintética en la línea de tiempo del editor, monta el vídeo sobre ella y sustitúyela más tarde por la grabación real. Los cortes siguen cuadrando porque el ritmo ya estaba decidido.
- Revisar tus propios textos. Al oír un párrafo detectas la palabra repetida y la palabra que falta, esas que la vista reconstruye sin que te des cuenta.
- Hacer una comprobación rápida de accesibilidad. Si tu texto resulta confuso cuando lo lee una voz sintética, también lo es para las personas que dependen de una.
Si necesitas una locución que puedas publicar
Grábate. Un micrófono USB modesto en una habitación con cortinas, alfombra y muebles tapizados supera a cualquier voz sintética en todo lo que pida personalidad, y el equipo cuesta menos que un año de la mayoría de las suscripciones. Casi todo lo que hace que un audio amateur suene amateur es la habitación, no el micrófono.
O paga un servicio de texto a voz. Obtienes un archivo que puedes descargar, una voz que aguanta la escucha con auriculares y una licencia comercial por escrito. Para narraciones largas en grandes cantidades, es la respuesta sensata.
O ejecuta un modelo neuronal en tu propio equipo. Varios funcionan en un ordenador normal y generan un archivo de audio sin coste por palabra y sin que nada salga de tu mesa. A cambio, pagas en tiempo de configuración y espacio en disco.
Nuestra herramienta va antes de todo eso, no en su lugar. Es la forma más rápida de oír si un guion funciona leído en voz alta. Lo que grabes después es otra decisión, y merece la pena tomarla a conciencia.
Texto a voz lee tu texto en voz alta en esta pestaña y puede guardarlo como archivo WAV.
Abrir Texto a voz