ऑडियो और स्पीच

YouTube और पॉडकास्ट के लिए AI वॉयसओवर कैसे बनाएँ

ब्राउज़र का टेक्स्ट से स्पीच किसी स्क्रिप्ट का ड्राफ़्ट बनाने और उसकी टाइमिंग जाँचने में सच में काम आता है। पर उसे ऐसी वॉयसओवर फ़ाइल में बदलना जिसे आप पब्लिश कर सकें, एक अलग समस्या है, और इसके भरोसे अपने काम का पूरा तरीका बनाने से पहले यह समझ लेना अच्छा है कि ऐसा क्यों है।

टेक्स्ट से स्पीच कहलाने वाली दो अलग चीज़ें

इस नाम में दो ऐसी टेक्नोलॉजी आती हैं जो सुनने में बिल्कुल एक जैसी नहीं लगतीं, और सिंथेटिक वॉयसओवर को लेकर ज़्यादातर उलझन ठीक यहीं से शुरू होती है।

पहली है आपके ऑपरेटिंग सिस्टम में बना स्पीच सिंथेसाइज़र, जिस तक वेब पेज Web Speech API के ज़रिए पहुँचते हैं। आज का हर ब्राउज़र इसे उपलब्ध कराता है। यह मुफ़्त है, तुरंत शुरू हो जाता है, कुछ डाउनलोड नहीं करना पड़ता, और इसकी क्वालिटी ठीक-ठाक से लेकर साफ़ तौर पर मशीनी तक कुछ भी हो सकती है। यह इस पर निर्भर करता है कि आपकी मशीन पर कौन-सी आवाज़ें इंस्टॉल हैं।

दूसरी है न्यूरल मॉडल, जो टेक्स्ट से वेवफ़ॉर्म का अनुमान लगाता है। लोग जब AI आवाज़ कहते हैं, तो उनका मतलब यही होता है। यही वह आवाज़ है जो साँस लेते इंसान जैसी लगती है। यह या तो किसी और के सर्वर पर पेड API के पीछे चलती है, या फिर एक मॉडल फ़ाइल के रूप में, जो इतनी बड़ी होती है कि उसे डाउनलोड करना सोच-समझकर लिया गया फ़ैसला होता है, गलती से होने वाली चीज़ नहीं।

हमारे टूल का प्लेबैक पहली तरह का है। आवाज़ों की लिस्ट हमारी नहीं है। उसमें वही आवाज़ें होती हैं जो आपका ऑपरेटिंग सिस्टम देता है। इसीलिए एक ही पेज Windows, macOS, Android और iOS पर अलग सुनाई देता है, और इसीलिए हो सकता है कि किसी साथी की सुझाई आवाज़ आपकी ड्रॉपडाउन लिस्ट में दिखे ही नहीं। स्पीड और पिच के स्लाइडर उसी सिस्टम आवाज़ को बदलते हैं। वे इंजन नहीं बदलते।

वह सीमा जिससे सब तय होता है: आप इसे रिकॉर्ड नहीं कर सकते

ब्राउज़र से वॉयसओवर बनाने पर लिखे लेख अक्सर यही हिस्सा छोड़ देते हैं। Web Speech API किसी पेज को अपना ही ऑडियो कैप्चर करने का कोई तरीका नहीं देता।

जब कोई पेज speechSynthesis.speak() कॉल करता है, तो ब्राउज़र ऑडियो सीधे सिस्टम के आउटपुट डिवाइस पर भेज देता है। API न कोई मीडिया स्ट्रीम लौटाता है, न Web Audio नोड, न सैंपल बफ़र। रिकॉर्डर जोड़ने के लिए कुछ नहीं है, और एन्कोड करने के लिए भी कुछ नहीं। पेज बोलना शुरू करा सकता है, उसे पॉज़ कर सकता है और रोक सकता है। उसे सेव नहीं कर सकता।

इसका नतीजा बिल्कुल साफ़ है: जो भी ब्राउज़र टूल Web Speech की आवाज़ डाउनलोड करने की सुविधा देता है, वह आपको वह आवाज़ नहीं दे रहा जो आपने अभी सुनी। वह किसी और तरीके से ऑडियो बनाता है और उसकी जगह वही आपको थमा देता है।

इस साइट का डाउनलोड बटन भी इसका अपवाद नहीं है, और हम यह बात यहीं बता देना बेहतर समझते हैं, ताकि नतीजे पर वीडियो एडिट कर लेने के बाद आपको इसका पता न चले। प्रीव्यू आपके ऑपरेटिंग सिस्टम की आवाज़ें चलाता है। डाउनलोड, पेज के अंदर चलने वाले एक छोटे फ़ॉर्मेंट सिंथेसाइज़र से WAV फ़ाइल बनाता है: एक ग्लॉटल सोर्स, जिसे रेज़ोनेंट फ़िल्टर से गुज़ारा जाता है और अक्षर-दर-अक्षर जोड़ा जाता है। यह असली सिग्नल प्रोसेसिंग है, और यह न्यूरल आवाज़ नहीं है। प्रीव्यू और डाउनलोड को दो ऐसे आउटपुट मानें जिनका आपस में कोई संबंध नहीं है, और कोई भी योजना बनाने से पहले फ़ाइल सुन लें।

अगर आपको ठीक वही आवाज़ चाहिए जो आपने प्रीव्यू में सुनी, तो एक ही रास्ता है: उसे ब्राउज़र के बाहर रिकॉर्ड करना। Windows पर इसका मतलब आम तौर पर साउंड सेटिंग्स में Stereo Mix जैसा लूपबैक इनपुट चालू करना होता है। macOS पर इसका मतलब है एक वर्चुअल ऑडियो डिवाइस इंस्टॉल करना और सिस्टम आउटपुट को किसी रिकॉर्डर में भेजना। दोनों तरीके वही रिकॉर्ड करते हैं जो स्पीकर पर बजता, और इन आवाज़ों तक किसी की भी पहुँच बस इतनी ही है।

लाइसेंस आपको असल में क्या पब्लिश करने देता है

ऑडियो रिकॉर्ड करना तकनीकी सवाल है। उसे पब्लिश करना कानूनी सवाल है, और इन दोनों को लगातार एक ही मान लिया जाता है।

ये आवाज़ें Microsoft, Apple, Google या आपके Android डिवाइस बनाने वाली कंपनी की हैं। ये ऑपरेटिंग सिस्टम के हिस्से के तौर पर आपको लाइसेंस पर मिली हैं, और वह लाइसेंस आपके कंप्यूटर के इस्तेमाल से जुड़ा है। उससे आपको अपने-आप यह अधिकार नहीं मिल जाता कि आउटपुट रिकॉर्ड करके उसे मॉनेटाइज़ किए गए वीडियो में डाल दें। शर्तें हर कंपनी में और अक्सर हर आवाज़ के लिए अलग होती हैं, और कुछ आवाज़ों पर सिर्फ़ निजी इस्तेमाल की पाबंदी होती है, जिसका इंटरफ़ेस में कहीं ज़िक्र नहीं होता। किसी सिंथेटिक रीडिंग को कमर्शियल काम में लगाने से पहले, जिस आवाज़ का आपने इस्तेमाल किया, ठीक उसी की शर्तें ढूँढें। पेड टेक्स्ट से स्पीच सर्विस कुछ हद तक इसीलिए पैसे लेती हैं, क्योंकि उनका लाइसेंस इस सवाल का जवाब लिखित में देता है।

YouTube के अपने नियम अलग मामला हैं, और उन्हें अक्सर गलत समझा जाता है। मॉनेटाइज़ेशन की नीतियाँ उस कंटेंट के ख़िलाफ़ हैं जो बड़े पैमाने पर बनाया गया हो, बार-बार एक जैसा हो और जिसमें मौलिक योगदान कम हो, सिंथेटिक नैरेशन के ख़िलाफ़ अपने-आप में नहीं। अच्छी तरह बना वीडियो सिर्फ़ सिंथेटिक वॉयसओवर की वजह से अयोग्य नहीं हो जाता। जो चैनल स्टॉक फ़ुटेज पर मशीन से पढ़े गए लेख धड़ाधड़ डालता है, उसकी समस्या है, और किसी इंसानी नैरेटर को रख लेने से भी वह हल नहीं होगी। रिव्यू करने वाले यह देखते हैं कि वीडियो कुछ नया जोड़ता है या नहीं, यह नहीं कि शब्द किसने बोले।

ब्राउज़र की स्पीच सच में कहाँ काम आती है

इसे आख़िरी आवाज़ मानना छोड़ दें, तो यह सच में अच्छा टूल बन जाती है। ये वे काम हैं जो यह अच्छी तरह करती है।

  • स्क्रिप्ट की टाइमिंग नापना। शब्दों की गिनती से पढ़ने का समय आँकना भरोसेमंद नहीं होता। स्क्रिप्ट पेस्ट करें, स्पीड को अपनी बोलने की रफ़्तार के आसपास रखें, और सुनें। स्टूडियो बुक करने या रिकॉर्ड करने बैठने से पहले ही आपको असली अवधि पता चल जाती है।
  • ऐसे वाक्य ढूँढना जिन्हें ज़ोर से पढ़ा नहीं जा सकता। अगर सिंथेसाइज़र अटकता है, तो इंसान भी अटकेगा। लंबे उपवाक्य, बिना विराम चिह्नों वाली सूचियाँ और ऐसे शब्द जिनका उच्चारण अर्थ के हिसाब से बदलता है, कुछ ही सेकंड में सामने आ जाते हैं।
  • स्क्रैच ट्रैक बनाना। एडिटिंग टाइमलाइन में एक सिंथेटिक रीडिंग डालें, उसके हिसाब से वीडियो काटें, और बाद में उसकी जगह असली रिकॉर्डिंग लगा दें। कट फिर भी सही बैठते हैं, क्योंकि रफ़्तार पहले ही तय हो चुकी थी।
  • अपना लिखा प्रूफ़रीड करना। कोई पैराग्राफ़ सुनने पर दोहराया गया शब्द और छूटा हुआ शब्द पकड़ में आ जाते हैं, जिन्हें पढ़ते समय आपकी आँख चुपचाप खुद ठीक कर लेती है।
  • एक्सेसिबिलिटी की मोटी-मोटी जाँच। अगर सिंथेटिक आवाज़ के पढ़ने पर आपका टेक्स्ट उलझा हुआ लगता है, तो वह उन लोगों के लिए भी उलझा हुआ है जो ऐसी आवाज़ पर निर्भर हैं।

अगर आपको पब्लिश करने लायक वॉयसओवर चाहिए

खुद रिकॉर्ड करें। पर्दों, कालीन और गद्देदार फ़र्नीचर वाले कमरे में रखा एक साधारण USB माइक्रोफ़ोन, जहाँ भी व्यक्तित्व चाहिए, किसी भी सिंथेटिक आवाज़ से बेहतर रहता है, और यह सामान ज़्यादातर सब्सक्रिप्शन के एक साल के खर्च से कम में आ जाता है। शौकिया ऑडियो को शौकिया बनाने वाली चीज़ ज़्यादातर कमरा होता है, माइक्रोफ़ोन नहीं।

या किसी टेक्स्ट से स्पीच सर्विस के लिए पैसे दें। आपको डाउनलोड करने लायक फ़ाइल मिलती है, ऐसी आवाज़ जो हेडफ़ोन पर सुनने में भी ठीक लगती है, और लिखित कमर्शियल लाइसेंस। बड़ी मात्रा में लंबे नैरेशन के लिए यही समझदारी वाला जवाब है।

या अपनी मशीन पर कोई न्यूरल मॉडल चलाएँ। कई मॉडल आम कंप्यूटर पर चल जाते हैं और ऑडियो फ़ाइल बना देते हैं, बिना प्रति शब्द खर्च के और बिना कुछ भी आपकी मेज़ से बाहर गए। इसके बदले आप सेटअप के समय और डिस्क स्पेस से कीमत चुकाते हैं।

हमारा टूल इन सबकी जगह नहीं लेता, बल्कि इन सबसे पहले आता है। कोई स्क्रिप्ट ज़ोर से पढ़े जाने पर ठीक बैठती है या नहीं, यह सुनने का यह सबसे तेज़ तरीका है। उसके बाद आप क्या रिकॉर्ड करते हैं, यह अलग फ़ैसला है, और इसे सोच-समझकर लेना चाहिए।

आज़माएँ

टेक्स्ट से स्पीच आपके टेक्स्ट को इसी टैब में पढ़कर सुनाता है और उसे WAV फ़ाइल के रूप में सेव कर सकता है।

टेक्स्ट से स्पीच खोलें