स्कैन की गई PDF से संपादन योग्य टेक्स्ट कैसे निकालें
स्कैन की गई PDF या किसी पेज की फ़ोटो से शब्द निकालें और एडिट करने लायक सादा टेक्स्ट पाएँ, वह भी आपके अपने ब्राउज़र के अंदर चल रही पहचान के साथ।
यह सबसे पहले जो आज़माता है, वह OCR नहीं है
जो PDF स्कैन जैसी दिखती हैं, उनमें से कई असल में स्कैन नहीं होतीं। Word से एक्सपोर्ट की गई फ़ाइल, या किसी और सॉफ़्टवेयर से पहले ही गुज़र चुका स्कैन, तस्वीर के नीचे एक अदृश्य टेक्स्ट लेयर लिए होता है। उस लेयर को पढ़ने से आपको ठीक वही अक्षर मिलते हैं जिनसे दस्तावेज़ बना था, बिना किसी पहचान त्रुटि के, और इसमें करीब एक सेकंड लगता है।
इसलिए जब आप कोई ऐसी PDF देते हैं जिसकी भाषा English पर ही छोड़ी हुई है, तो टूल पहले टेक्स्ट लेयर पढ़ता है। अगर वहाँ उसे ठीक-ठाक मात्रा में टेक्स्ट मिल जाता है, तो वह उसे तुरंत लौटा देता है और OCR इंजन कभी शुरू ही नहीं करता। आपको यह लगभग तुरंत पूरा होता दिखेगा, यही इसकी पहचान है। कोई भी और भाषा चुनें, तो यह शॉर्टकट छोड़कर सीधे पहचान पर चला जाता है, इसलिए अगर आपकी PDF अंग्रेज़ी में है, तो भाषा को वैसे ही छोड़ दें और टूल को यह तेज़ रास्ता आज़माने दें।
असली स्कैन कैसे पढ़ा जाता है
जब कोई टेक्स्ट नहीं मिलता, तो हर पेज को 144 पिक्सेल प्रति इंच पर इमेज के रूप में रेंडर किया जाता है और Tesseract को भेजा जाता है, जो आपके ब्राउज़र में WebAssembly के रूप में चलता है। पहले इमेज को साफ़ किया जाता है। टूल पेज के सबसे हल्के और सबसे गहरे पिक्सेल नापता है, दोनों के बीच का कंट्रास्ट खींचता है, और हर पिक्सेल को काले या सफ़ेद में बदल देता है, क्योंकि पहचान इंजन को यही चाहिए होता है।
अगर वह पहला पास लगभग कुछ भी नहीं देता, तो दो और पास अपने-आप चलते हैं। दूसरा इमेज को इनवर्ट करता है, जिससे गहरे बैकग्राउंड पर सफ़ेद टेक्स्ट बच जाता है, ठीक वैसा जैसा किसी ऐप के डार्क मोड का स्क्रीनशॉट देता है। तीसरा बिना छुई हुई मूल इमेज को सीधे भेज देता है, इस सोच पर कि सफ़ाई ही दिक़्क़त थी। जो भी पास सबसे ज़्यादा टेक्स्ट देता है, वही जीतता है। यह सब आप नहीं चुनते, और इसी वजह से कोई पेज जो बिल्कुल बेकार लगता है, कभी-कभी तीसरी कोशिश में पढ़ने लायक निकल आता है।
आपको बदले में क्या मिलता है
नतीजा पेज पर एक टेक्स्ट बॉक्स में दिखता है, और हर पेज के बाद एक मार्कर लाइन होती है ताकि आपको पता चले कि कौन-सा पेज कहाँ ख़त्म हुआ। वहाँ से आप उसे कॉपी कर सकते हैं या .txt फ़ाइल के रूप में डाउनलोड कर सकते हैं। बस यही पूरा आउटपुट है। यह टूल आपको मूल स्कैन के ऊपर अदृश्य टेक्स्ट लेयर वाली सर्च की जा सकने वाली PDF वापस नहीं देता, और न ही यह कोई Word फ़ाइल बनाता है, इसलिए अगर आपको ऐसी PDF चाहिए जिसमें खोजा जा सके, तो यह आपको शब्द दे देता है पर फ़ॉर्मैट नहीं।
लेआउट भी नहीं बचता। टेक्स्ट लाइनों के एक बहाव जैसा आता है। दो कॉलम वाला पेज अक्सर आपस में गड्डमड्ड कॉलम के साथ निकलता है, और टेबल अपने सेल खोकर सिर्फ़ संख्याओं की एक लाइन बनकर रह जाती है। जिस भी चीज़ में ज़्यादा ढाँचा था, उसमें दोबारा ढाँचा जोड़ने में समय लगने की उम्मीद रखें।
क्या चीज़ सटीकता को नुक़सान पहुँचाती है
पहचान की क्वालिटी लगभग पूरी तरह उस इमेज पर निर्भर करती है जो आप उसे देते हैं:
- कम रिज़ॉल्यूशन वाले सोर्स स्कैन। 150 DPI पर स्कैन किया पेज पतली, टूटी हुई अक्षर-रेखाओं वाला होता है, और कोई भी प्रोसेसिंग खोए हुए पिक्सेल वापस नहीं बना सकती।
- असमान रोशनी। कंट्रास्ट स्ट्रेच पूरे पेज को एक साथ नापता है, हिस्सा-दर-हिस्सा नहीं, इसलिए जिस फ़ोटो में एक तरफ़ छाया हो, वह तरफ़ पूरी तरह ठोस काले रंग में खो सकती है।
- टेढ़ापन। फ़ोन को थोड़ा तिरछा पकड़ने से आई बस कुछ डिग्री की घुमाव भी सटीकता घटा देती है, और यहाँ कुछ भी आपके लिए पेज को सीधा नहीं करता। शुरू करने से पहले उसे सीधा घुमा लें।
- छोटे अक्षर, सटी हुई लाइन-स्पेसिंग, और सजावटी या हस्तलिपि जैसे फ़ॉन्ट। फ़ुटनोट और क़ानूनी काग़ज़ों की घनी छोटी छपाई हमेशा किसी भी पेज का सबसे ख़राब हिस्सा होती है।
- हाथ से लिखी लिखावट। Tesseract को छपे हुए अक्षरों पर प्रशिक्षित किया गया है और यह कर्सिव लिखावट से पूरे भरोसे के साथ बकवास नतीजे देगा।
अगर स्कैन आपके हाथ में है, तो सबसे काम की बात यही है कि उसे सपाट, सीधा और बड़ा करके कैप्चर करें। इसके बाद आने वाला हर कदम आसान हो जाता है।
वह इकलौता बटन जो आपकी डिवाइस से बाहर जाता है
पहचान का काम स्थानीय रूप से होता है। आपकी PDF इसी टैब में पढ़ी जाती है, इंजन और उसका भाषा डेटा पहली बार इस्तेमाल पर एक सार्वजनिक CDN से डाउनलोड होता है, और आपके दस्तावेज़ का कोई भी पेज कहीं नहीं भेजा जाता। इस पेज पर एक अपवाद है और उसे साफ़ बता देना ज़रूरी है: नतीजे के पास मौजूद अनुवाद बटन निकाले गए टेक्स्ट को इंटरनेट के ज़रिए किसी बाहरी अनुवाद सेवा को भेजता है। फ़ाइल कभी नहीं जाती, लेकिन पहचाने गए शब्द चले जाते हैं। दस्तावेज़ गोपनीय हो तो वह बटन इस्तेमाल न करें।
डेस्कटॉप टूल कब बेहतर जवाब होता है
OCRmyPDF जैसा टूल पहचाने गए टेक्स्ट को एक अदृश्य लेयर के रूप में वापस मूल PDF में लिख देता है, इसलिए फ़ाइल अब भी स्कैन जैसी दिखती है पर अब उसमें खोजा भी जा सकता है, जो किसी आर्काइव को असल में अक्सर चाहिए होता है। डेस्कटॉप सॉफ़्टवेयर पहचानने से पहले पेज को सीधा भी करता है और दाग़-धब्बे जैसा शोर भी हटाता है, टेबल फिर से बनाता है, और सैकड़ों फ़ाइलों वाले किसी फ़ोल्डर पर बिना किसी निगरानी के काम करता है। घने, ख़राब क्वालिटी वाले और कई भाषाओं वाले पेजों पर कमर्शियल इंजन अब भी आगे हैं। ब्राउज़र का इस्तेमाल तब करें जब आपको बस एक स्कैन से शब्द चाहिए हों, अभी, और आप उसे अपलोड करके यह पता लगाना न चाहते हों कि उसमें लिखा क्या है।
PDF और इमेज OCR आपके स्कैन का टेक्स्ट इसी टैब में पढ़ता है। फ़ाइल खुद कभी अपलोड नहीं होती।
PDF और इमेज OCR खोलें