यह टूल क्या नहीं करता
यह इमेज को टेक्स्ट में बदलता है। यह मूल लेआउट नहीं रखता, और इसका एक हिस्सा एक बाहरी सेवा से बात करता है।
सिर्फ़ प्लेन टेक्स्ट
आपको एक सादा टेक्स्ट फ़ाइल मिलती है, न कि नीचे स्कैन वाली सर्च करने लायक PDF और न ही Word डॉक्यूमेंट। OCRmyPDF जैसा डेस्कटॉप टूल पहचाने गए टेक्स्ट को वापस मूल फ़ाइल में जोड़ता है।
लेआउट नहीं बचता
कॉलम अक्सर आपस में मिल जाते हैं और टेबल के सेल नहीं बचते, वे नंबरों की एक लाइन बनकर रह जाते हैं। मुश्किल लेआउट को बाद में हाथ से ठीक करना पड़ता है।
अनुवाद करने पर डेटा डिवाइस से बाहर जाता है
फ़ाइल खोलना, उसे बनाना और OCR चलाना, यह सब आपके डिवाइस पर ही रहता है। टेक्स्ट का अनुवाद करें दबाने पर, पुष्टि माँगने के बाद, निकाला गया टेक्स्ट अनुवाद के लिए MyMemory के API को भेजा जाता है। गोपनीय टेक्स्ट के लिए यह बटन न दबाएँ।
हाथ से लिखी लिखावट नहीं
Tesseract छपे हुए टेक्स्ट पर ट्रेन किया गया है और कर्सिव लिखावट को भरोसे से मगर ग़लत टेक्स्ट के रूप में पढ़ता है।
सटीकता स्कैन पर निर्भर करती है
कम रिज़ॉल्यूशन, असमान रोशनी, और घुमी या तिरछी फ़ोटो, ये सब सटीकता घटाते हैं। सीधा, सपाट और अच्छी रोशनी वाला स्कैन सबसे अच्छा नतीजा देता है।
अंग्रेज़ी को शॉर्टकट मिलता है, बाकी भाषाओं को नहीं
टेक्स्ट लेयर की जाँच सिर्फ़ तब होती है जब भाषा अंग्रेज़ी हो। कोई और OCR भाषा चुनने पर यह हमेशा पेज बनाकर पहचान चलाता है, भले ही PDF में पहले से चुना जा सकने वाला टेक्स्ट क्यों न हो।
जुड़े हुए PDF टूल
अक्सर पूछे जाने वाले सवाल
फ़ाइल ख़ुद अपलोड नहीं होती। उसे पढ़ना, उसके पेज बनाना और OCR चलाना, यह सब Tesseract.js और PDF.js के साथ इसी टैब में होता है। सिर्फ़ एक अपवाद है, टेक्स्ट का अनुवाद करें बटन, जो इस्तेमाल करने पर पहचाने गए टेक्स्ट को, फ़ाइल को नहीं, एक बाहरी ट्रांसलेशन सेवा को भेजता है।
सिर्फ़ रिज़ल्ट बॉक्स में उस समय मौजूद टेक्स्ट, 500 से कम अक्षरों के टुकड़ों में बाँटकर, इंटरनेट पर MyMemory के पब्लिक ट्रांसलेशन API को। किसी पेज पर पहली बार इस्तेमाल करने पर यह आपसे पुष्टि माँगता है। आपकी PDF या इमेज कभी भी उस रिक्वेस्ट का हिस्सा नहीं बनती।
अगर आपने भाषा अंग्रेज़ी पर ही छोड़ी हो और फ़ाइल PDF हो, तो टूल पहले फ़ाइल में पहले से मौजूद टेक्स्ट लेयर जाँचता है, जैसी Word से एक्सपोर्ट की गई फ़ाइल में या जिस PDF पर पहले से OCR चल चुका है उसमें होती है। वहाँ काफ़ी टेक्स्ट मिलने पर यह उसे सीधे लौटा देता है और OCR पूरी तरह छोड़ देता है। कोई और भाषा चुनने पर यह हमेशा पूरी पहचान प्रक्रिया चलाता है।
नहीं। नतीजा सिर्फ़ प्लेन टेक्स्ट होता है, जो बॉक्स में दिखता है और .txt के रूप में डाउनलोड हो सकता है। टेक्स्ट को नई PDF में बदलने के लिए टेक्स्ट से PDF इस्तेमाल करें, और मूल स्कैन को रखते हुए उसमें छिपी टेक्स्ट लेयर जोड़नी हो, तो डेस्कटॉप टूल बेहतर विकल्प है।
पहचान टेक्स्ट को ब्लॉक में बाएँ से दाएँ पढ़ती है, इसलिए कई कॉलम वाले पेज और टेबल अक्सर क्रम बदले हुए या नंबरों की लाइन में बदले हुए आते हैं। कम रिज़ॉल्यूशन, असमान रोशनी, तिरछी फ़ोटो, छोटे अक्षर या हाथ की लिखावट भी सटीकता घटाते हैं।
आपकी फ़ाइल ज़्यादातर आपके डिवाइस पर ही रहती है
Tesseract.js और PDF.js इसी टैब में चलकर फ़ाइल पढ़ते हैं और उसका टेक्स्ट पहचानते हैं। फ़ाइल ख़ुद अपलोड नहीं होती। अगर आप टेक्स्ट का अनुवाद करें दबाते हैं, तो पुष्टि के बाद पहचाना गया टेक्स्ट, फ़ाइल को नहीं, MyMemory के ट्रांसलेशन API को भेजा जाता है।