PDF और इमेज OCR

pdf → txt

ब्राउज़र में चलने वाले OCR से स्कैन की गई PDF या फ़ोटो से टेक्स्ट निकालें, फिर उसे प्लेन टेक्स्ट के रूप में कॉपी या डाउनलोड करें।

सेटिंग्स
कतारकुछ भी अपलोड नहीं होता
यहाँ स्कैन की गई PDF या फ़ोटो खींचकर छोड़ें
टेक्स्ट पहचाना जा रहा है…

इस OCR टूल के बारे में

यह टूल Tesseract.js चलाता है, जो WebAssembly में बना एक OCR इंजन है और एक Web Worker के अंदर चलता है। अंग्रेज़ी वाली PDF के लिए यह पहले जाँचता है कि फ़ाइल में पहले से टेक्स्ट लेयर तो नहीं है, जैसी Word से एक्सपोर्ट की गई फ़ाइल में या जिस PDF पर पहले से OCR चल चुका है उसमें होती है, और अगर वहाँ काफ़ी टेक्स्ट मिले तो उसे तुरंत लौटा देता है। वरना यह हर पेज को इमेज में बदलकर उस पर मौजूद टेक्स्ट पहचानता है।

पहचान हर पेज पर अलग-अलग तरह से इमेज प्रोसेस करके तीन बार तक चलती है: हल्के टेक्स्ट के लिए कॉन्ट्रास्ट बढ़ाकर, गहरे बैकग्राउंड पर हल्के टेक्स्ट के लिए रंग पलटकर, और आख़िर में बिना बदलाव वाली मूल इमेज पर। जिस कोशिश में सबसे ज़्यादा टेक्स्ट मिलता है, वही रखा जाता है।

इस्तेमाल कैसे करें

01

फ़ाइल जोड़ें

कोई स्कैन की गई PDF या पेज की फ़ोटो छोड़ें, या फ़ाइल चुनें से उसे चुनें।

02

भाषा चुनें

OCR भाषा की लिस्ट में से वह भाषा चुनें जिसमें टेक्स्ट लिखा है। डिफ़ॉल्ट रूप से यह अंग्रेज़ी पर सेट रहती है।

03

टेक्स्ट निकालें

टेक्स्ट निकालें पर क्लिक करें। एक अकेला पेज कुछ सेकंड में तैयार हो जाता है, कई पेजों वाला स्कैन इससे ज़्यादा समय लेता है, एक-एक पेज करके।

04

कॉपी या डाउनलोड करें

नतीजा टेक्स्ट बॉक्स में पढ़ें, फिर टेक्स्ट कॉपी करें या .txt डाउनलोड करें इस्तेमाल करें। टेक्स्ट का अनुवाद करें टेक्स्ट को बाहर भेजता है, इसलिए किसी निजी चीज़ के लिए इसे न दबाएँ।

यह क्या करता है

  • स्कैन की गई PDF, किसी पेज की फ़ोटो या इमेज फ़ाइल से टेक्स्ट पढ़ता है, एक बार में एक फ़ाइल।
  • अंग्रेज़ी वाली PDF में पहले मौजूदा टेक्स्ट लेयर जाँचता है और काफ़ी टेक्स्ट मिलने पर OCR चलाए बिना उसे तुरंत लौटा देता है।
  • अगर पहली कोशिश में लगभग कुछ न मिले, तो पेज को उलटी या बिना बदलाव वाली इमेज के साथ फिर आज़माता है, जो गहरे बैकग्राउंड और हल्के स्कैन में मदद करता है।
  • ग्यारह भाषाएँ और अंग्रेज़ी के साथ तीन जोड़ी भाषाएँ पहचानता है, अरबी से लेकर चीनी तक, जिन्हें कन्वर्ट करने से पहले लिस्ट में से चुना जाता है।
  • फ़ाइल में एक से ज़्यादा पेज होने पर हर पेज को «--- Page N ---» लाइन से अलग करता है।
  • नतीजे को कॉपी करने या .txt फ़ाइल के रूप में डाउनलोड करने देता है। टेक्स्ट का अनुवाद करें बटन ही इस पेज का इकलौता हिस्सा है जो आपके डिवाइस से बाहर कुछ भेजता है।

तकनीकी जानकारी

विशेषता विवरण
स्वीकार करता है एक बार में एक स्कैन की गई PDF या इमेज (JPG, PNG और आपका ब्राउज़र दिखा सके ऐसे अन्य फ़ॉर्मैट), 100 MB तक
नतीजा टेक्स्ट बॉक्स में प्लेन टेक्स्ट; Download .txt उसे ocr_extracted_text.txt के नाम से सेव करता है
OCR भाषाएँ अंग्रेज़ी, स्पेनिश, फ़्रेंच, जर्मन, हिन्दी, चीनी, जापानी, पुर्तगाली, इतालवी, अरबी, रूसी, और अंग्रेज़ी के साथ तीन जोड़ी भाषाएँ
पहचान इंजन Tesseract.js 5.0.4, जो Web Worker में WebAssembly के रूप में चलता है, cdnjs CDN से लोड होता है
PDF प्रोसेसिंग PDF.js 3.11 मौजूदा टेक्स्ट लेयर पढ़ता है या OCR के लिए हर पेज को क़रीब 144 DPI पर बनाता है
टेक्स्ट का अनुवाद करें बटन आपकी पुष्टि के बाद निकाले गए टेक्स्ट को, फ़ाइल को नहीं, इंटरनेट पर MyMemory के ट्रांसलेशन API को भेजता है
आपकी फ़ाइल कहाँ जाती है कहीं नहीं। यह इसी टैब में पढ़ी और पहचानी जाती है।
ध्यान देने लायक

यह टूल क्या नहीं करता

यह इमेज को टेक्स्ट में बदलता है। यह मूल लेआउट नहीं रखता, और इसका एक हिस्सा एक बाहरी सेवा से बात करता है।

सिर्फ़ प्लेन टेक्स्ट

आपको एक सादा टेक्स्ट फ़ाइल मिलती है, न कि नीचे स्कैन वाली सर्च करने लायक PDF और न ही Word डॉक्यूमेंट। OCRmyPDF जैसा डेस्कटॉप टूल पहचाने गए टेक्स्ट को वापस मूल फ़ाइल में जोड़ता है।

लेआउट नहीं बचता

कॉलम अक्सर आपस में मिल जाते हैं और टेबल के सेल नहीं बचते, वे नंबरों की एक लाइन बनकर रह जाते हैं। मुश्किल लेआउट को बाद में हाथ से ठीक करना पड़ता है।

अनुवाद करने पर डेटा डिवाइस से बाहर जाता है

फ़ाइल खोलना, उसे बनाना और OCR चलाना, यह सब आपके डिवाइस पर ही रहता है। टेक्स्ट का अनुवाद करें दबाने पर, पुष्टि माँगने के बाद, निकाला गया टेक्स्ट अनुवाद के लिए MyMemory के API को भेजा जाता है। गोपनीय टेक्स्ट के लिए यह बटन न दबाएँ।

हाथ से लिखी लिखावट नहीं

Tesseract छपे हुए टेक्स्ट पर ट्रेन किया गया है और कर्सिव लिखावट को भरोसे से मगर ग़लत टेक्स्ट के रूप में पढ़ता है।

सटीकता स्कैन पर निर्भर करती है

कम रिज़ॉल्यूशन, असमान रोशनी, और घुमी या तिरछी फ़ोटो, ये सब सटीकता घटाते हैं। सीधा, सपाट और अच्छी रोशनी वाला स्कैन सबसे अच्छा नतीजा देता है।

अंग्रेज़ी को शॉर्टकट मिलता है, बाकी भाषाओं को नहीं

टेक्स्ट लेयर की जाँच सिर्फ़ तब होती है जब भाषा अंग्रेज़ी हो। कोई और OCR भाषा चुनने पर यह हमेशा पेज बनाकर पहचान चलाता है, भले ही PDF में पहले से चुना जा सकने वाला टेक्स्ट क्यों न हो।

जुड़े हुए PDF टूल

अक्सर पूछे जाने वाले सवाल

फ़ाइल ख़ुद अपलोड नहीं होती। उसे पढ़ना, उसके पेज बनाना और OCR चलाना, यह सब Tesseract.js और PDF.js के साथ इसी टैब में होता है। सिर्फ़ एक अपवाद है, टेक्स्ट का अनुवाद करें बटन, जो इस्तेमाल करने पर पहचाने गए टेक्स्ट को, फ़ाइल को नहीं, एक बाहरी ट्रांसलेशन सेवा को भेजता है।

सिर्फ़ रिज़ल्ट बॉक्स में उस समय मौजूद टेक्स्ट, 500 से कम अक्षरों के टुकड़ों में बाँटकर, इंटरनेट पर MyMemory के पब्लिक ट्रांसलेशन API को। किसी पेज पर पहली बार इस्तेमाल करने पर यह आपसे पुष्टि माँगता है। आपकी PDF या इमेज कभी भी उस रिक्वेस्ट का हिस्सा नहीं बनती।

अगर आपने भाषा अंग्रेज़ी पर ही छोड़ी हो और फ़ाइल PDF हो, तो टूल पहले फ़ाइल में पहले से मौजूद टेक्स्ट लेयर जाँचता है, जैसी Word से एक्सपोर्ट की गई फ़ाइल में या जिस PDF पर पहले से OCR चल चुका है उसमें होती है। वहाँ काफ़ी टेक्स्ट मिलने पर यह उसे सीधे लौटा देता है और OCR पूरी तरह छोड़ देता है। कोई और भाषा चुनने पर यह हमेशा पूरी पहचान प्रक्रिया चलाता है।

नहीं। नतीजा सिर्फ़ प्लेन टेक्स्ट होता है, जो बॉक्स में दिखता है और .txt के रूप में डाउनलोड हो सकता है। टेक्स्ट को नई PDF में बदलने के लिए टेक्स्ट से PDF इस्तेमाल करें, और मूल स्कैन को रखते हुए उसमें छिपी टेक्स्ट लेयर जोड़नी हो, तो डेस्कटॉप टूल बेहतर विकल्प है।

पहचान टेक्स्ट को ब्लॉक में बाएँ से दाएँ पढ़ती है, इसलिए कई कॉलम वाले पेज और टेबल अक्सर क्रम बदले हुए या नंबरों की लाइन में बदले हुए आते हैं। कम रिज़ॉल्यूशन, असमान रोशनी, तिरछी फ़ोटो, छोटे अक्षर या हाथ की लिखावट भी सटीकता घटाते हैं।

आपकी फ़ाइल ज़्यादातर आपके डिवाइस पर ही रहती है

Tesseract.js और PDF.js इसी टैब में चलकर फ़ाइल पढ़ते हैं और उसका टेक्स्ट पहचानते हैं। फ़ाइल ख़ुद अपलोड नहीं होती। अगर आप टेक्स्ट का अनुवाद करें दबाते हैं, तो पुष्टि के बाद पहचाना गया टेक्स्ट, फ़ाइल को नहीं, MyMemory के ट्रांसलेशन API को भेजा जाता है।