LoveByPDF logo

LoveByPDF

HI

स्कैन की हुई PDF से टेक्स्ट कॉपी कैसे करें: हिंदी और अंग्रेज़ी OCR की पूरी गाइड

स्कैन की हुई PDF से टेक्स्ट कॉपी कैसे करें: हिंदी और अंग्रेज़ी OCR की पूरी गाइड

आपने कोई दस्तावेज़ स्कैन किया, PDF खोली और कोई अनुच्छेद कॉपी करना चाहा, पर कुछ चुना ही नहीं जा रहा। किसी नाम को खोजा तो कुछ नहीं मिला। यह कोई गड़बड़ी नहीं है: स्कैनर या फ़ोन का कैमरा पन्ने की तस्वीर सेव करता है। OCR (ऑप्टिकल कैरेक्टर रिकग्निशन) उसी तस्वीर को पढ़कर आकृतियों को असली अक्षरों में बदलता है, ताकि आप उन्हें खोज, चुन और कॉपी कर सकें।

दो आम काम

  • PDF वैसी ही रखनी है, बस सर्चेबल बनानी है। PDF OCR टूल इस्तेमाल करें। नतीजा आपके स्कैन जैसा ही दिखता है, पर उसका टेक्स्ट चुना और खोजा जा सकता है।
  • फ़ोटो या स्क्रीनशॉट से सिर्फ़ टेक्स्ट चाहिए। इमेज से टेक्स्ट इस्तेमाल करें, जो तस्वीर से कॉपी करने लायक टेक्स्ट निकालता है। हिंदी और अंग्रेज़ी दोनों इसमें पहले से शामिल हैं।

चरण

1. अपलोड करें - 2. सर्चेबल PDF बनाएँ (OCR) - 3. डाउनलोड करें
  1. स्कैन की हुई PDF या फ़ोटो को संबंधित टूल में अपलोड करें।
  2. पहचान पूरी होने का इंतज़ार करें। लंबे दस्तावेज़ में ज़्यादा समय लगता है, क्योंकि हर पन्ना जाँचा जाता है।
  3. सर्चेबल PDF डाउनलोड करें, या निकला हुआ टेक्स्ट कॉपी करें।
  4. टेक्स्ट को ध्यान से पढ़कर सुधारें। साफ़ छपे हुए टेक्स्ट पर OCR बहुत अच्छा होता है, पर कभी पूरी तरह सही नहीं होता।

OCR चलाने से पहले बेहतर नतीजे के लिए

  • रेज़ोल्यूशन: छपे हुए टेक्स्ट के लिए 300 dpi सबसे उपयुक्त माना जाता है। लगभग 150 dpi से नीचे छोटे अक्षर आपस में मिलने लगते हैं।
  • सीधा पन्ना: तिरछी फ़ोटो से पंक्तियाँ झुकी दिखती हैं। पन्ने को समतल रखें और फ़ोन को उसके समानांतर पकड़ें। ज़रूरत हो तो पहले PDF घुमाएँ से पन्ने सीधे करें।
  • अच्छी रोशनी, परछाईं नहीं: आपके हाथ की परछाईं भी तस्वीर का हिस्सा मानी जाती है।
  • ज़्यादा कंट्रास्ट: सफ़ेद काग़ज़ पर काला टेक्स्ट सबसे अच्छा रहता है। फीकी मुहर या रंगीन पृष्ठभूमि से सटीकता घटती है।
  • एक पन्ने पर एक ही भाषा: मिली-जुली लिपियाँ पहचानना कठिन होता है।

हिंदी टेक्स्ट में किन बातों का ध्यान रखें

देवनागरी में मात्राएँ, आधे अक्षर और संयुक्ताक्षर होते हैं, इसलिए OCR में ग़लती की गुंजाइश अंग्रेज़ी से ज़्यादा रहती है। पढ़ते समय ख़ास तौर पर बिंदु और चंद्रबिंदु, छोटी-बड़ी इ-ई की मात्रा और संख्याएँ जाँचें। नाम, पते और तारीख़ों को मूल दस्तावेज़ से मिलाना न भूलें, क्योंकि फ़ॉर्म में एक अक्षर की ग़लती भी आपत्ति बन सकती है।

OCR के बाद क्या जाँचें

सबसे पहले संख्याएँ पढ़ें। मिलते-जुलते अक्षर क्लासिक ग़लतियाँ हैं: अक्षर O और अंक 0, अक्षर l और अंक 1, या 5 और S। नाम, तारीख़, रकम और संदर्भ संख्याएँ मूल से मिलाएँ। तालिकाएँ और हाथ की लिखावट सबसे कठिन होती हैं; हाथ की लिखावट अक्सर भरोसेमंद ढंग से नहीं पहचानी जाती।

OCR और फ़ाइल का साइज़

सर्चेबल PDF का साइज़ स्कैन के बराबर होता है और उसमें एक अदृश्य टेक्स्ट परत जुड़ जाती है। अगर अपलोड के लिए वह भारी लगे, तो बाद में उसे कंप्रेस कर लें।

अक्सर पूछे जाने वाले सवाल

कैसे पता चले कि मेरी PDF को OCR चाहिए?

टेक्स्ट चुनने या कोई शब्द खोजने की कोशिश करें। अगर कुछ हाइलाइट या प्राप्त न हो, तो पन्ने तस्वीर हैं और OCR चाहिए।

क्या OCR हाथ की लिखावट पढ़ लेता है?

सिर्फ़ आंशिक रूप से। यह छपे हुए टेक्स्ट के लिए बना है। साफ़ अलग-अलग अक्षरों में लिखा टेक्स्ट जुड़ी हुई लिखावट से बेहतर पहचाना जाता है, फिर भी नतीजे की जाँच ज़रूर करें।

कौन-सी भाषाएँ समर्थित हैं?

हिंदी और अंग्रेज़ी शुरू से उपलब्ध हैं। बाकी भाषाएँ सर्वर पर इंस्टॉल भाषा पैक पर निर्भर करती हैं, इसलिए टूल का पेज देख लें।

क्या OCR से मेरा दस्तावेज़ बदल जाएगा?

सर्चेबल PDF में पन्ने की तस्वीर वैसी ही रहती है; पहचाना गया टेक्स्ट उसके पीछे अदृश्य रूप से जोड़ा जाता है।