आपने कोई दस्तावेज़ स्कैन किया, PDF खोली और कोई अनुच्छेद कॉपी करना चाहा, पर कुछ चुना ही नहीं जा रहा। किसी नाम को खोजा तो कुछ नहीं मिला। यह कोई गड़बड़ी नहीं है: स्कैनर या फ़ोन का कैमरा पन्ने की तस्वीर सेव करता है। OCR (ऑप्टिकल कैरेक्टर रिकग्निशन) उसी तस्वीर को पढ़कर आकृतियों को असली अक्षरों में बदलता है, ताकि आप उन्हें खोज, चुन और कॉपी कर सकें।
दो आम काम
- PDF वैसी ही रखनी है, बस सर्चेबल बनानी है। PDF OCR टूल इस्तेमाल करें। नतीजा आपके स्कैन जैसा ही दिखता है, पर उसका टेक्स्ट चुना और खोजा जा सकता है।
- फ़ोटो या स्क्रीनशॉट से सिर्फ़ टेक्स्ट चाहिए। इमेज से टेक्स्ट इस्तेमाल करें, जो तस्वीर से कॉपी करने लायक टेक्स्ट निकालता है। हिंदी और अंग्रेज़ी दोनों इसमें पहले से शामिल हैं।
चरण

- स्कैन की हुई PDF या फ़ोटो को संबंधित टूल में अपलोड करें।
- पहचान पूरी होने का इंतज़ार करें। लंबे दस्तावेज़ में ज़्यादा समय लगता है, क्योंकि हर पन्ना जाँचा जाता है।
- सर्चेबल PDF डाउनलोड करें, या निकला हुआ टेक्स्ट कॉपी करें।
- टेक्स्ट को ध्यान से पढ़कर सुधारें। साफ़ छपे हुए टेक्स्ट पर OCR बहुत अच्छा होता है, पर कभी पूरी तरह सही नहीं होता।
OCR चलाने से पहले बेहतर नतीजे के लिए
- रेज़ोल्यूशन: छपे हुए टेक्स्ट के लिए 300 dpi सबसे उपयुक्त माना जाता है। लगभग 150 dpi से नीचे छोटे अक्षर आपस में मिलने लगते हैं।
- सीधा पन्ना: तिरछी फ़ोटो से पंक्तियाँ झुकी दिखती हैं। पन्ने को समतल रखें और फ़ोन को उसके समानांतर पकड़ें। ज़रूरत हो तो पहले PDF घुमाएँ से पन्ने सीधे करें।
- अच्छी रोशनी, परछाईं नहीं: आपके हाथ की परछाईं भी तस्वीर का हिस्सा मानी जाती है।
- ज़्यादा कंट्रास्ट: सफ़ेद काग़ज़ पर काला टेक्स्ट सबसे अच्छा रहता है। फीकी मुहर या रंगीन पृष्ठभूमि से सटीकता घटती है।
- एक पन्ने पर एक ही भाषा: मिली-जुली लिपियाँ पहचानना कठिन होता है।
हिंदी टेक्स्ट में किन बातों का ध्यान रखें
देवनागरी में मात्राएँ, आधे अक्षर और संयुक्ताक्षर होते हैं, इसलिए OCR में ग़लती की गुंजाइश अंग्रेज़ी से ज़्यादा रहती है। पढ़ते समय ख़ास तौर पर बिंदु और चंद्रबिंदु, छोटी-बड़ी इ-ई की मात्रा और संख्याएँ जाँचें। नाम, पते और तारीख़ों को मूल दस्तावेज़ से मिलाना न भूलें, क्योंकि फ़ॉर्म में एक अक्षर की ग़लती भी आपत्ति बन सकती है।
OCR के बाद क्या जाँचें
सबसे पहले संख्याएँ पढ़ें। मिलते-जुलते अक्षर क्लासिक ग़लतियाँ हैं: अक्षर O और अंक 0, अक्षर l और अंक 1, या 5 और S। नाम, तारीख़, रकम और संदर्भ संख्याएँ मूल से मिलाएँ। तालिकाएँ और हाथ की लिखावट सबसे कठिन होती हैं; हाथ की लिखावट अक्सर भरोसेमंद ढंग से नहीं पहचानी जाती।
OCR और फ़ाइल का साइज़
सर्चेबल PDF का साइज़ स्कैन के बराबर होता है और उसमें एक अदृश्य टेक्स्ट परत जुड़ जाती है। अगर अपलोड के लिए वह भारी लगे, तो बाद में उसे कंप्रेस कर लें।
अक्सर पूछे जाने वाले सवाल
कैसे पता चले कि मेरी PDF को OCR चाहिए?
टेक्स्ट चुनने या कोई शब्द खोजने की कोशिश करें। अगर कुछ हाइलाइट या प्राप्त न हो, तो पन्ने तस्वीर हैं और OCR चाहिए।
क्या OCR हाथ की लिखावट पढ़ लेता है?
सिर्फ़ आंशिक रूप से। यह छपे हुए टेक्स्ट के लिए बना है। साफ़ अलग-अलग अक्षरों में लिखा टेक्स्ट जुड़ी हुई लिखावट से बेहतर पहचाना जाता है, फिर भी नतीजे की जाँच ज़रूर करें।
कौन-सी भाषाएँ समर्थित हैं?
हिंदी और अंग्रेज़ी शुरू से उपलब्ध हैं। बाकी भाषाएँ सर्वर पर इंस्टॉल भाषा पैक पर निर्भर करती हैं, इसलिए टूल का पेज देख लें।
क्या OCR से मेरा दस्तावेज़ बदल जाएगा?
सर्चेबल PDF में पन्ने की तस्वीर वैसी ही रहती है; पहचाना गया टेक्स्ट उसके पीछे अदृश्य रूप से जोड़ा जाता है।