स्कैन किए PDF को सर्च करने लायक बनाएं (OCR)
स्कैन किए पेज में एक छिपी टेक्स्ट लेयर जोड़ें, ताकि उनका टेक्स्ट सर्च, सिलेक्ट और कॉपी हो सके। पेज बिल्कुल पहले जैसे दिखते हैं।
हमारे सर्वर पर प्रोसेस होती है, फिर हटा दी जाती है
स्कैन किया PDF यहाँ छोड़ें
या इसे इस पेज पर कहीं भी खींचकर लाएं। 10 MB तक।
सिर्फ़ इस एक काम के लिए हमारे सर्वर पर भेजी जाती है, फिर हटा दी जाती है। न कभी सेव की जाती है, न लॉग।
एक PDF 10 MB तक, हर काम में 10 पेज तक, अंग्रेज़ी टेक्स्ट। हमारे सर्वर पर प्रोसेस होती है, फिर हटा दी जाती है। हर व्यक्ति के लिए रोज़ 10 मुफ़्त सर्वर टास्क, जो सभी सर्वर टूल में साझा होते हैं। बड़े काम के लिए: PDF OCR API (हर कॉल पर भुगतान)।
PDF को सर्च करने लायक कैसे बनाएं
- 10 MB तक का स्कैन किया PDF चुनें, या उसे पेज पर खींचकर छोड़ें।
- पढ़ने वाले पेज चुनें: छोटी फ़ाइलों के लिए सभी, या एक बार में 10 तक।
- सर्च करने लायक बनाएं दबाएं, फिर PDF डाउनलोड करें। पहचाना गया टेक्स्ट कॉपी या सेव भी कर सकते हैं।
OCR स्कैन किए PDF के साथ क्या करता है
स्कैनर या फ़ोन ऐप हर पेज को एक तस्वीर के रूप में सेव करता है। आप उसे पढ़ सकते हैं, पर आपका कंप्यूटर नहीं: सर्च में कुछ नहीं मिलता और आप एक वाक्य भी कॉपी नहीं कर सकते। ऑप्टिकल कैरेक्टर रिकग्निशन (OCR) तस्वीर को देखता है, अक्षर और शब्द पहचानता है, और उन्हें PDF में अदृश्य टेक्स्ट के रूप में ठीक उन शब्दों के ऊपर लिख देता है जो आपको दिखते हैं।
हमारा सर्वर चुने गए हर पेज को 200 से 300 dpi पर रेंडर करता है, ओपन-सोर्स Tesseract इंजन से पढ़ता है, और टेक्स्ट को मूल पेज के ऊपर बिना उसे बदले रख देता है। पहचाना गया टेक्स्ट यहाँ भी दिखता है, ताकि आप उसे तुरंत कॉपी कर सकें।
सुझाव
- सबसे अच्छी सटीकता के लिए 300 dpi पर ब्लैक-एंड-व्हाइट या ग्रे में स्कैन करें।
- पेज उलटे या आड़े हैं? पहले उन्हें PDF घुमाएं से घुमाएं (आपके ब्राउज़र में)।
- PDF की जगह फ़ोटो या स्क्रीनशॉट है? इमेज से टेक्स्ट (OCR) इस्तेमाल करें।
अक्सर पूछे जाने वाले सवाल
क्या मेरा PDF अपलोड होता है?
हाँ। इस साइट के ज़्यादातर टूल से अलग, यह हमारे सर्वर पर चलता है: आपका PDF HTTPS से भेजा जाता है, OCR इंजन उसे पढ़ता है, और सर्च करने लायक कॉपी सीधे आपके ब्राउज़र को लौटा दी जाती है। फ़ाइल सर्वर पर सिर्फ़ काम चलने के दौरान रहती है, मेमोरी में और एक निजी अस्थायी फ़ोल्डर में, जो काम खत्म होते ही हटा दिया जाता है। हम न PDF सेव करते हैं, न नतीजा, न पहचाना गया टेक्स्ट, और फ़ाइल की सामग्री कभी लॉग नहीं करते।
OCR मेरे PDF में क्या बदलता है?
ऐसा कुछ नहीं जो आपको दिखे। हर पेज को ओपन-सोर्स Tesseract OCR इंजन पढ़ता है, और जो शब्द वह पाता है उन्हें पेज के ऊपर सही जगह पर अदृश्य टेक्स्ट के रूप में रखा जाता है। मूल पेज नीचे जस का तस रहता है, इसलिए PDF वैसा ही दिखता है, पर सर्च, सिलेक्ट और कॉपी करने लायक हो जाता है।
एक बार में सिर्फ़ 10 पेज क्यों?
एक पेज पढ़ने में सर्वर के कुछ सेकंड लगते हैं, और हर काम को लगभग एक मिनट में खत्म होना होता है। लंबे दस्तावेज़ के लिए डाउनलोड की गई फ़ाइल पर अगले पेजों के साथ, जैसे 11-20, टूल फिर चलाएं। जो पेज हो चुके हैं वे जैसे हैं वैसे रहते हैं।
कौन-सी भाषाएं चलती हैं?
अंग्रेज़ी, और उसी लैटिन लिपि में बिना उच्चारण चिह्न वाली दूसरी भाषाएं, कम सटीकता के साथ। उच्चारण चिह्न वाले अक्षर और दूसरी लिपियाँ अभी भरोसे से नहीं पहचानी जातीं।
मेरे पेजों में पहले से टेक्स्ट है। क्या होगा?
जिन पेजों में पहले से टेक्स्ट है उन्हें छोड़ दिया जाता है, इसलिए वर्ड प्रोसेसर से बना PDF जैसा है वैसा रहता है। फिर भी उन पर OCR करने के लिए, जैसे जब स्कैन की टेक्स्ट लेयर खराब हो, जिन पेजों में पहले से टेक्स्ट है उन्हें भी पढ़ें पर टिक करें।
यह कितना सटीक है?
सामान्य रेज़ोल्यूशन के साफ़, सीधे स्कैन बहुत अच्छे आते हैं। तिरछे कोण से ली गई फ़ोटो, फीकी या धुंधली छपाई, हाथ की लिखावट और जटिल टेबल में ज़्यादा गलतियाँ होती हैं। नाम और संख्याएं भरोसा करने से पहले जाँच लें।
क्या कोई सीमा है?
10 MB तक की फ़ाइलें, हर काम में 10 पेज तक, और हर व्यक्ति के लिए रोज़ 10 मुफ़्त सर्वर टास्क, जो हमारे सभी सर्वर टूल में साझा होते हैं। सिर्फ़ सफल काम गिने जाते हैं, और गिनती UTC आधी रात को रीसेट होती है। बड़े काम के लिए: PDF OCR API, हर कॉल पर भुगतान।
इंसान होने की जाँच क्या है?
काम चलने से पहले Cloudflare Turnstile जाँचता है कि टूल कोई इंसान इस्तेमाल कर रहा है, बॉट नहीं। यह आमतौर पर दिखती नहीं; कभी-कभी आपसे एक बॉक्स पर टिक करने को कहती है।