TanodTools
HI

PDF से टेक्स्ट निकालें

PDF का टेक्स्ट पेज-दर-पेज निकालें, फिर उसे कॉपी करें या .txt फ़ाइल के रूप में सेव करें। स्कैन की हुई PDF में निकालने लायक टेक्स्ट होता ही नहीं; ऐसी PDF के लिए PDF OCR इस्तेमाल करें।

आपकी फ़ाइलें कभी आपके डिवाइस से बाहर नहीं जातीं

PDF यहाँ छोड़ें

या इसे इस पेज पर कहीं भी खींचकर लाएं।

इसी डिवाइस पर खुलती है। कुछ भी अपलोड नहीं होता।

एक बार में एक PDF, 200 MB और 500 पेज तक। यह टूल वही टेक्स्ट पढ़ता है जो PDF में सेव होता है। स्कैन की हुई PDF में सिर्फ़ पेजों की तस्वीरें होती हैं, टेक्स्ट नहीं, इसलिए उसके लिए यह टूल नहीं, PDF OCR चाहिए। टेबल और कॉलम लाइन-दर-लाइन निकलते हैं, और पासवर्ड वाली PDF खोली नहीं जा सकतीं।

PDF से टेक्स्ट कैसे निकालें

  1. PDF फ़ाइल चुनें, या उसे पेज पर खींचकर लाएं।
  2. पेज पढ़े जाने तक थोड़ा रुकें। सभी पेज चुनें या 1-3, 5 जैसी रेंज, और तय करें कि हर पेज की शुरुआत पर निशान लगाना है या नहीं।
  3. .txt डाउनलोड करें दबाएं, या पूरा टेक्स्ट कॉपी करें, या सूची में से किसी एक पेज का टेक्स्ट कॉपी करें।

PDF में टेक्स्ट कहाँ से आता है

वर्ड प्रोसेसर, ब्राउज़र या डिज़ाइन प्रोग्राम से बनी PDF अपने शब्द टेक्स्ट के रूप में सेव करती है: अक्षरों के हर टुकड़े के साथ उसका फ़ॉन्ट और पेज पर उसकी जगह भी दर्ज होती है। यह टूल यही सेव किया हुआ टेक्स्ट पढ़ता है। आपका ब्राउज़र फ़ाइल को pdf.js से खोलता है, हर पेज से उसका टेक्स्ट माँगता है, और इन टुकड़ों को उसी क्रम में वापस लाइनों में जोड़ देता है जिस क्रम में वे फ़ाइल में दर्ज हैं। पेज स्क्रीन पर कैसा दिखता है, यह वह कभी नहीं देखता।

स्कैन की हुई PDF अलग होती है। स्कैनर या फ़ोन का कैमरा हर पेज की एक तस्वीर बनाता है, और PDF में सिर्फ़ वही तस्वीरें होती हैं, इसलिए पढ़ने को कोई टेक्स्ट नहीं होता: आपको शब्द दिखते हैं, पर फ़ाइल में वे होते नहीं। तस्वीरों को वापस टेक्स्ट में बदलना एक अलग काम है, जिसे ऑप्टिकल कैरेक्टर रिकग्निशन कहते हैं और जो PDF OCR करता है। जिन पेजों में टेक्स्ट नहीं होता, उन्हें टेक्स्ट बॉक्स के नीचे की सूची में चिह्नित किया जाता है, ताकि जिस फ़ाइल में दोनों तरह के पेज हों, उसमें आप स्कैन और सामान्य पेजों का फ़र्क़ पहचान सकें।

नतीजा बिना फ़ॉर्मैटिंग का सादा टेक्स्ट होता है। लाइनें वहीं खत्म होती हैं जहाँ PDF में खत्म होती हैं, और जहाँ दो लाइनों के बीच की दूरी उस पेज की सामान्य दूरी से साफ़ तौर पर ज़्यादा हो, वहाँ एक खाली लाइन जोड़ दी जाती है; इसी से पैराग्राफ़ और शीर्षक एक-दूसरे से अलग होते हैं। कुछ फ़ॉन्ट fi और fl जैसे अक्षर-जोड़ों के लिए जो लिगेचर इस्तेमाल करते हैं, उन्हें वापस अलग-अलग अक्षरों में बदल दिया जाता है, और अदृश्य सॉफ़्ट हाइफ़न हटा दिए जाते हैं।

सुझाव

  • स्कैन किए पेज बिना टेक्स्ट वाले पेज के रूप में दिखते हैं। उन पर PDF OCR चलाएं और नतीजा पढ़ें।
  • एक के नीचे एक टूटी लाइनों को जुड़े हुए पैराग्राफ़ में बदलने के लिए टेक्स्ट को लाइन ब्रेक हटाएं में पेस्ट करें।
  • कुछ ही पेज PDF के रूप में चाहिए? PDF से पेज निकालें उन्हें अलग कर देता है, और कॉपी किए हुए टेक्स्ट को शब्द गिनें से गिन सकते हैं।

अक्सर पूछे जाने वाले सवाल

क्या मेरी PDF अपलोड होती है?

नहीं। आपका ब्राउज़र ओपन-सोर्स pdf.js लाइब्रेरी से, आपके डिवाइस पर ही टेक्स्ट पढ़ता है। सर्वर पर कुछ नहीं भेजा जाता, और टैब बंद करते ही टेक्स्ट मिट जाता है।

मुझे टेक्स्ट क्यों नहीं मिला, या सिर्फ़ कुछ पेजों का ही टेक्स्ट क्यों मिला?

यह टूल वही टेक्स्ट पढ़ता है जो PDF में सेव होता है। स्कैन की हुई PDF हर पेज को तस्वीर के रूप में सेव करती है, उसके पीछे कोई टेक्स्ट नहीं होता, इसलिए पढ़ने को कुछ नहीं मिलता। यही बात उन स्कैन किए पेजों पर भी लागू होती है जो किसी सामान्य दस्तावेज़ में जोड़े गए हों। तस्वीरों के अक्षर पहचानने के लिए PDF OCR इस्तेमाल करें। जिन पेजों में टेक्स्ट नहीं होता, उन्हें पेज-दर-पेज सूची में चिह्नित किया जाता है।

क्या फ़ॉर्मैटिंग बनी रहती है?

नहीं। आपको सादा टेक्स्ट मिलता है: अक्षर, अंक और लाइन ब्रेक। फ़ॉन्ट, रंग, इमेज और पेज का लेआउट शामिल नहीं होते। लाइनें वहीं टूटती हैं जहाँ PDF में टूटती हैं, और जहाँ दो लाइनों के बीच की दूरी सामान्य से ज़्यादा हो, जैसे पैराग्राफ़ के बीच, वहाँ एक खाली लाइन जोड़ दी जाती है।

टूटी हुई लाइनों को पैराग्राफ़ में कैसे जोड़ूँ?

टेक्स्ट को लाइन ब्रेक हटाएं में पेस्ट करें। वह हर पैराग्राफ़ के अंदर की लाइनें जोड़ देता है, पैराग्राफ़ के बीच की खाली लाइनें बनाए रखता है, और लाइन के अंत में हाइफ़न से टूटे शब्दों को भी ठीक कर सकता है।

कुछ टेक्स्ट गड़बड़ क्रम में क्यों आता है, या अजीब टुकड़ों में क्यों बँट जाता है?

टेक्स्ट उसी क्रम में निकलता है जिसमें PDF उसे सेव करती है; यह क्रम आमतौर पर पढ़ने का क्रम होता है, पर हमेशा नहीं। टेबल, कई कॉलम वाले पेज, और डिज़ाइन प्रोग्राम से एक्सपोर्ट की गई PDF का टेक्स्ट गड़बड़ क्रम में आ सकता है, और कुछ PDF टेक्स्ट ऐसे टुकड़ों में सेव करती हैं जो आपको दिखने वाले शब्दों से मेल नहीं खाते।

क्या यह अंग्रेज़ी के अलावा दूसरी भाषाओं के टेक्स्ट के साथ भी काम करता है?

हाँ। टेक्स्ट Unicode के रूप में पढ़ा जाता है, इसलिए उच्चारण चिह्न वाले अक्षर, सिरिलिक, ग्रीक, हिंदी, चीनी और दूसरी लिपियाँ भी निकलती हैं, बशर्ते PDF में सही टेक्स्ट लेयर हो। अगर PDF में फ़ॉन्ट का सेटअप असामान्य हो, तो किसी भी प्रोग्राम में कॉपी करने पर अक्षर गड़बड़ आते हैं; आमतौर पर इसका हल उस पर OCR चलाना है।