स्रोत लिंक एकत्र करें
रिपोर्ट और अनुसंधान दस्तावेजों से एक संदर्भ सूची बनाएं।
अपने PDF से उपयोगी लिंक बाहर निकालें।
| प्रकार | मान | गणना | पृष्ठ |
|---|
कॉपी और डाउनलोड में सभी परिणाम पृष्ठों की सभी मिलान वाली पंक्तियाँ शामिल हैं। CSV में गणना और PDF पृष्ठ संख्याएँ शामिल हैं; TXT में केवल मान होते हैं।
अपना स्रोत जांचने के लिए परिणामों में एक पृष्ठ संख्या चुनें। हाइलाइट्स अनुमानित स्थिति दिखाते हैं।
आपकी सूची तैयार है। इसे डाउनलोड करें, या समीक्षा करने और प्रारूप बदलने के लिए वापस जाएं।
चयन योग्य टेक्स्ट वाली दस्तावेज़ लोड करें, या नमूना आज़माएं।
एक्सट्रैक्ट चुनें। मानों, गणनाओं और स्रोत पृष्ठों की समीक्षा करें; सूची को फ़िल्टर या क्रमबद्ध करें।
मानों को कॉपी करें, या पृष्ठ संदर्भों के साथ CSV या एक सरल TXT सूची डाउनलोड करें।
एक PDF से मुद्रित HTTP/HTTPS पते, www पते और क्लिक करने योग्य वेब-लिंक लक्ष्य एकत्र करें। पेज संदर्भ रखें और एक डिडुप्लिकेटेड सूची CSV या TXT के रूप में डाउनलोड करें।
रिपोर्ट और अनुसंधान दस्तावेजों से एक संदर्भ सूची बनाएं।
क्लिक करने योग्य संसाधन लेबल के पीछे के गंतव्य निकालें।
कहीं और समीक्षा करने से पहले रिकॉर्ड करें कि प्रत्येक लिंक कहाँ पाया गया था।
लिंक लक्ष्य को तब भी शामिल करें जब उसका लेबल केवल “और पढ़ें” कहता हो।
http://, https:// या www. से शुरू होने वाले मुद्रित लिंक पहचाने जाते हैं। पीडीएफ लिंक एनोटेशन सामान्य टेक्स्ट के पीछे HTTP/HTTPS लक्ष्यों को भी प्रकट कर सकते हैं। पीडीएफ को यूआरएल को उसके क्लिक करने योग्य लेबल के रूप में प्रदर्शित करने की आवश्यकता नहीं है।
एक पृष्ठ पर समान मुद्रित लक्ष्य और एनोटेशन की दोहरी गिनती नहीं की जाती है। डुप्लिकेट तुलना के लिए सामान्यीकृत यूआरएल रूपों का उपयोग किया जाता है, जबकि पहली पहचानी गई वर्तनी प्रदर्शित की जाती है। लंबे, लिपटे या क्षतिग्रस्त यूआरएल को मैन्युअल सुधार की आवश्यकता हो सकती है। कोई भी निकाला गया यूआरएल स्वचालित रूप से फ़ेच नहीं किया जाता है।
गिनती की जांच करें, पीडीएफ पृष्ठ पर जाएं, और परिणाम सूची को फ़िल्टर करें।
प्रत्येक परिणाम पीडीएफ में भौतिक पृष्ठ स्थिति को रिकॉर्ड करता है, जो मुद्रित पृष्ठ संख्याओं से भिन्न हो सकता है। पूर्वावलोकन को अनुमानित हाइलाइट के साथ खोलने के लिए एक पेज चिप चुनें।
डुप्लिकेट हटाएं विकल्प सक्षम रहता है। गिनती एक ही मान की पहचाने गए पुनरावृत्तियों को जोड़ती है; अलग-अलग घटनाओं को देखने के लिए इसे बंद करें। वर्णानुक्रम में क्रमबद्ध करें सूची के क्रम को बदल देता है। फ़िल्टरिंग कॉपी करने और डाउनलोड करने के साथ-साथ दृश्य पंक्तियों पर भी लागू होती है।
गिनती और पृष्ठों के लिए CSV चुनें, या प्रति पंक्ति एक मान के लिए TXT चुनें।
CSV में Type, Value, Count और Pages कॉलम होते हैं। UTF-8 एन्कोडिंग अरबी और अन्य लिपियों का समर्थन करती है। जिन मानों को स्प्रेडशीट फ़ार्मुलों के रूप में समझा जा सकता है, उन्हें सुरक्षित आयात के लिए एक एपोस्ट्रोफी के साथ प्रीफ़िक्स किया जाता है।
TXT और 'सभी कॉपी करें' में केवल मान होते हैं, प्रति पंक्ति एक। फ़िल्टर से मेल खाने वाली सभी पंक्तियाँ शामिल की जाती हैं, तब भी जब ऑन-स्क्रीन तालिका कई परिणाम पृष्ठों में फैली हो। कोई नई PDF नहीं बनाई जाती है और स्रोत PDF अपरिवर्तित रहती है।
अपने ब्राउज़र में एक PDF प्रोसेस करें, स्पष्ट सीमाओं और आंशिक-परिणाम सूचनाओं के साथ।
50 MiB और 500 पृष्ठों तक की एक PDF लोड करें। एक्सट्रैक्शन प्रति पृष्ठ 250,000 वर्णों और 2,000 मिलानों, कुल मिलाकर 10 मिलियन वर्णों और 20,000 मिलानों, और प्रति पृष्ठ 2,000 एनोटेशन की जाँच करता है। 90-सेकंड का एक्सट्रैक्शन बजट लंबी प्रक्रियाओं को सीमित करता है। बहुत जटिल दस्तावेज़ छोटी फ़ाइलों में विभाजित होने पर बेहतर काम कर सकते हैं।
जब कोई सीमा पूरी हो जाती है या किसी पृष्ठ को पूरी तरह से नहीं पढ़ा जा सकता है, तो परिणाम एक सूचना दिखाते हैं और सीमित या विफल रन फ़ाइल नाम में 'partial' के साथ निर्यात होते हैं। बिना चयन योग्य टेक्स्ट वाले पृष्ठों को अलग से गिना जाता है। केवल-छवि स्कैन के लिए PDF OCR का उपयोग करें, फिर पहचाने गए टेक्स्ट को निकालने के लिए वापस आएं।
PDF सामग्री को इस ब्राउज़र में स्थानीय रूप से प्रोसेस किया जाता है। अपलोड किए गए दस्तावेज़ों को एक्सट्रैक्शन सर्वर पर नहीं भेजा जाता है। PDF के अंदर पाए गए लिंक, ईमेल पते और फ़ोन नंबरों से कभी भी स्वचालित रूप से संपर्क नहीं किया जाता है।
50 MB और 750 पृष्ठों तक की एक PDF खोलें। जटिल दस्तावेज़ों के लिए अतिरिक्त आउटपुट, मेमोरी और प्रसंस्करण सीमाएं लागू हो सकती हैं।
प्रसंस्करण दस्तावेज़ अपलोड किए बिना आपके डिवाइस पर होता है। पृष्ठ बंद करने से पहले अपना परिणाम डाउनलोड करें; मूल फ़ाइल को अलग से सुरक्षित रखें।
शुरू करने से पहले जानें कि क्या उम्मीद करनी है।
आपके डिवाइस परएक PDF से मुद्रित HTTP/HTTPS पते, www पते और क्लिक करने योग्य वेब-लिंक लक्ष्य एकत्र करें। पृष्ठ संदर्भ रखें और CSV या TXT के रूप में डुप्लिकेट-मुक्त सूची डाउनलोड करें। टूल यह जांच नहीं करता है कि लिंक अभी भी काम कर रहे हैं या नहीं। आंतरिक पृष्ठ गंतव्य, JavaScript क्रियाएं, mailto और अन्य गैर-वेब योजनाएं वेब लिंक के रूप में निर्यात नहीं की जाती हैं।
केवल चयन योग्य टेक्स्ट और पहचाने गए लिंक लक्ष्य ही पढ़े जाते हैं। केवल-छवि वाले पृष्ठों को पहले PDF OCR की आवश्यकता होती है। OCR चलाएं, खोजने योग्य PDF डाउनलोड करें, फिर इस एक्सट्रैक्टर पर वापस आएं।
डुप्लिकेट हटाना पहचाने गए समान मानों को संयोजित करता है। काउंट पता चली घटनाओं को दिखाता है और पेज भौतिक PDF पृष्ठ स्थितियों को सूचीबद्ध करते हैं। घटनाओं को अलग रखने के लिए विकल्प को अक्षम करें। एक ही पृष्ठ पर मुद्रित लक्ष्य और मिलान करने वाले क्लिक करने योग्य लिंक की दोहरी गणना नहीं की जाती है।
CSV में प्रकार, मान, घटना गणना और पृष्ठ संदर्भ शामिल हैं। TXT और 'सभी कॉपी करें' केवल मान प्रदान करते हैं, प्रति पंक्ति एक। वर्तमान फ़िल्टर से मेल खाने वाली सभी पंक्तियाँ शामिल की जाती हैं, न कि केवल दृश्यमान तालिका पृष्ठ।
नहीं। PDF पार्सिंग, मिलान और निर्यात इस ब्राउज़र में चलते हैं। मूल PDF अपरिवर्तित रहती है। किसी भी निकाले गए लिंक, ईमेल या फ़ोन नंबर से स्वचालित रूप से संपर्क नहीं किया जाता है।
50 MiB और 500 पृष्ठों तक की एक PDF। निष्कर्षण 250,000 टेक्स्ट वर्णों और प्रति पृष्ठ 2,000 मिलान, कुल 10 मिलियन वर्णों और 20,000 मिलान, और प्रति पृष्ठ 2,000 एनोटेशन तक सीमित है। यदि सीमाएं या अपठनीय पृष्ठ परिणामों को आंशिक बनाते हैं तो परिणामों पर एक सूचना दी जाती है।
त्वरित वीडियो ट्यूटोरियल
PDF से लिंक और URL कैसे एक्सट्रैक्ट करें
उपयोगी वेब लिंक को एक-एक करके खोले बिना रखें।
अंग्रेजी वर्णन
वीडियो देखें