पहचानकर्ता एकत्र करें
DOI और ISBN मानों को उन पेजों के साथ एकत्र करें जहां वे दिखाई देते हैं।
अपनी ज़रूरत का डेटा खोजें। हर परिणाम के साथ स्रोत पेज रखें।
| प्रकार | मान | गणना | पृष्ठ |
|---|
कॉपी और डाउनलोड में सभी परिणाम पृष्ठों की सभी मिलान वाली पंक्तियाँ शामिल हैं। CSV में गणना और PDF पृष्ठ संख्याएँ शामिल हैं; TXT में केवल मान होते हैं।
अपना स्रोत जांचने के लिए परिणामों में एक पृष्ठ संख्या चुनें। हाइलाइट्स अनुमानित स्थिति दिखाते हैं।
आपकी सूची तैयार है। इसे डाउनलोड करें, या समीक्षा करने और प्रारूप बदलने के लिए वापस जाएं।
चयन योग्य टेक्स्ट वाली दस्तावेज़ लोड करें, या नमूना आज़माएं।
एक्सट्रैक्ट चुनें। मानों, गणनाओं और स्रोत पृष्ठों की समीक्षा करें; सूची को फ़िल्टर या क्रमबद्ध करें।
मानों को कॉपी करें, या पृष्ठ संदर्भों के साथ CSV या एक सरल TXT सूची डाउनलोड करें।
अपनी ज़रूरत के डेटा प्रकार चुनें: ईमेल, फ़ोन नंबर, URL, संख्यात्मक तारीखें, IPv4 पते, डोमेन, DOI, ISBN, हैशटैग और MAC पते। गणना और पेज संदर्भों के साथ निकाले गए मानों की समीक्षा करें।
DOI और ISBN मानों को उन पेजों के साथ एकत्र करें जहां वे दिखाई देते हैं।
दिनांकित प्रविष्टियां और IPv4 पते खोजें।
ईमेल, फोन और वेब लिंक को एक संरचित निर्यात में संयोजित करें।
ईमेल, फोन और यूआरएल से शुरुआत करें, फिर विशेष मानों के लिए अधिक डेटा प्रकार खोलें।
तारीखों में चार अंकों के वर्ष के साथ एक संख्यात्मक प्रारूप का उपयोग करना चाहिए; अस्पष्ट दिन/महीने के मान अपने स्रोत क्रम को बनाए रखते हैं। IPv4 ऑक्टेट्स मान्य हैं; IPv6 शामिल नहीं है।
डोमेन की पहचान मान्यता प्राप्त ईमेल और वेब लिंक से की जाती है, न कि मनमाने फ़ाइल नामों से। DOI एक्सट्रैक्शन सामान्य आधुनिक DOI रूपों को कवर करता है, न कि हर ऐतिहासिक रूप को। ISBN-13 मानों के लिए एक वैध चेकसम की आवश्यकता होती है; ISBN-10 के लिए भी ISBN लेबल आवश्यक है। हैशटैग में अरबी सहित यूनिकोड अक्षर हो सकते हैं।
MAC पते छह कोलन या हाइफ़न से अलग किए गए जोड़े का उपयोग करते हैं। यह टूल कभी भी निकाले गए पतों या पहचानकर्ताओं से संपर्क नहीं करता है।
गिनती की जांच करें, पीडीएफ पृष्ठ पर जाएं, और परिणाम सूची को फ़िल्टर करें।
प्रत्येक परिणाम पीडीएफ में भौतिक पृष्ठ स्थिति को रिकॉर्ड करता है, जो मुद्रित पृष्ठ संख्याओं से भिन्न हो सकता है। पूर्वावलोकन को अनुमानित हाइलाइट के साथ खोलने के लिए एक पेज चिप चुनें।
डुप्लिकेट हटाएं विकल्प सक्षम रहता है। गिनती एक ही मान की पहचाने गए पुनरावृत्तियों को जोड़ती है; अलग-अलग घटनाओं को देखने के लिए इसे बंद करें। वर्णानुक्रम में क्रमबद्ध करें सूची के क्रम को बदल देता है। फ़िल्टरिंग कॉपी करने और डाउनलोड करने के साथ-साथ दृश्य पंक्तियों पर भी लागू होती है।
गिनती और पृष्ठों के लिए CSV चुनें, या प्रति पंक्ति एक मान के लिए TXT चुनें।
CSV में Type, Value, Count और Pages कॉलम होते हैं। UTF-8 एन्कोडिंग अरबी और अन्य लिपियों का समर्थन करती है। जिन मानों को स्प्रेडशीट फ़ार्मुलों के रूप में समझा जा सकता है, उन्हें सुरक्षित आयात के लिए एक एपोस्ट्रोफी के साथ प्रीफ़िक्स किया जाता है।
TXT और 'सभी कॉपी करें' में केवल मान होते हैं, प्रति पंक्ति एक। फ़िल्टर से मेल खाने वाली सभी पंक्तियाँ शामिल की जाती हैं, तब भी जब ऑन-स्क्रीन तालिका कई परिणाम पृष्ठों में फैली हो। कोई नई PDF नहीं बनाई जाती है और स्रोत PDF अपरिवर्तित रहती है।
अपने ब्राउज़र में एक PDF प्रोसेस करें, स्पष्ट सीमाओं और आंशिक-परिणाम सूचनाओं के साथ।
50 MiB और 500 पृष्ठों तक की एक PDF लोड करें। एक्सट्रैक्शन प्रति पृष्ठ 250,000 वर्णों और 2,000 मिलानों, कुल मिलाकर 10 मिलियन वर्णों और 20,000 मिलानों, और प्रति पृष्ठ 2,000 एनोटेशन की जाँच करता है। 90-सेकंड का एक्सट्रैक्शन बजट लंबी प्रक्रियाओं को सीमित करता है। बहुत जटिल दस्तावेज़ छोटी फ़ाइलों में विभाजित होने पर बेहतर काम कर सकते हैं।
जब कोई सीमा पूरी हो जाती है या किसी पृष्ठ को पूरी तरह से नहीं पढ़ा जा सकता है, तो परिणाम एक सूचना दिखाते हैं और सीमित या विफल रन फ़ाइल नाम में 'partial' के साथ निर्यात होते हैं। बिना चयन योग्य टेक्स्ट वाले पृष्ठों को अलग से गिना जाता है। केवल-छवि स्कैन के लिए PDF OCR का उपयोग करें, फिर पहचाने गए टेक्स्ट को निकालने के लिए वापस आएं।
PDF सामग्री को इस ब्राउज़र में स्थानीय रूप से प्रोसेस किया जाता है। अपलोड किए गए दस्तावेज़ों को एक्सट्रैक्शन सर्वर पर नहीं भेजा जाता है। PDF के अंदर पाए गए लिंक, ईमेल पते और फ़ोन नंबरों से कभी भी स्वचालित रूप से संपर्क नहीं किया जाता है।
50 MB और 750 पृष्ठों तक की एक PDF खोलें। जटिल दस्तावेज़ों के लिए अतिरिक्त आउटपुट, मेमोरी और प्रसंस्करण सीमाएं लागू हो सकती हैं।
प्रसंस्करण दस्तावेज़ अपलोड किए बिना आपके डिवाइस पर होता है। पृष्ठ बंद करने से पहले अपना परिणाम डाउनलोड करें; मूल फ़ाइल को अलग से सुरक्षित रखें।
शुरू करने से पहले जानें कि क्या उम्मीद करनी है।
आपके डिवाइस परअपनी आवश्यकता के डेटा प्रकार चुनें: ईमेल, फ़ोन नंबर, URL, संख्यात्मक तिथियां, IPv4 पते, डोमेन, DOI, ISBN, हैशटैग और MAC पते। गणना और पृष्ठ संदर्भों के साथ निकाले गए मानों की समीक्षा करें। यह पहचानने योग्य मान निकालता है, न कि तालिकाएं, चालान या शब्दार्थ फ़ील्ड। पैटर्न और चेकसम शोर को कम करते हैं लेकिन पूर्णता की गारंटी नहीं देते हैं या यह साबित नहीं करते हैं कि कोई पहचानकर्ता वास्तविक है।
केवल चयन योग्य टेक्स्ट और पहचाने गए लिंक लक्ष्य ही पढ़े जाते हैं। केवल-छवि वाले पृष्ठों को पहले PDF OCR की आवश्यकता होती है। OCR चलाएं, खोजने योग्य PDF डाउनलोड करें, फिर इस एक्सट्रैक्टर पर वापस आएं।
डुप्लिकेट हटाना पहचाने गए समान मानों को संयोजित करता है। काउंट पता चली घटनाओं को दिखाता है और पेज भौतिक PDF पृष्ठ स्थितियों को सूचीबद्ध करते हैं। घटनाओं को अलग रखने के लिए विकल्प को अक्षम करें। एक ही पृष्ठ पर मुद्रित लक्ष्य और मिलान करने वाले क्लिक करने योग्य लिंक की दोहरी गणना नहीं की जाती है।
CSV में प्रकार, मान, घटना गणना और पृष्ठ संदर्भ शामिल हैं। TXT और 'सभी कॉपी करें' केवल मान प्रदान करते हैं, प्रति पंक्ति एक। वर्तमान फ़िल्टर से मेल खाने वाली सभी पंक्तियाँ शामिल की जाती हैं, न कि केवल दृश्यमान तालिका पृष्ठ।
नहीं। PDF पार्सिंग, मिलान और निर्यात इस ब्राउज़र में चलते हैं। मूल PDF अपरिवर्तित रहती है। किसी भी निकाले गए लिंक, ईमेल या फ़ोन नंबर से स्वचालित रूप से संपर्क नहीं किया जाता है।
50 MiB और 500 पृष्ठों तक की एक PDF। निष्कर्षण 250,000 टेक्स्ट वर्णों और प्रति पृष्ठ 2,000 मिलान, कुल 10 मिलियन वर्णों और 20,000 मिलान, और प्रति पृष्ठ 2,000 एनोटेशन तक सीमित है। यदि सीमाएं या अपठनीय पृष्ठ परिणामों को आंशिक बनाते हैं तो परिणामों पर एक सूचना दी जाती है।
त्वरित वीडियो ट्यूटोरियल
PDF से संरचित डेटा कैसे निकालें
संपर्कों और शोध पहचानकर्ताओं को एक व्यवस्थित सूची में एकत्र करें।
अंग्रेजी वर्णन
वीडियो देखें