टूल्स150

एक उपयोगी PDF कार्य, जिसे सरल बनाया गया है

PDF से डेटा निकालें.

अपनी ज़रूरत का डेटा खोजें। हर परिणाम के साथ स्रोत पेज रखें।

Advertisements
आपका PDF वर्कस्पेस
आपके डिवाइस पर
या अपनी फ़ाइलें यहाँ छोड़ें
आपकी PDF इस ब्राउज़र में प्रोसेस की जाती है। PDF
Advertisements

PDF से डेटा कैसे निकालें

  1. 01

    एक PDF चुनें

    चयन योग्य टेक्स्ट वाली दस्तावेज़ लोड करें, या नमूना आज़माएं।

  2. 02

    एक्सट्रैक्ट और समीक्षा करें

    एक्सट्रैक्ट चुनें। मानों, गणनाओं और स्रोत पृष्ठों की समीक्षा करें; सूची को फ़िल्टर या क्रमबद्ध करें।

  3. 03

    कॉपी या डाउनलोड करें

    मानों को कॉपी करें, या पृष्ठ संदर्भों के साथ CSV या एक सरल TXT सूची डाउनलोड करें।

ब्लॉगPDF से संरचित डेटा कैसे निकालेंगाइड पढ़ें

PDF से संरचित मान CSV या टेक्स्ट में निकालें

अपनी ज़रूरत के डेटा प्रकार चुनें: ईमेल, फ़ोन नंबर, URL, संख्यात्मक तारीखें, IPv4 पते, डोमेन, DOI, ISBN, हैशटैग और MAC पते। गणना और पेज संदर्भों के साथ निकाले गए मानों की समीक्षा करें।

पहचाने गए मान स्रोत-पेज संदर्भों के साथ एक सूची बन जाते हैं।
त्वरित वीडियो ट्यूटोरियल PDF से संरचित डेटा कैसे निकालें संपर्कों और शोध पहचानकर्ताओं को एक व्यवस्थित सूची में एकत्र करें। अंग्रेजी वर्णन वीडियो देखें

PDF से संरचित डेटा कैसे निकालें

यह कब उपयोगी है?

अनुसंधान

पहचानकर्ता एकत्र करें

DOI और ISBN मानों को उन पेजों के साथ एकत्र करें जहां वे दिखाई देते हैं।

रिपोर्ट

संख्यात्मक विवरण निकालें

दिनांकित प्रविष्टियां और IPv4 पते खोजें।

निर्देशिकाएं

संपर्क सूची बनाएं

ईमेल, फोन और वेब लिंक को एक संरचित निर्यात में संयोजित करें।

सुविधाएँ और नियंत्रण

उपयोगी डेटा प्रकार चुनें

ईमेल, फोन और यूआरएल से शुरुआत करें, फिर विशेष मानों के लिए अधिक डेटा प्रकार खोलें।

रिकॉग्नाइज़र क्या समर्थन करते हैं

तारीखों में चार अंकों के वर्ष के साथ एक संख्यात्मक प्रारूप का उपयोग करना चाहिए; अस्पष्ट दिन/महीने के मान अपने स्रोत क्रम को बनाए रखते हैं। IPv4 ऑक्टेट्स मान्य हैं; IPv6 शामिल नहीं है।

डोमेन की पहचान मान्यता प्राप्त ईमेल और वेब लिंक से की जाती है, न कि मनमाने फ़ाइल नामों से। DOI एक्सट्रैक्शन सामान्य आधुनिक DOI रूपों को कवर करता है, न कि हर ऐतिहासिक रूप को। ISBN-13 मानों के लिए एक वैध चेकसम की आवश्यकता होती है; ISBN-10 के लिए भी ISBN लेबल आवश्यक है। हैशटैग में अरबी सहित यूनिकोड अक्षर हो सकते हैं।

MAC पते छह कोलन या हाइफ़न से अलग किए गए जोड़े का उपयोग करते हैं। यह टूल कभी भी निकाले गए पतों या पहचानकर्ताओं से संपर्क नहीं करता है।

अपने स्रोत पृष्ठों के साथ मानों की समीक्षा करें

गिनती की जांच करें, पीडीएफ पृष्ठ पर जाएं, और परिणाम सूची को फ़िल्टर करें।

समीक्षा करें और व्यवस्थित करें

प्रत्येक परिणाम पीडीएफ में भौतिक पृष्ठ स्थिति को रिकॉर्ड करता है, जो मुद्रित पृष्ठ संख्याओं से भिन्न हो सकता है। पूर्वावलोकन को अनुमानित हाइलाइट के साथ खोलने के लिए एक पेज चिप चुनें।

डुप्लिकेट हटाएं विकल्प सक्षम रहता है। गिनती एक ही मान की पहचाने गए पुनरावृत्तियों को जोड़ती है; अलग-अलग घटनाओं को देखने के लिए इसे बंद करें। वर्णानुक्रम में क्रमबद्ध करें सूची के क्रम को बदल देता है। फ़िल्टरिंग कॉपी करने और डाउनलोड करने के साथ-साथ दृश्य पंक्तियों पर भी लागू होती है।

मान कॉपी करें या एक संरचित सूची डाउनलोड करें

गिनती और पृष्ठों के लिए CSV चुनें, या प्रति पंक्ति एक मान के लिए TXT चुनें।

प्रत्येक डाउनलोड में क्या होता है

CSV में Type, Value, Count और Pages कॉलम होते हैं। UTF-8 एन्कोडिंग अरबी और अन्य लिपियों का समर्थन करती है। जिन मानों को स्प्रेडशीट फ़ार्मुलों के रूप में समझा जा सकता है, उन्हें सुरक्षित आयात के लिए एक एपोस्ट्रोफी के साथ प्रीफ़िक्स किया जाता है।

TXT और 'सभी कॉपी करें' में केवल मान होते हैं, प्रति पंक्ति एक। फ़िल्टर से मेल खाने वाली सभी पंक्तियाँ शामिल की जाती हैं, तब भी जब ऑन-स्क्रीन तालिका कई परिणाम पृष्ठों में फैली हो। कोई नई PDF नहीं बनाई जाती है और स्रोत PDF अपरिवर्तित रहती है।

बड़े एक्सट्रैक्शन को प्रबंधनीय रखें

अपने ब्राउज़र में एक PDF प्रोसेस करें, स्पष्ट सीमाओं और आंशिक-परिणाम सूचनाओं के साथ।

फ़ाइलें, सीमाएँ और स्कैन किए गए पृष्ठ

50 MiB और 500 पृष्ठों तक की एक PDF लोड करें। एक्सट्रैक्शन प्रति पृष्ठ 250,000 वर्णों और 2,000 मिलानों, कुल मिलाकर 10 मिलियन वर्णों और 20,000 मिलानों, और प्रति पृष्ठ 2,000 एनोटेशन की जाँच करता है। 90-सेकंड का एक्सट्रैक्शन बजट लंबी प्रक्रियाओं को सीमित करता है। बहुत जटिल दस्तावेज़ छोटी फ़ाइलों में विभाजित होने पर बेहतर काम कर सकते हैं।

जब कोई सीमा पूरी हो जाती है या किसी पृष्ठ को पूरी तरह से नहीं पढ़ा जा सकता है, तो परिणाम एक सूचना दिखाते हैं और सीमित या विफल रन फ़ाइल नाम में 'partial' के साथ निर्यात होते हैं। बिना चयन योग्य टेक्स्ट वाले पृष्ठों को अलग से गिना जाता है। केवल-छवि स्कैन के लिए PDF OCR का उपयोग करें, फिर पहचाने गए टेक्स्ट को निकालने के लिए वापस आएं।

PDF सामग्री को इस ब्राउज़र में स्थानीय रूप से प्रोसेस किया जाता है। अपलोड किए गए दस्तावेज़ों को एक्सट्रैक्शन सर्वर पर नहीं भेजा जाता है। PDF के अंदर पाए गए लिंक, ईमेल पते और फ़ोन नंबरों से कभी भी स्वचालित रूप से संपर्क नहीं किया जाता है।

समर्थित फ़ाइलें और प्रसंस्करण

इनपुट
PDF
आउटपुट
CSV / TXT

50 MB और 750 पृष्ठों तक की एक PDF खोलें। जटिल दस्तावेज़ों के लिए अतिरिक्त आउटपुट, मेमोरी और प्रसंस्करण सीमाएं लागू हो सकती हैं।

प्रसंस्करण दस्तावेज़ अपलोड किए बिना आपके डिवाइस पर होता है। पृष्ठ बंद करने से पहले अपना परिणाम डाउनलोड करें; मूल फ़ाइल को अलग से सुरक्षित रखें।

Advertisements
सामान्य प्रश्न

कुछ उपयोगी उत्तर

शुरू करने से पहले जानें कि क्या उम्मीद करनी है।

आपके डिवाइस पर
यह टूल क्या पहचान सकता है?

अपनी आवश्यकता के डेटा प्रकार चुनें: ईमेल, फ़ोन नंबर, URL, संख्यात्मक तिथियां, IPv4 पते, डोमेन, DOI, ISBN, हैशटैग और MAC पते। गणना और पृष्ठ संदर्भों के साथ निकाले गए मानों की समीक्षा करें। यह पहचानने योग्य मान निकालता है, न कि तालिकाएं, चालान या शब्दार्थ फ़ील्ड। पैटर्न और चेकसम शोर को कम करते हैं लेकिन पूर्णता की गारंटी नहीं देते हैं या यह साबित नहीं करते हैं कि कोई पहचानकर्ता वास्तविक है।

क्या मैं स्कैन की गई PDF से डेटा निकाल सकता हूँ?

केवल चयन योग्य टेक्स्ट और पहचाने गए लिंक लक्ष्य ही पढ़े जाते हैं। केवल-छवि वाले पृष्ठों को पहले PDF OCR की आवश्यकता होती है। OCR चलाएं, खोजने योग्य PDF डाउनलोड करें, फिर इस एक्सट्रैक्टर पर वापस आएं।

डुप्लिकेट और गिनती को कैसे संभाला जाता है?

डुप्लिकेट हटाना पहचाने गए समान मानों को संयोजित करता है। काउंट पता चली घटनाओं को दिखाता है और पेज भौतिक PDF पृष्ठ स्थितियों को सूचीबद्ध करते हैं। घटनाओं को अलग रखने के लिए विकल्प को अक्षम करें। एक ही पृष्ठ पर मुद्रित लक्ष्य और मिलान करने वाले क्लिक करने योग्य लिंक की दोहरी गणना नहीं की जाती है।

CSV और TXT में क्या अंतर है?

CSV में प्रकार, मान, घटना गणना और पृष्ठ संदर्भ शामिल हैं। TXT और 'सभी कॉपी करें' केवल मान प्रदान करते हैं, प्रति पंक्ति एक। वर्तमान फ़िल्टर से मेल खाने वाली सभी पंक्तियाँ शामिल की जाती हैं, न कि केवल दृश्यमान तालिका पृष्ठ।

क्या PDF को एक्सट्रैक्शन के लिए अपलोड किया जाता है?

नहीं। PDF पार्सिंग, मिलान और निर्यात इस ब्राउज़र में चलते हैं। मूल PDF अपरिवर्तित रहती है। किसी भी निकाले गए लिंक, ईमेल या फ़ोन नंबर से स्वचालित रूप से संपर्क नहीं किया जाता है।

सीमाएं क्या हैं?

50 MiB और 500 पृष्ठों तक की एक PDF। निष्कर्षण 250,000 टेक्स्ट वर्णों और प्रति पृष्ठ 2,000 मिलान, कुल 10 मिलियन वर्णों और 20,000 मिलान, और प्रति पृष्ठ 2,000 एनोटेशन तक सीमित है। यदि सीमाएं या अपठनीय पृष्ठ परिणामों को आंशिक बनाते हैं तो परिणामों पर एक सूचना दी जाती है।

जारी रखें

आप आगे क्या करना चाहेंगे?

एक टूल चुनें। आपकी तैयार PDF आपके साथ रहेगी।

PDF

सुझाए गए अगले चरण

Advertisements

भाषा38

English العربية Français Italiano Deutsch Español Português Nederlands Русский Türkçe 日本語 中文 हिन्दी Bahasa Indonesia Bahasa Melayu 한국어 Tiếng Việt ไทย Polski Svenska Українська Norsk বাংলা Ελληνικά فارسی اردو Čeština Dansk Magyar Română Suomi Български Filipino ქართული Slovenčina Azərbaycanca עברית Slovenščina