ٹولز150

ایک مفید PDF ٹاسک، آسان بنایا گیا

پی ڈی ایف سے ڈیٹا نکالیں.

اپنی مطلوبہ معلومات تلاش کریں۔ ہر نتیجے کے ساتھ ماخذ صفحہ کو محفوظ رکھیں۔

Advertisements
آپ کا PDF ورک اسپیس
آپ کے آلے پر
یا اپنی فائلیں یہاں ڈراپ کریں
آپ کی PDF اس براؤزر میں پروسیس کی جاتی ہے۔ PDF
Advertisements

پی ڈی ایف سے ڈیٹا کیسے نکالیں

  1. 01

    ایک PDF منتخب کریں

    قابل انتخاب متن والی دستاویز لوڈ کریں، یا نمونہ آزمائیں۔

  2. 02

    نکالیں اور جائزہ لیں

    نکالیں منتخب کریں۔ اقدار، تعداد اور ماخذ کے صفحات کا جائزہ لیں؛ فہرست کو فلٹر یا ترتیب دیں۔

  3. 03

    کاپی یا ڈاؤن لوڈ کریں

    اقدار کو کاپی کریں، یا صفحہ کے حوالہ جات کے ساتھ CSV یا سادہ TXT فہرست ڈاؤن لوڈ کریں۔

بلاگPDF سے منظم ڈیٹا کیسے نکالیںگائیڈ پڑھیں

پی ڈی ایف سے ساختہ اقدار کو CSV یا ٹیکسٹ میں نکالیں

اپنی مطلوبہ ڈیٹا کی اقسام منتخب کریں: ای میلز، فون نمبرز، یو آر ایل، عددی تاریخیں، IPv4 ایڈریسز، ڈومینز، DOI، ISBN، ہیش ٹیگز، اور MAC ایڈریسز۔ نکالی گئی اقدار کا تعداد اور صفحہ کے حوالہ جات کے ساتھ جائزہ لیں۔

تسلیم شدہ اقدار ماخذ-صفحہ کے حوالہ جات کے ساتھ ایک فہرست بن جاتی ہیں۔
مختصر ویڈیو ٹیوٹوریل PDF سے منظم ڈیٹا کیسے نکالیں رابطے اور تحقیقی شناخت کنندگان کو ایک منظم فہرست میں جمع کریں۔ انگریزی بیانیہ ویڈیو دیکھیں

PDF سے منظم ڈیٹا کیسے نکالیں

یہ کب مفید ہے؟

تحقیق

شناخت کنندگان جمع کریں

DOI اور ISBN اقدار کو ان صفحات کے ساتھ جمع کریں جہاں وہ ظاہر ہوتے ہیں۔

رپورٹس

عددی تفصیلات نکالیں

تاریخی اندراجات اور IPv4 ایڈریسز تلاش کریں۔

ڈائریکٹریز

رابطہ فہرست بنائیں

ای میلز، فون نمبرز اور ویب لنکس کو ایک منظم ایکسپورٹ میں یکجا کریں۔

خصوصیات اور کنٹرولز

مفید ڈیٹا کی اقسام منتخب کریں

ای میلز، فونز اور یو آر ایل سے شروع کریں، پھر خصوصی اقدار کے لیے مزید ڈیٹا کی اقسام کھولیں۔

ریکوگنائزرز کیا سپورٹ کرتے ہیں

تاریخوں کو چار ہندسوں والے سال کے ساتھ عددی فارمیٹ استعمال کرنا چاہیے؛ مبہم دن/ماہ کی اقدار اپنی ماخذ ترتیب کو برقرار رکھتی ہیں۔ IPv4 آکٹیٹس کی توثیق کی جاتی ہے؛ IPv6 شامل نہیں ہے۔

ڈومینز کا تعین تسلیم شدہ ای میلز اور ویب لنکس سے کیا جاتا ہے، نہ کہ من مانی فائل کے ناموں سے۔ DOI کا اخراج عام جدید DOI فارمز کا احاطہ کرتا ہے، نہ کہ ہر تاریخی شکل کا۔ ISBN-13 اقدار کے لیے درست چیک سم درکار ہے؛ ISBN-10 کے لیے بھی ISBN لیبل ضروری ہے۔ ہیش ٹیگز میں عربی سمیت یونی کوڈ حروف شامل ہو سکتے ہیں۔

MAC ایڈریسز چھ کولن یا ہائفن سے الگ کیے گئے جوڑوں کا استعمال کرتے ہیں۔ یہ ٹول کبھی بھی نکالی گئی ایڈریسز یا شناخت کنندگان سے رابطہ نہیں کرتا۔

اقدار کا ان کے ماخذ صفحات کے ساتھ جائزہ لیں

تعداد چیک کریں، پی ڈی ایف صفحہ پر جائیں، اور نتائج کی فہرست کو فلٹر کریں۔

جائزہ لیں اور منظم کریں

ہر نتیجہ پی ڈی ایف میں جسمانی صفحہ کی پوزیشن ریکارڈ کرتا ہے، جو پرنٹ شدہ صفحہ نمبروں سے مختلف ہو سکتی ہے۔ پیش نظارہ کو تقریباً ہائی لائٹ کے ساتھ کھولنے کے لیے صفحہ چپ منتخب کریں۔

ڈپلیکیٹس ہٹانا فعال ہوتا ہے۔ کاؤنٹس ایک ہی قدر کی شناخت شدہ تکرار کو یکجا کرتے ہیں؛ الگ الگ واقعات دیکھنے کے لیے اسے بند کریں۔ حروف تہجی کے لحاظ سے ترتیب فہرست کی ترتیب کو تبدیل کرتی ہے۔ فلٹرنگ کاپی کرنے اور ڈاؤن لوڈز کے ساتھ ساتھ نظر آنے والی قطاروں پر بھی لاگو ہوتی ہے۔

اقدار کاپی کریں یا ایک منظم فہرست ڈاؤن لوڈ کریں

تعداد اور صفحات کے لیے CSV، یا فی لائن ایک قدر کے لیے TXT کا انتخاب کریں۔

ہر ڈاؤن لوڈ میں کیا شامل ہے

CSV میں Type، Value، Count اور Pages کے کالم ہوتے ہیں۔ UTF-8 انکوڈنگ عربی اور دیگر اسکرپٹس کو سپورٹ کرتی ہے۔ وہ اقدار جنہیں اسپریڈشیٹ فارمولوں کے طور پر سمجھا جا سکتا ہے، محفوظ درآمد کے لیے ان کے شروع میں ایک اپوسٹروف لگایا جاتا ہے۔

TXT اور کاپی میں صرف ویلیوز ہوتی ہیں، فی لائن ایک۔ فلٹر سے مطابقت رکھنے والی تمام قطاریں شامل کی جاتی ہیں، تب بھی جب آن اسکرین ٹیبل کئی رزلٹ صفحات پر پھیلی ہو۔ کوئی نئی PDF نہیں بنائی جاتی اور سورس PDF تبدیل نہیں ہوتی۔

بڑی ایکسٹریکشنز کو قابل انتظام رکھیں

اپنے براؤزر میں ایک PDF پروسیس کریں، واضح حدود اور جزوی نتائج کے نوٹس کے ساتھ۔

فائلیں، حدود اور اسکین شدہ صفحات

50 MiB اور 500 صفحات تک کی ایک PDF لوڈ کریں۔ ایکسٹریکشن فی صفحہ 250,000 کریکٹرز اور 2,000 میچز، مجموعی طور پر 10 ملین کریکٹرز اور 20,000 میچز، اور فی صفحہ 2,000 اینوٹیشنز تک چیک کرتی ہے۔ 90 سیکنڈ کا ایکسٹریکشن بجٹ طویل رنز کو محدود کرتا ہے۔ بہت پیچیدہ دستاویزات چھوٹی فائلوں میں تقسیم کرنے پر بہتر کام کر سکتی ہیں۔

جب کوئی حد پوری ہو جاتی ہے یا کوئی صفحہ مکمل طور پر نہیں پڑھا جا سکتا، تو نتائج میں ایک نوٹس دکھایا جاتا ہے اور محدود یا ناکام رنز فائل کے نام میں partial کے ساتھ ایکسپورٹ ہوتے ہیں۔ قابل انتخاب ٹیکسٹ کے بغیر صفحات کو الگ سے شمار کیا جاتا ہے۔ صرف امیج والے اسکینز کے لیے PDF OCR استعمال کریں، پھر پہچانے گئے ٹیکسٹ کو ایکسٹریکٹ کرنے کے لیے واپس آئیں۔

PDF مواد کو مقامی طور پر اس براؤزر میں پروسیس کیا جاتا ہے۔ اپ لوڈ کردہ دستاویزات کسی ایکسٹریکشن سرور پر نہیں بھیجی جاتیں۔ PDF کے اندر پائے جانے والے لنکس، ای میل ایڈریسز اور فون نمبرز سے کبھی خود بخود رابطہ نہیں کیا جاتا۔

معاون فائلیں اور پروسیسنگ

ان پٹ
PDF
آؤٹ پٹ
CSV / TXT

50 MB اور 750 صفحات تک کی ایک PDF کھولیں۔ پیچیدہ دستاویزات پر اضافی آؤٹ پٹ، میموری اور پروسیسنگ کی حدود لاگو ہو سکتی ہیں۔

پروسیسنگ آپ کے آلے پر ہوتی ہے، دستاویز اپ لوڈ کیے بغیر۔ صفحہ بند کرنے سے پہلے اپنا نتیجہ ڈاؤن لوڈ کریں؛ اصل فائل کو الگ سے محفوظ رکھیں۔

Advertisements
عمومی سوالات

کچھ مفید جوابات

شروع کرنے سے پہلے جانیں کہ کیا توقع رکھنی ہے۔

آپ کے آلے پر
یہ ٹول کیا پہچان سکتا ہے؟

اپنی ضرورت کے ڈیٹا کی اقسام منتخب کریں: ای میلز، فون نمبرز، URLs، عددی تاریخیں، IPv4 پتے، ڈومینز، DOI، ISBN، ہیش ٹیگز، اور MAC پتے۔ شمار اور صفحہ کے حوالہ جات کے ساتھ نکالی گئی اقدار کا جائزہ لیں۔ یہ قابل شناخت اقدار نکالتا ہے، نہ کہ ٹیبلز، انوائسز یا سیمنٹک فیلڈز۔ پیٹرنز اور چیکسمز شور کو کم کرتے ہیں لیکن مکمل ہونے کی ضمانت نہیں دیتے اور نہ ہی یہ ثابت کرتے ہیں کہ شناخت کنندہ اصلی ہے۔

کیا میں اسکین شدہ PDFs سے ڈیٹا نکال سکتا ہوں؟

صرف منتخب کرنے کے قابل متن اور پہچانے گئے لنک کے اہداف پڑھے جاتے ہیں۔ صرف تصویر والے صفحات کو پہلے PDF OCR کی ضرورت ہوتی ہے۔ OCR چلائیں، تلاش کے قابل PDF ڈاؤن لوڈ کریں، پھر اس ایکسٹریکٹر پر واپس آئیں۔

ڈپلیکیٹس اور کاؤنٹس کو کیسے ہینڈل کیا جاتا ہے؟

ڈپلیکیٹس کو ہٹانا پہچانی گئی مساوی اقدار کو یکجا کرتا ہے۔ Count سے پتہ چلتا ہے کہ کتنی بار وقوع پذیر ہوا اور Pages جسمانی PDF صفحہ کی پوزیشنوں کی فہرست دیتا ہے۔ وقوع پذیر ہونے والی اقدار کو الگ رکھنے کے لیے اس آپشن کو غیر فعال کریں۔ ایک پرنٹ شدہ ہدف اور اسی صفحے پر موجود مماثل کلک کے قابل لنک کو دو بار شمار نہیں کیا جاتا ہے۔

CSV اور TXT میں کیا فرق ہے؟

CSV میں قسم، قدر، وقوع کی تعداد اور صفحہ کے حوالہ جات شامل ہوتے ہیں۔ TXT اور Copy all صرف اقدار فراہم کرتے ہیں، فی لائن ایک۔ موجودہ فلٹر سے مماثل تمام قطاریں شامل کی جاتی ہیں، نہ صرف نظر آنے والا ٹیبل صفحہ۔

کیا PDF ایکسٹریکشن کے لیے اپ لوڈ کی جاتی ہے؟

نہیں۔ PDF پارسنگ، میچنگ اور ایکسپورٹس اس براؤزر میں چلتے ہیں۔ اصل PDF تبدیل نہیں ہوتی۔ کسی ایکسٹریکٹ شدہ لنک، ای میل یا فون نمبر سے خود بخود رابطہ نہیں کیا جاتا۔

حدود کیا ہیں؟

ایک PDF جس کا سائز 50 MiB اور 500 صفحات تک ہو۔ نکالنے کا عمل 250,000 ٹیکسٹ کریکٹرز اور فی صفحہ 2,000 میچز، مجموعی طور پر 10 ملین کریکٹرز اور 20,000 میچز، اور فی صفحہ 2,000 تشریحات تک محدود ہے۔ اگر حدود یا ناقابل مطالعہ صفحات کی وجہ سے نتائج جزوی ہوں تو ان پر ایک نوٹس موجود ہوتا ہے۔

جاری رکھیں

آپ آگے کیا کرنا چاہیں گے؟

ایک ٹول منتخب کریں۔ آپ کی تیار شدہ PDF آپ کے ساتھ رہے گی۔

PDF

Advertisements

زبان38

English العربية Français Italiano Deutsch Español Português Nederlands Русский Türkçe 日本語 中文 हिन्दी Bahasa Indonesia Bahasa Melayu 한국어 Tiếng Việt ไทย Polski Svenska Українська Norsk বাংলা Ελληνικά فارسی اردو Čeština Dansk Magyar Română Suomi Български Filipino ქართული Slovenčina Azərbaycanca עברית Slovenščina