شناخت کنندگان جمع کریں
DOI اور ISBN اقدار کو ان صفحات کے ساتھ جمع کریں جہاں وہ ظاہر ہوتے ہیں۔
اپنی مطلوبہ معلومات تلاش کریں۔ ہر نتیجے کے ساتھ ماخذ صفحہ کو محفوظ رکھیں۔
| قسم | قدر | تعداد | صفحات |
|---|
کاپی اور ڈاؤن لوڈ میں تمام مماثل قطاریں شامل ہیں، تمام نتائج کے صفحات پر۔ CSV میں تعداد اور PDF صفحہ نمبر شامل ہیں؛ TXT میں صرف اقدار ہیں۔
اس کا ماخذ چیک کرنے کے لیے نتائج میں صفحہ نمبر منتخب کریں۔ ہائی لائٹس تقریباً پوزیشنز دکھاتی ہیں۔
آپ کی فہرست تیار ہے۔ اسے ڈاؤن لوڈ کریں، یا جائزہ لینے اور فارمیٹ تبدیل کرنے کے لیے واپس جائیں۔
قابل انتخاب متن والی دستاویز لوڈ کریں، یا نمونہ آزمائیں۔
نکالیں منتخب کریں۔ اقدار، تعداد اور ماخذ کے صفحات کا جائزہ لیں؛ فہرست کو فلٹر یا ترتیب دیں۔
اقدار کو کاپی کریں، یا صفحہ کے حوالہ جات کے ساتھ CSV یا سادہ TXT فہرست ڈاؤن لوڈ کریں۔
اپنی مطلوبہ ڈیٹا کی اقسام منتخب کریں: ای میلز، فون نمبرز، یو آر ایل، عددی تاریخیں، IPv4 ایڈریسز، ڈومینز، DOI، ISBN، ہیش ٹیگز، اور MAC ایڈریسز۔ نکالی گئی اقدار کا تعداد اور صفحہ کے حوالہ جات کے ساتھ جائزہ لیں۔
DOI اور ISBN اقدار کو ان صفحات کے ساتھ جمع کریں جہاں وہ ظاہر ہوتے ہیں۔
تاریخی اندراجات اور IPv4 ایڈریسز تلاش کریں۔
ای میلز، فون نمبرز اور ویب لنکس کو ایک منظم ایکسپورٹ میں یکجا کریں۔
ای میلز، فونز اور یو آر ایل سے شروع کریں، پھر خصوصی اقدار کے لیے مزید ڈیٹا کی اقسام کھولیں۔
تاریخوں کو چار ہندسوں والے سال کے ساتھ عددی فارمیٹ استعمال کرنا چاہیے؛ مبہم دن/ماہ کی اقدار اپنی ماخذ ترتیب کو برقرار رکھتی ہیں۔ IPv4 آکٹیٹس کی توثیق کی جاتی ہے؛ IPv6 شامل نہیں ہے۔
ڈومینز کا تعین تسلیم شدہ ای میلز اور ویب لنکس سے کیا جاتا ہے، نہ کہ من مانی فائل کے ناموں سے۔ DOI کا اخراج عام جدید DOI فارمز کا احاطہ کرتا ہے، نہ کہ ہر تاریخی شکل کا۔ ISBN-13 اقدار کے لیے درست چیک سم درکار ہے؛ ISBN-10 کے لیے بھی ISBN لیبل ضروری ہے۔ ہیش ٹیگز میں عربی سمیت یونی کوڈ حروف شامل ہو سکتے ہیں۔
MAC ایڈریسز چھ کولن یا ہائفن سے الگ کیے گئے جوڑوں کا استعمال کرتے ہیں۔ یہ ٹول کبھی بھی نکالی گئی ایڈریسز یا شناخت کنندگان سے رابطہ نہیں کرتا۔
تعداد چیک کریں، پی ڈی ایف صفحہ پر جائیں، اور نتائج کی فہرست کو فلٹر کریں۔
ہر نتیجہ پی ڈی ایف میں جسمانی صفحہ کی پوزیشن ریکارڈ کرتا ہے، جو پرنٹ شدہ صفحہ نمبروں سے مختلف ہو سکتی ہے۔ پیش نظارہ کو تقریباً ہائی لائٹ کے ساتھ کھولنے کے لیے صفحہ چپ منتخب کریں۔
ڈپلیکیٹس ہٹانا فعال ہوتا ہے۔ کاؤنٹس ایک ہی قدر کی شناخت شدہ تکرار کو یکجا کرتے ہیں؛ الگ الگ واقعات دیکھنے کے لیے اسے بند کریں۔ حروف تہجی کے لحاظ سے ترتیب فہرست کی ترتیب کو تبدیل کرتی ہے۔ فلٹرنگ کاپی کرنے اور ڈاؤن لوڈز کے ساتھ ساتھ نظر آنے والی قطاروں پر بھی لاگو ہوتی ہے۔
تعداد اور صفحات کے لیے CSV، یا فی لائن ایک قدر کے لیے TXT کا انتخاب کریں۔
CSV میں Type، Value، Count اور Pages کے کالم ہوتے ہیں۔ UTF-8 انکوڈنگ عربی اور دیگر اسکرپٹس کو سپورٹ کرتی ہے۔ وہ اقدار جنہیں اسپریڈشیٹ فارمولوں کے طور پر سمجھا جا سکتا ہے، محفوظ درآمد کے لیے ان کے شروع میں ایک اپوسٹروف لگایا جاتا ہے۔
TXT اور کاپی میں صرف ویلیوز ہوتی ہیں، فی لائن ایک۔ فلٹر سے مطابقت رکھنے والی تمام قطاریں شامل کی جاتی ہیں، تب بھی جب آن اسکرین ٹیبل کئی رزلٹ صفحات پر پھیلی ہو۔ کوئی نئی PDF نہیں بنائی جاتی اور سورس PDF تبدیل نہیں ہوتی۔
اپنے براؤزر میں ایک PDF پروسیس کریں، واضح حدود اور جزوی نتائج کے نوٹس کے ساتھ۔
50 MiB اور 500 صفحات تک کی ایک PDF لوڈ کریں۔ ایکسٹریکشن فی صفحہ 250,000 کریکٹرز اور 2,000 میچز، مجموعی طور پر 10 ملین کریکٹرز اور 20,000 میچز، اور فی صفحہ 2,000 اینوٹیشنز تک چیک کرتی ہے۔ 90 سیکنڈ کا ایکسٹریکشن بجٹ طویل رنز کو محدود کرتا ہے۔ بہت پیچیدہ دستاویزات چھوٹی فائلوں میں تقسیم کرنے پر بہتر کام کر سکتی ہیں۔
جب کوئی حد پوری ہو جاتی ہے یا کوئی صفحہ مکمل طور پر نہیں پڑھا جا سکتا، تو نتائج میں ایک نوٹس دکھایا جاتا ہے اور محدود یا ناکام رنز فائل کے نام میں partial کے ساتھ ایکسپورٹ ہوتے ہیں۔ قابل انتخاب ٹیکسٹ کے بغیر صفحات کو الگ سے شمار کیا جاتا ہے۔ صرف امیج والے اسکینز کے لیے PDF OCR استعمال کریں، پھر پہچانے گئے ٹیکسٹ کو ایکسٹریکٹ کرنے کے لیے واپس آئیں۔
PDF مواد کو مقامی طور پر اس براؤزر میں پروسیس کیا جاتا ہے۔ اپ لوڈ کردہ دستاویزات کسی ایکسٹریکشن سرور پر نہیں بھیجی جاتیں۔ PDF کے اندر پائے جانے والے لنکس، ای میل ایڈریسز اور فون نمبرز سے کبھی خود بخود رابطہ نہیں کیا جاتا۔
50 MB اور 750 صفحات تک کی ایک PDF کھولیں۔ پیچیدہ دستاویزات پر اضافی آؤٹ پٹ، میموری اور پروسیسنگ کی حدود لاگو ہو سکتی ہیں۔
پروسیسنگ آپ کے آلے پر ہوتی ہے، دستاویز اپ لوڈ کیے بغیر۔ صفحہ بند کرنے سے پہلے اپنا نتیجہ ڈاؤن لوڈ کریں؛ اصل فائل کو الگ سے محفوظ رکھیں۔
شروع کرنے سے پہلے جانیں کہ کیا توقع رکھنی ہے۔
آپ کے آلے پراپنی ضرورت کے ڈیٹا کی اقسام منتخب کریں: ای میلز، فون نمبرز، URLs، عددی تاریخیں، IPv4 پتے، ڈومینز، DOI، ISBN، ہیش ٹیگز، اور MAC پتے۔ شمار اور صفحہ کے حوالہ جات کے ساتھ نکالی گئی اقدار کا جائزہ لیں۔ یہ قابل شناخت اقدار نکالتا ہے، نہ کہ ٹیبلز، انوائسز یا سیمنٹک فیلڈز۔ پیٹرنز اور چیکسمز شور کو کم کرتے ہیں لیکن مکمل ہونے کی ضمانت نہیں دیتے اور نہ ہی یہ ثابت کرتے ہیں کہ شناخت کنندہ اصلی ہے۔
صرف منتخب کرنے کے قابل متن اور پہچانے گئے لنک کے اہداف پڑھے جاتے ہیں۔ صرف تصویر والے صفحات کو پہلے PDF OCR کی ضرورت ہوتی ہے۔ OCR چلائیں، تلاش کے قابل PDF ڈاؤن لوڈ کریں، پھر اس ایکسٹریکٹر پر واپس آئیں۔
ڈپلیکیٹس کو ہٹانا پہچانی گئی مساوی اقدار کو یکجا کرتا ہے۔ Count سے پتہ چلتا ہے کہ کتنی بار وقوع پذیر ہوا اور Pages جسمانی PDF صفحہ کی پوزیشنوں کی فہرست دیتا ہے۔ وقوع پذیر ہونے والی اقدار کو الگ رکھنے کے لیے اس آپشن کو غیر فعال کریں۔ ایک پرنٹ شدہ ہدف اور اسی صفحے پر موجود مماثل کلک کے قابل لنک کو دو بار شمار نہیں کیا جاتا ہے۔
CSV میں قسم، قدر، وقوع کی تعداد اور صفحہ کے حوالہ جات شامل ہوتے ہیں۔ TXT اور Copy all صرف اقدار فراہم کرتے ہیں، فی لائن ایک۔ موجودہ فلٹر سے مماثل تمام قطاریں شامل کی جاتی ہیں، نہ صرف نظر آنے والا ٹیبل صفحہ۔
نہیں۔ PDF پارسنگ، میچنگ اور ایکسپورٹس اس براؤزر میں چلتے ہیں۔ اصل PDF تبدیل نہیں ہوتی۔ کسی ایکسٹریکٹ شدہ لنک، ای میل یا فون نمبر سے خود بخود رابطہ نہیں کیا جاتا۔
ایک PDF جس کا سائز 50 MiB اور 500 صفحات تک ہو۔ نکالنے کا عمل 250,000 ٹیکسٹ کریکٹرز اور فی صفحہ 2,000 میچز، مجموعی طور پر 10 ملین کریکٹرز اور 20,000 میچز، اور فی صفحہ 2,000 تشریحات تک محدود ہے۔ اگر حدود یا ناقابل مطالعہ صفحات کی وجہ سے نتائج جزوی ہوں تو ان پر ایک نوٹس موجود ہوتا ہے۔
مختصر ویڈیو ٹیوٹوریل
PDF سے منظم ڈیٹا کیسے نکالیں
رابطے اور تحقیقی شناخت کنندگان کو ایک منظم فہرست میں جمع کریں۔
انگریزی بیانیہ
ویڈیو دیکھیں