جمعآوری شناسهها
مقادیر DOI و ISBN را به همراه صفحاتی که در آنها ظاهر میشوند، جمعآوری کنید.
دادههای مورد نیاز خود را پیدا کنید. صفحه منبع را برای هر نتیجه حفظ کنید.
| نوع | مقدار | تعداد | صفحات |
|---|
کپی و دانلود شامل تمام ردیفهای منطبق در تمام صفحات نتایج است. CSV شامل تعداد و شماره صفحات PDF است؛ TXT فقط حاوی مقادیر است.
یک شماره صفحه را در نتایج انتخاب کنید تا منبع آن را بررسی کنید. موارد برجسته موقعیت تقریبی را نشان میدهند.
لیست شما آماده است. آن را دانلود کنید یا برای بررسی و تغییر فرمت به عقب برگردید.
سندی با متن قابل انتخاب بارگذاری کنید، یا نمونه را امتحان کنید.
استخراج را انتخاب کنید. مقادیر، تعداد و صفحات منبع را بررسی کنید؛ لیست را فیلتر یا مرتب کنید.
مقادیر را کپی کنید، یا CSV با ارجاعات صفحه یا یک لیست ساده TXT دانلود کنید.
انواع دادههای مورد نیاز خود را انتخاب کنید: ایمیلها، شماره تلفنها، URLها، تاریخهای عددی، آدرسهای IPv4، دامنهها، DOI، ISBN، هشتگها و آدرسهای MAC. مقادیر استخراج شده را با تعداد و ارجاعات صفحه بررسی کنید.
مقادیر DOI و ISBN را به همراه صفحاتی که در آنها ظاهر میشوند، جمعآوری کنید.
ورودیهای تاریخدار و آدرسهای IPv4 را پیدا کنید.
ترکیب ایمیلها، تلفنها و لینکهای وب در یک خروجی ساختاریافته.
با ایمیلها، تلفنها و URLها شروع کنید، سپس برای مقادیر تخصصیتر، «انواع دادههای بیشتر» را باز کنید.
تاریخها باید از فرمت عددی با سال چهار رقمی استفاده کنند؛ مقادیر مبهم روز/ماه ترتیب منبع خود را حفظ میکنند. اکتتهای IPv4 اعتبارسنجی میشوند؛ IPv6 گنجانده نشده است.
دامنهها از ایمیلها و لینکهای وب شناساییشده استخراج میشوند، نه نام فایلهای دلخواه. استخراج DOI فرمتهای مدرن رایج DOI را پوشش میدهد، نه همه فرمتهای تاریخی. مقادیر ISBN-13 نیاز به چکسام معتبر دارند؛ ISBN-10 نیز نیاز به برچسب ISBN دارد. هشتگها میتوانند شامل حروف یونیکد، از جمله فارسی باشند.
آدرسهای MAC از شش جفت جدا شده با دونقطه یا خط تیره استفاده میکنند. این ابزار هرگز با آدرسها یا شناسههای استخراجشده تماس نمیگیرد.
تعداد را بررسی کنید، به یک صفحه خاص از PDF بپرید و لیست نتایج را فیلتر کنید.
هر نتیجه موقعیت فیزیکی صفحه در PDF را ثبت میکند که ممکن است با شماره صفحات چاپی متفاوت باشد. روی یک برچسب صفحه کلیک کنید تا پیشنمایش با هایلایت تقریبی باز شود.
حذف موارد تکراری بهصورت پیشفرض فعال است. تعداد، تکرارهای شناساییشده از یک مقدار واحد را ترکیب میکند؛ آن را خاموش کنید تا موارد جداگانه را ببینید. مرتبسازی الفبایی ترتیب لیست را تغییر میدهد. فیلتر کردن هم بر کپی و دانلود و هم بر ردیفهای قابل مشاهده اعمال میشود.
CSV را برای تعداد و صفحات، یا TXT را برای یک مقدار در هر خط انتخاب کنید.
CSV شامل ستونهای نوع، مقدار، تعداد و صفحات است. انکودینگ UTF-8 از زبان فارسی و سایر خطوط پشتیبانی میکند. مقادیری که ممکن است به عنوان فرمولهای صفحه گسترده تفسیر شوند، برای وارد کردن ایمنتر با یک آپاستروف پیشوند میشوند.
TXT و کپی همه فقط شامل مقادیر هستند، یکی در هر خط. تمام ردیفهای منطبق با فیلتر گنجانده میشوند، حتی زمانی که جدول روی صفحه چندین صفحه نتیجه را در بر میگیرد. هیچ PDF جدیدی ایجاد نمیشود و PDF منبع بدون تغییر باقی میماند.
یک PDF را در مرورگر خود با محدودیتهای مشخص و اعلانهای نتایج جزئی پردازش کنید.
یک PDF تا ۵۰ مگابایت و ۵۰۰ صفحه را بارگذاری کنید. استخراج تا ۲۵۰,۰۰۰ کاراکتر و ۲,۰۰۰ تطبیق در هر صفحه، ۱۰ میلیون کاراکتر و ۲۰,۰۰۰ تطبیق در کل، و ۲,۰۰۰ حاشیهنویسی در هر صفحه را بررسی میکند. بودجه زمانی ۹۰ ثانیهای برای استخراج، اجرای طولانی را محدود میکند. اسناد بسیار پیچیده ممکن است در صورت تقسیم به فایلهای کوچکتر، بهتر کار کنند.
هنگامی که به محدودیت میرسید یا یک صفحه نمیتواند بهطور کامل خوانده شود، نتایج یک اعلان نشان میدهند و اجراهای محدود یا ناموفق با عبارت partial در نام فایل صادر میشوند. صفحاتی که متن قابل انتخاب ندارند جداگانه شمرده میشوند. برای اسکنهای فقط تصویری از PDF OCR استفاده کنید، سپس برای استخراج متن شناساییشده بازگردید.
محتوای PDF بهصورت محلی در این مرورگر پردازش میشود. اسناد آپلود شده به سرور استخراج ارسال نمیشوند. لینکها، آدرسهای ایمیل و شماره تلفنهای یافت شده در داخل PDF هرگز بهطور خودکار فراخوانی نمیشوند.
یک فایل PDF تا 50 مگابایت و 750 صفحه را باز کنید. محدودیتهای اضافی برای خروجی، حافظه و پردازش ممکن است برای اسناد پیچیده اعمال شود.
پردازش بدون بارگذاری سند، روی دستگاه شما انجام میشود. قبل از بستن صفحه، نتیجه را دانلود کنید؛ نسخه اصلی را جداگانه نگه دارید.
قبل از شروع بدانید چه انتظاری داشته باشید.
روی دستگاه شماانواع دادههای مورد نیاز خود را انتخاب کنید: ایمیلها، شماره تلفنها، URLها، تاریخهای عددی، آدرسهای IPv4، دامنهها، DOI، ISBN، هشتگها و آدرسهای MAC. مقادیر استخراجشده را به همراه تعداد و ارجاعات صفحه بررسی کنید. این ابزار مقادیر قابل شناسایی را استخراج میکند، نه جداول، فاکتورها یا فیلدهای معنایی. الگوها و چکسامها نویز را کاهش میدهند اما کامل بودن یا اصالت یک شناسه را تضمین نمیکنند.
فقط متنهای قابل انتخاب و اهداف لینکهای شناساییشده خوانده میشوند. صفحات صرفاً تصویری ابتدا نیاز به OCR دارند. عملیات OCR را اجرا کنید، فایل PDF قابل جستجو را دانلود کرده و سپس به این استخراجکننده بازگردید.
حذف موارد تکراری، مقادیر معادل شناساییشده را ترکیب میکند. ستون Count تعداد دفعات مشاهدهشده و ستون Pages موقعیت فیزیکی آنها در صفحات PDF را نشان میدهد. برای جدا نگه داشتن موارد تکراری، این گزینه را غیرفعال کنید. یک هدف چاپشده و لینک قابل کلیک منطبق بر آن در یک صفحه، دو بار شمرده نمیشوند.
فرمت CSV شامل نوع، مقدار، تعداد دفعات تکرار و ارجاعات صفحه است. فرمتهای TXT و Copy all فقط مقادیر را به صورت یک مورد در هر خط ارائه میدهند. تمام ردیفهای منطبق با فیلتر فعلی، نه فقط صفحه قابل مشاهده جدول، در خروجی لحاظ میشوند.
خیر. تجزیه، تطبیق و خروجیهای PDF در همین مرورگر اجرا میشوند. PDF اصلی بدون تغییر باقی میماند. هیچ لینک، ایمیل یا شماره تلفن استخراجشدهای بهطور خودکار فراخوانی نمیشود.
یک فایل PDF تا سقف 50 MiB و 500 صفحه. استخراج به 250,000 کاراکتر متنی و 2,000 مورد منطبق در هر صفحه، و در مجموع 10 میلیون کاراکتر و 20,000 مورد منطبق، و 2,000 حاشیهنویسی در هر صفحه محدود است. اگر محدودیتها یا صفحات غیرقابل خواندن باعث ناقص شدن نتایج شوند، یک اعلان در نتایج نمایش داده میشود.
آموزش ویدیویی سریع
نحوه استخراج دادههای ساختاریافته از یک PDF
مخاطبین و شناسههای پژوهشی را در یک لیست سازمانیافته جمعآوری کنید.
روایت انگلیسی
مشاهده ویدیو