جمعآوری لینکهای منبع
یک لیست مرجع از گزارشها و اسناد تحقیقاتی بسازید.
لینکهای مفید را از فایل PDF خود بیرون بکشید.
| نوع | مقدار | تعداد | صفحات |
|---|
کپی و دانلود شامل تمام ردیفهای منطبق در تمام صفحات نتایج است. CSV شامل تعداد و شماره صفحات PDF است؛ TXT فقط حاوی مقادیر است.
یک شماره صفحه را در نتایج انتخاب کنید تا منبع آن را بررسی کنید. موارد برجسته موقعیت تقریبی را نشان میدهند.
لیست شما آماده است. آن را دانلود کنید یا برای بررسی و تغییر فرمت به عقب برگردید.
سندی با متن قابل انتخاب بارگذاری کنید، یا نمونه را امتحان کنید.
استخراج را انتخاب کنید. مقادیر، تعداد و صفحات منبع را بررسی کنید؛ لیست را فیلتر یا مرتب کنید.
مقادیر را کپی کنید، یا CSV با ارجاعات صفحه یا یک لیست ساده TXT دانلود کنید.
آدرسهای HTTP/HTTPS چاپ شده، آدرسهای www و مقاصد لینکهای وب قابل کلیک را از یک فایل PDF جمعآوری کنید. ارجاعات صفحه را حفظ کرده و یک لیست بدون تکرار را به صورت CSV یا TXT دانلود کنید.
یک لیست مرجع از گزارشها و اسناد تحقیقاتی بسازید.
مقاصد پشت برچسبهای منابع قابل کلیک را استخراج کنید.
قبل از بررسی هر لینک در جای دیگر، ثبت کنید که در کجا پیدا شده است.
حتی زمانی که برچسب لینک فقط میگوید «بیشتر بخوانید»، هدف لینک را بگنجانید.
لینکهای چاپی که با http://، https:// یا www. شروع میشوند، شناسایی میشوند. حاشیهنویسیهای لینک PDF نیز میتوانند اهداف HTTP/HTTPS پشت متنهای معمولی را آشکار کنند. لازم نیست PDF حتماً URL را به عنوان برچسب قابل کلیک نمایش دهد.
اهداف چاپی و حاشیهنویسیهای یکسان در یک صفحه دو بار شمرده نمیشوند. فرمتهای استاندارد شده URL برای مقایسه موارد تکراری استفاده میشوند، در حالی که اولین املای شناساییشده نمایش داده میشود. URLهای طولانی، شکسته یا آسیبدیده ممکن است نیاز به اصلاح دستی داشته باشند. هیچ URL استخراجشدهای بهطور خودکار فراخوانی نمیشود.
تعداد را بررسی کنید، به یک صفحه خاص از PDF بپرید و لیست نتایج را فیلتر کنید.
هر نتیجه موقعیت فیزیکی صفحه در PDF را ثبت میکند که ممکن است با شماره صفحات چاپی متفاوت باشد. روی یک برچسب صفحه کلیک کنید تا پیشنمایش با هایلایت تقریبی باز شود.
حذف موارد تکراری بهصورت پیشفرض فعال است. تعداد، تکرارهای شناساییشده از یک مقدار واحد را ترکیب میکند؛ آن را خاموش کنید تا موارد جداگانه را ببینید. مرتبسازی الفبایی ترتیب لیست را تغییر میدهد. فیلتر کردن هم بر کپی و دانلود و هم بر ردیفهای قابل مشاهده اعمال میشود.
CSV را برای تعداد و صفحات، یا TXT را برای یک مقدار در هر خط انتخاب کنید.
CSV شامل ستونهای نوع، مقدار، تعداد و صفحات است. انکودینگ UTF-8 از زبان فارسی و سایر خطوط پشتیبانی میکند. مقادیری که ممکن است به عنوان فرمولهای صفحه گسترده تفسیر شوند، برای وارد کردن ایمنتر با یک آپاستروف پیشوند میشوند.
TXT و کپی همه فقط شامل مقادیر هستند، یکی در هر خط. تمام ردیفهای منطبق با فیلتر گنجانده میشوند، حتی زمانی که جدول روی صفحه چندین صفحه نتیجه را در بر میگیرد. هیچ PDF جدیدی ایجاد نمیشود و PDF منبع بدون تغییر باقی میماند.
یک PDF را در مرورگر خود با محدودیتهای مشخص و اعلانهای نتایج جزئی پردازش کنید.
یک PDF تا ۵۰ مگابایت و ۵۰۰ صفحه را بارگذاری کنید. استخراج تا ۲۵۰,۰۰۰ کاراکتر و ۲,۰۰۰ تطبیق در هر صفحه، ۱۰ میلیون کاراکتر و ۲۰,۰۰۰ تطبیق در کل، و ۲,۰۰۰ حاشیهنویسی در هر صفحه را بررسی میکند. بودجه زمانی ۹۰ ثانیهای برای استخراج، اجرای طولانی را محدود میکند. اسناد بسیار پیچیده ممکن است در صورت تقسیم به فایلهای کوچکتر، بهتر کار کنند.
هنگامی که به محدودیت میرسید یا یک صفحه نمیتواند بهطور کامل خوانده شود، نتایج یک اعلان نشان میدهند و اجراهای محدود یا ناموفق با عبارت partial در نام فایل صادر میشوند. صفحاتی که متن قابل انتخاب ندارند جداگانه شمرده میشوند. برای اسکنهای فقط تصویری از PDF OCR استفاده کنید، سپس برای استخراج متن شناساییشده بازگردید.
محتوای PDF بهصورت محلی در این مرورگر پردازش میشود. اسناد آپلود شده به سرور استخراج ارسال نمیشوند. لینکها، آدرسهای ایمیل و شماره تلفنهای یافت شده در داخل PDF هرگز بهطور خودکار فراخوانی نمیشوند.
یک فایل PDF تا 50 مگابایت و 750 صفحه را باز کنید. محدودیتهای اضافی برای خروجی، حافظه و پردازش ممکن است برای اسناد پیچیده اعمال شود.
پردازش بدون بارگذاری سند، روی دستگاه شما انجام میشود. قبل از بستن صفحه، نتیجه را دانلود کنید؛ نسخه اصلی را جداگانه نگه دارید.
قبل از شروع بدانید چه انتظاری داشته باشید.
روی دستگاه شماآدرسهای HTTP/HTTPS چاپشده، آدرسهای www و اهداف لینکهای وب قابل کلیک را از یک فایل PDF جمعآوری کنید. ارجاعات صفحه را حفظ کرده و لیست بدون موارد تکراری را به صورت CSV یا TXT دانلود کنید. این ابزار بررسی نمیکند که آیا لینکها هنوز کار میکنند یا خیر. مقاصد داخلی صفحه، عملکردهای JavaScript، آدرسهای mailto و سایر طرحهای غیر وب به عنوان لینک وب صادر نمیشوند.
فقط متنهای قابل انتخاب و اهداف لینکهای شناساییشده خوانده میشوند. صفحات صرفاً تصویری ابتدا نیاز به OCR دارند. عملیات OCR را اجرا کنید، فایل PDF قابل جستجو را دانلود کرده و سپس به این استخراجکننده بازگردید.
حذف موارد تکراری، مقادیر معادل شناساییشده را ترکیب میکند. ستون Count تعداد دفعات مشاهدهشده و ستون Pages موقعیت فیزیکی آنها در صفحات PDF را نشان میدهد. برای جدا نگه داشتن موارد تکراری، این گزینه را غیرفعال کنید. یک هدف چاپشده و لینک قابل کلیک منطبق بر آن در یک صفحه، دو بار شمرده نمیشوند.
فرمت CSV شامل نوع، مقدار، تعداد دفعات تکرار و ارجاعات صفحه است. فرمتهای TXT و Copy all فقط مقادیر را به صورت یک مورد در هر خط ارائه میدهند. تمام ردیفهای منطبق با فیلتر فعلی، نه فقط صفحه قابل مشاهده جدول، در خروجی لحاظ میشوند.
خیر. تجزیه، تطبیق و خروجیهای PDF در همین مرورگر اجرا میشوند. PDF اصلی بدون تغییر باقی میماند. هیچ لینک، ایمیل یا شماره تلفن استخراجشدهای بهطور خودکار فراخوانی نمیشود.
یک فایل PDF تا سقف 50 MiB و 500 صفحه. استخراج به 250,000 کاراکتر متنی و 2,000 مورد منطبق در هر صفحه، و در مجموع 10 میلیون کاراکتر و 20,000 مورد منطبق، و 2,000 حاشیهنویسی در هر صفحه محدود است. اگر محدودیتها یا صفحات غیرقابل خواندن باعث ناقص شدن نتایج شوند، یک اعلان در نتایج نمایش داده میشود.
آموزش ویدیویی سریع
نحوه استخراج لینکها و URLها از یک فایل PDF
لینکهای وب مفید را بدون باز کردن تکتک آنها حفظ کنید.
روایت انگلیسی
مشاهده ویدیو