ابزارها150

یک کار مفید با PDF، به سادگی انجام شد

استخراج لینک‌ها از PDF.

لینک‌های مفید را از فایل PDF خود بیرون بکشید.

Advertisements
فضای کاری PDF شما
روی دستگاه شما
یا فایل‌های خود را اینجا رها کنید
فایل PDF شما در این مرورگر پردازش می‌شود. PDF
Advertisements

نحوه استخراج لینک‌ها از PDF

  1. 01

    یک فایل PDF انتخاب کنید

    سندی با متن قابل انتخاب بارگذاری کنید، یا نمونه را امتحان کنید.

  2. 02

    استخراج و بررسی

    استخراج را انتخاب کنید. مقادیر، تعداد و صفحات منبع را بررسی کنید؛ لیست را فیلتر یا مرتب کنید.

  3. 03

    کپی یا دانلود

    مقادیر را کپی کنید، یا CSV با ارجاعات صفحه یا یک لیست ساده TXT دانلود کنید.

وبلاگنحوه استخراج لینک‌ها و URLها از یک فایل PDFخواندن راهنما

استخراج لینک‌های PDF بدون باز کردن تک‌تک صفحات

آدرس‌های HTTP/HTTPS چاپ شده، آدرس‌های www و مقاصد لینک‌های وب قابل کلیک را از یک فایل PDF جمع‌آوری کنید. ارجاعات صفحه را حفظ کرده و یک لیست بدون تکرار را به صورت CSV یا TXT دانلود کنید.

مقادیر شناسایی شده به لیستی با ارجاعات صفحه منبع تبدیل می‌شوند.
آموزش ویدیویی سریع نحوه استخراج لینک‌ها و URLها از یک فایل PDF لینک‌های وب مفید را بدون باز کردن تک‌تک آن‌ها حفظ کنید. روایت انگلیسی مشاهده ویدیو

نحوه استخراج لینک‌ها و URLها از یک فایل PDF

این کار چه زمانی مفید است؟

منابع

جمع‌آوری لینک‌های منبع

یک لیست مرجع از گزارش‌ها و اسناد تحقیقاتی بسازید.

منابع

ذخیره مقاصد مفید

مقاصد پشت برچسب‌های منابع قابل کلیک را استخراج کنید.

بررسی

نگهداری لیست حسابرسی

قبل از بررسی هر لینک در جای دیگر، ثبت کنید که در کجا پیدا شده است.

ویژگی‌ها و کنترل‌ها

یافتن لینک‌های قابل مشاهده و قابل کلیک

حتی زمانی که برچسب لینک فقط می‌گوید «بیشتر بخوانید»، هدف لینک را بگنجانید.

استخراج لینک چگونه کار می‌کند

لینک‌های چاپی که با http://، https:// یا www. شروع می‌شوند، شناسایی می‌شوند. حاشیه‌نویسی‌های لینک PDF نیز می‌توانند اهداف HTTP/HTTPS پشت متن‌های معمولی را آشکار کنند. لازم نیست PDF حتماً URL را به عنوان برچسب قابل کلیک نمایش دهد.

اهداف چاپی و حاشیه‌نویسی‌های یکسان در یک صفحه دو بار شمرده نمی‌شوند. فرمت‌های استاندارد شده URL برای مقایسه موارد تکراری استفاده می‌شوند، در حالی که اولین املای شناسایی‌شده نمایش داده می‌شود. URLهای طولانی، شکسته یا آسیب‌دیده ممکن است نیاز به اصلاح دستی داشته باشند. هیچ URL استخراج‌شده‌ای به‌طور خودکار فراخوانی نمی‌شود.

بررسی مقادیر به همراه صفحات منبع آن‌ها

تعداد را بررسی کنید، به یک صفحه خاص از PDF بپرید و لیست نتایج را فیلتر کنید.

بررسی و سازماندهی

هر نتیجه موقعیت فیزیکی صفحه در PDF را ثبت می‌کند که ممکن است با شماره صفحات چاپی متفاوت باشد. روی یک برچسب صفحه کلیک کنید تا پیش‌نمایش با هایلایت تقریبی باز شود.

حذف موارد تکراری به‌صورت پیش‌فرض فعال است. تعداد، تکرارهای شناسایی‌شده از یک مقدار واحد را ترکیب می‌کند؛ آن را خاموش کنید تا موارد جداگانه را ببینید. مرتب‌سازی الفبایی ترتیب لیست را تغییر می‌دهد. فیلتر کردن هم بر کپی و دانلود و هم بر ردیف‌های قابل مشاهده اعمال می‌شود.

کپی مقادیر یا دانلود لیست ساختاریافته

CSV را برای تعداد و صفحات، یا TXT را برای یک مقدار در هر خط انتخاب کنید.

هر دانلود شامل چه مواردی است

CSV شامل ستون‌های نوع، مقدار، تعداد و صفحات است. انکودینگ UTF-8 از زبان فارسی و سایر خطوط پشتیبانی می‌کند. مقادیری که ممکن است به عنوان فرمول‌های صفحه گسترده تفسیر شوند، برای وارد کردن ایمن‌تر با یک آپاستروف پیش‌وند می‌شوند.

TXT و کپی همه فقط شامل مقادیر هستند، یکی در هر خط. تمام ردیف‌های منطبق با فیلتر گنجانده می‌شوند، حتی زمانی که جدول روی صفحه چندین صفحه نتیجه را در بر می‌گیرد. هیچ PDF جدیدی ایجاد نمی‌شود و PDF منبع بدون تغییر باقی می‌ماند.

مدیریت استخراج‌های بزرگ

یک PDF را در مرورگر خود با محدودیت‌های مشخص و اعلان‌های نتایج جزئی پردازش کنید.

فایل‌ها، محدودیت‌ها و صفحات اسکن‌شده

یک PDF تا ۵۰ مگابایت و ۵۰۰ صفحه را بارگذاری کنید. استخراج تا ۲۵۰,۰۰۰ کاراکتر و ۲,۰۰۰ تطبیق در هر صفحه، ۱۰ میلیون کاراکتر و ۲۰,۰۰۰ تطبیق در کل، و ۲,۰۰۰ حاشیه‌نویسی در هر صفحه را بررسی می‌کند. بودجه زمانی ۹۰ ثانیه‌ای برای استخراج، اجرای طولانی را محدود می‌کند. اسناد بسیار پیچیده ممکن است در صورت تقسیم به فایل‌های کوچک‌تر، بهتر کار کنند.

هنگامی که به محدودیت می‌رسید یا یک صفحه نمی‌تواند به‌طور کامل خوانده شود، نتایج یک اعلان نشان می‌دهند و اجراهای محدود یا ناموفق با عبارت partial در نام فایل صادر می‌شوند. صفحاتی که متن قابل انتخاب ندارند جداگانه شمرده می‌شوند. برای اسکن‌های فقط تصویری از PDF OCR استفاده کنید، سپس برای استخراج متن شناسایی‌شده بازگردید.

محتوای PDF به‌صورت محلی در این مرورگر پردازش می‌شود. اسناد آپلود شده به سرور استخراج ارسال نمی‌شوند. لینک‌ها، آدرس‌های ایمیل و شماره تلفن‌های یافت شده در داخل PDF هرگز به‌طور خودکار فراخوانی نمی‌شوند.

فایل‌های پشتیبانی‌شده و پردازش

ورودی
PDF
خروجی
CSV / TXT

یک فایل PDF تا 50 مگابایت و 750 صفحه را باز کنید. محدودیت‌های اضافی برای خروجی، حافظه و پردازش ممکن است برای اسناد پیچیده اعمال شود.

پردازش بدون بارگذاری سند، روی دستگاه شما انجام می‌شود. قبل از بستن صفحه، نتیجه را دانلود کنید؛ نسخه اصلی را جداگانه نگه دارید.

Advertisements
سوالات متداول

چند پاسخ مفید

قبل از شروع بدانید چه انتظاری داشته باشید.

روی دستگاه شما
این ابزار چه مواردی را می‌تواند شناسایی کند؟

آدرس‌های HTTP/HTTPS چاپ‌شده، آدرس‌های www و اهداف لینک‌های وب قابل کلیک را از یک فایل PDF جمع‌آوری کنید. ارجاعات صفحه را حفظ کرده و لیست بدون موارد تکراری را به صورت CSV یا TXT دانلود کنید. این ابزار بررسی نمی‌کند که آیا لینک‌ها هنوز کار می‌کنند یا خیر. مقاصد داخلی صفحه، عملکردهای JavaScript، آدرس‌های mailto و سایر طرح‌های غیر وب به عنوان لینک وب صادر نمی‌شوند.

آیا می‌توانم داده‌ها را از فایل‌های PDF اسکن‌شده استخراج کنم؟

فقط متن‌های قابل انتخاب و اهداف لینک‌های شناسایی‌شده خوانده می‌شوند. صفحات صرفاً تصویری ابتدا نیاز به OCR دارند. عملیات OCR را اجرا کنید، فایل PDF قابل جستجو را دانلود کرده و سپس به این استخراج‌کننده بازگردید.

موارد تکراری و تعداد چگونه مدیریت می‌شوند؟

حذف موارد تکراری، مقادیر معادل شناسایی‌شده را ترکیب می‌کند. ستون Count تعداد دفعات مشاهده‌شده و ستون Pages موقعیت فیزیکی آن‌ها در صفحات PDF را نشان می‌دهد. برای جدا نگه داشتن موارد تکراری، این گزینه را غیرفعال کنید. یک هدف چاپ‌شده و لینک قابل کلیک منطبق بر آن در یک صفحه، دو بار شمرده نمی‌شوند.

تفاوت بین CSV و TXT چیست؟

فرمت CSV شامل نوع، مقدار، تعداد دفعات تکرار و ارجاعات صفحه است. فرمت‌های TXT و Copy all فقط مقادیر را به صورت یک مورد در هر خط ارائه می‌دهند. تمام ردیف‌های منطبق با فیلتر فعلی، نه فقط صفحه قابل مشاهده جدول، در خروجی لحاظ می‌شوند.

آیا PDF برای استخراج آپلود می‌شود؟

خیر. تجزیه، تطبیق و خروجی‌های PDF در همین مرورگر اجرا می‌شوند. PDF اصلی بدون تغییر باقی می‌ماند. هیچ لینک، ایمیل یا شماره تلفن استخراج‌شده‌ای به‌طور خودکار فراخوانی نمی‌شود.

محدودیت‌ها چیست؟

یک فایل PDF تا سقف 50 MiB و 500 صفحه. استخراج به 250,000 کاراکتر متنی و 2,000 مورد منطبق در هر صفحه، و در مجموع 10 میلیون کاراکتر و 20,000 مورد منطبق، و 2,000 حاشیه‌نویسی در هر صفحه محدود است. اگر محدودیت‌ها یا صفحات غیرقابل خواندن باعث ناقص شدن نتایج شوند، یک اعلان در نتایج نمایش داده می‌شود.

ادامه دهید

دوست دارید مرحله بعد چه کاری انجام دهید؟

یک ابزار انتخاب کنید. PDF نهایی شما همراهتان خواهد بود.

PDF

Advertisements

زبان38

English العربية Français Italiano Deutsch Español Português Nederlands Русский Türkçe 日本語 中文 हिन्दी Bahasa Indonesia Bahasa Melayu 한국어 Tiếng Việt ไทย Polski Svenska Українська Norsk বাংলা Ελληνικά فارسی اردو Čeština Dansk Magyar Română Suomi Български Filipino ქართული Slovenčina Azərbaycanca עברית Slovenščina