استخراج لینکها از PDF را باز کنید تا مقادیر را از یک فایل PDF بدون کپی کردن خط به خط آنها جمعآوری کنید. این مقایسه از سند نمونه واقعی و یک فایل CSV دانلود شده از ابزار استفاده میکند. نمونه سه صفحهای، ۴ آدرس وب منحصربهفرد را از ۵ مورد تکرار استخراج میکند.
فایل PDF خود را باز کنید
یک فایل PDF آپلود کنید یا امتحان نمونه را انتخاب کنید تا این مثال را دنبال کنید. پیشنمایش PDF و تصاویر بندانگشتی صفحات ظاهر میشوند. فایل اصلی شما بدون تغییر باقی میماند و استخراج در مرورگر شما انجام میشود.
یک دایرکتوری مبتنی بر متن، گزارش، مقاله پژوهشی یا بروشور، نقطه شروع مفیدی است. اسکنهای فقط تصویری قبل از اینکه متن چاپشده آنها قابل تشخیص باشد، نیاز به OCR دارند.
گزینههای مفید را انتخاب کنید
در گوشی، تنظیمات را باز کنید. در دسکتاپ، از پنل تنظیمات در کنار پیشنمایش استفاده کنید.
حذف موارد تکراری را فعال نگه دارید تا اهداف تکراری گروهبندی شوند. زمانی که به ارجاعات صفحه نیاز دارید CSV را انتخاب کنید، یا برای یک لیست URL ساده، TXT را انتخاب کنید. این مثال از فرمت پیشفرض CSV و ترتیب منبع استفاده میکند.
موارد منطبق را استخراج و بررسی کنید
استخراج را انتخاب کنید. پس از پایان پردازش، تب نتایج مقادیر، تعداد تکرار و صفحات منبع را نشان میدهد. یک شماره صفحه دایرهای را انتخاب کنید تا مکان آن را در پیشنمایش PDF بررسی کنید، سپس به نتایج بازگردید.
این نمونه شامل https://example.org/events دو بار و سه آدرس وب دیگر است. همچنین یک لینک قابل کلیک را نشان میدهد که برچسب قابل مشاهده آن با هدفش متفاوت است. یک URL چاپشده و هدف قابل کلیک یکسان آن در همان صفحه، دو بار شمرده نمیشوند.
از فیلتر نتایج برای محدود کردن لیست استفاده کنید. کپی و دانلود شامل تمام ردیفهای منطبق میشود، حتی زمانی که جدول نتایج چندین صفحه ردیف را در بر میگیرد.
دانلود CSV یا TXT
دانلود CSV را انتخاب کنید، سپس از دکمه اصلی دانلود در صفحه آماده استفاده کنید. CSV شامل ستونهای نوع، مقدار، تعداد و صفحات است. TXT و کپی همه شامل یک مقدار در هر خط هستند.
مقادیر CSV که ممکن است به عنوان فرمولهای صفحه گسترده تفسیر شوند، با یک آپاستروف در ابتدا محافظت میشوند. برای مثال، یک شماره تلفن بینالمللی با علامت مثبت شروع میشود. اگر به یک لیست ساده بدون محافظت صفحه گسترده نیاز دارید، از TXT استفاده کنید.
سوالات متداول
آیا این ابزار میتواند لینکی را پشت کلماتی مانند «بیشتر بخوانید» پیدا کند؟
بله، زمانی که آن کلمات دارای یک حاشیهنویسی لینک HTTP یا HTTPS پشتیبانیشده در PDF باشند. مقدار صادر شده، مقصد وب آن است. یک زیرخط بصری به تنهایی ثابت نمیکند که یک لینک قابل کلیک وجود دارد.
با یک PDF اسکنشده چه کار کنم؟
ابتدا PDF OCR را اجرا کنید، سپس نسخه شناساییشده را در این ابزار بارگذاری کنید. خروجی OCR را به دقت بررسی کنید: یک کاراکتر اشتباه میتواند یک آدرس یا شناسه را تغییر دهد.
محدودیتهای استخراج چیست؟
از یک فایل PDF تا ۵۰ مگابایت و 750 صفحه استفاده کنید. استخراج در مجموع به ۲۰,۰۰۰ مورد منطبق و ۲,۰۰۰ مورد در هر صفحه با بودجه پردازشی ۹۰ ثانیهای محدود شده است. محدودیتهای متن و حاشیهنویسی نیز اعمال میشوند. اگر یک محدودیت یا صفحه غیرقابل خواندن اسکن را قطع کند، ابزار یک اعلان نتایج ناقص نشان میدهد و نام فایل خروجی را به عنوان ناقص علامتگذاری میکند.
آیا لینکهای PDF من به طور خودکار باز میشوند؟
خیر. استخراج فایل را در مرورگر میخواند و از مقاصد استخراجشده بازدید نمیکند. دکمههای صفحه در داخل پیشنمایش PDF حرکت میکنند.
مقادیر و زمینه آنها را حفظ کنید
یک لیست متمرکز استخراج کنید، صفحات منبع را بررسی کنید و فرمتی که برای مرحله بعدی شما مناسب است را دانلود کنید.

