استخراج داده از PDF را باز کنید تا مقادیر را از یک فایل PDF بدون کپی کردن خط به خط جمعآوری کنید. این مقایسه از سند نمونه واقعی و یک فایل CSV دانلود شده از ابزار استفاده میکند. با انتخاب ایمیلها، تلفنها، آدرسهای وب، DOI، ISBN و IPv4، نمونه سه صفحهای 11 ردیف منحصربهفرد از 15 مورد را تولید میکند.
فایل PDF خود را باز کنید
یک فایل PDF آپلود کنید، یا امتحان نمونه را انتخاب کنید تا این مثال را دنبال کنید. پیشنمایش PDF و تصاویر بندانگشتی صفحات ظاهر میشوند. فایل اصلی شما بدون تغییر باقی میماند و استخراج در مرورگر شما اجرا میشود.
یک دایرکتوری مبتنی بر متن، گزارش، مقاله پژوهشی یا بروشور نقطه شروع مفیدی است. اسکنهای فقط تصویری قبل از اینکه متن چاپشده آنها قابل تشخیص باشد، نیاز به OCR دارند.
گزینههای مفید را انتخاب کنید
در گوشی، تنظیمات را باز کنید. در دسکتاپ، از پنل تنظیمات در کنار پیشنمایش استفاده کنید.
در بخش چه چیزی استخراج شود، ایمیلها، شمارههای تلفن و آدرسهای وب بهصورت پیشفرض انتخاب شدهاند. انواع دادههای بیشتر را باز کنید و همچنین DOI، ISBN و آدرسهای IPv4 را انتخاب کنید. حذف موارد تکراری را فعال بگذارید و CSV را انتخاب کنید.
استخراج و بررسی موارد منطبق
گزینه استخراج را انتخاب کنید. پس از پایان پردازش، تب نتایج مقادیر، تعداد تکرار و صفحات منبع را نشان میدهد. یک شماره صفحه دایرهای را انتخاب کنید تا مکان آن را در پیشنمایش PDF بررسی کنید، سپس به نتایج بازگردید.
خروجی، لیست مخاطبین را با DOI 10.1000/182، ISBN 978-0-306-40615-7 و آدرس IPv4 192.0.2.10 از صفحه 2 ترکیب میکند. ستون نوع، هر مقدار را شناسایی میکند. قبل از کپی یا دانلود یک زیرمجموعه کوچکتر، بر اساس یک کلمه یا شناسه مرتبط فیلتر کنید.
از فیلتر نتایج برای محدود کردن لیست استفاده کنید. کپی و دانلود شامل تمام ردیفهای منطبق میشود، حتی زمانی که جدول نتایج چندین صفحه ردیف را در بر میگیرد.
دانلود CSV یا TXT
گزینه دانلود CSV را انتخاب کنید، سپس از دکمه اصلی دانلود در صفحه آماده استفاده کنید. CSV شامل ستونهای نوع، مقدار، تعداد و صفحات است. TXT و کپی همه شامل یک مقدار در هر خط هستند.
مقادیر CSV که ممکن است به عنوان فرمولهای صفحه گسترده تفسیر شوند، با یک آپاستروف در ابتدا محافظت میشوند. برای مثال، یک شماره تلفن بینالمللی با علامت مثبت شروع میشود. اگر به یک لیست ساده بدون محافظت صفحه گسترده نیاز دارید، از TXT استفاده کنید.
سوالات متداول
آیا این ابزار هر عددی یا هر شناسهای را استخراج میکند؟
خیر. هر دستهبندی انتخابشده قوانین تشخیص خاص خود را دارد. IPv6، درصدها، قیمتها و شمارههای کارت پرداخت استخراج نمیشوند. موارد منطبق را با منبع بررسی کنید؛ فرمت معتبر نمیتواند تأیید کند که یک مخاطب یا شناسه وجود دارد.
با یک PDF اسکنشده چه کار کنم؟
ابتدا PDF OCR را اجرا کنید، سپس نسخه شناساییشده را در این ابزار بارگذاری کنید. خروجی OCR را با دقت بررسی کنید: یک کاراکتر اشتباه میتواند یک آدرس یا شناسه را تغییر دهد.
محدودیتهای استخراج چیست؟
از یک فایل PDF تا 50 مگابایت و 750 صفحه استفاده کنید. استخراج در مجموع به 20,000 مورد منطبق و 2,000 مورد در هر صفحه محدود شده است، با بودجه پردازشی 90 ثانیهای. محدودیتهای متن و حاشیهنویسی نیز اعمال میشوند. اگر یک محدودیت یا صفحه غیرقابل خواندن اسکن را قطع کند، ابزار یک اعلان نتایج جزئی نشان میدهد و نام فایل خروجی را به عنوان جزئی علامتگذاری میکند.
آیا لینکهای PDF من بهطور خودکار باز میشوند؟
خیر. استخراج، فایل را در مرورگر میخواند و از مقاصد استخراجشده بازدید نمیکند. دکمههای صفحه در داخل پیشنمایش PDF حرکت میکنند.
مقادیر و زمینه آنها را حفظ کنید
یک لیست متمرکز استخراج کنید، صفحات منبع را بررسی کنید و فرمتی را که برای مرحله بعدی شما مناسب است، دانلود کنید.

