PDF به متن را باز کنید، صفحات را انتخاب کرده و فرمت دانلود را برگزینید. نمونه چهار صفحهای ما یک فایل TXT با فرمت UTF-8 تولید میکند که حاوی متن استخراج شده صفحات است.
بارگذاری یک PDF با متن قابل استفاده
فایل PDF اصلی را انتخاب کنید. بررسی کنید که آیا متن آن در یک نمایشگر قابل انتخاب است یا خیر. صفحهای اسکن شده که فقط از پیکسل تشکیل شده، قبل از ارائه متن مفید، به OCR PDF نیاز دارد.
تنظیم صفحات و بستهبندی
برای کل سند، فیلد صفحات را خالی بگذارید یا برای بخشی از آن، محدوده مورد نظر را وارد کنید. صفحهای که در پیشنمایش نشان داده میشود، لزوماً محدوده خروجی نیست.
گزینه یک فایل متنی را برای یک فایل TXT ترکیبی (مانند مثال) یا فایلهای جداگانه را برای یک فایل ZIP حاوی فایلهای متنی در سطح صفحه و یک فایل ترکیبی انتخاب کنید.
استخراج و بررسی متن
شروع را انتخاب کرده و دانلود کنید. این نمونه 3,940 بایت تولید میکند که در آن بخشهای چهار صفحه با کاراکترهای شکست صفحه از هم جدا شدهاند.
فایل TXT را در یک ویرایشگر متن باز کرده و ستونها، زیرنویسها و جداول را بررسی کنید. استخراج ممکن است فاصلهگذاریهای غیرمعمول PDF را حفظ کند؛ قبل از چسباندن متن در مقصد نهایی، آن را پاکسازی کنید.
سوالات متداول
چرا نتیجه برای اسکن من خالی است؟
صفحه ممکن است فقط شامل یک تصویر باشد. برای تشخیص کلمات از OCR PDF استفاده کنید؛ این ابزار فقط لایه متنی موجود را استخراج میکند.
کدام ابزار برای سرتیترها و یادداشتها بهتر است؟
زمانی که نشانگرهای سرتیتر و پاراگرافها مفیدتر از TXT ساده هستند، PDF به Markdown را امتحان کنید. ساختار استنباط شده آن را نیز بررسی کنید.
آن را با سند خود امتحان کنید
نتیجه را بررسی کرده و سپس نسخه مورد نیاز خود را ذخیره کنید.

