ابزارها150

یک کار مفید با PDF، به سادگی انجام شد

استخراج ایمیل از PDF.

جزئیات تماس در PDF خود را به یک لیست ایمیل تمیز تبدیل کنید.

Advertisements
فضای کاری PDF شما
روی دستگاه شما
یا فایل‌های خود را اینجا رها کنید
فایل PDF شما در این مرورگر پردازش می‌شود. PDF
Advertisements

نحوه استخراج ایمیل‌ها از PDF

  1. 01

    یک فایل PDF انتخاب کنید

    سندی با متن قابل انتخاب بارگذاری کنید، یا نمونه را امتحان کنید.

  2. 02

    استخراج و بررسی

    استخراج را انتخاب کنید. مقادیر، تعداد و صفحات منبع را بررسی کنید؛ لیست را فیلتر یا مرتب کنید.

  3. 03

    کپی یا دانلود

    مقادیر را کپی کنید، یا CSV با ارجاعات صفحه یا یک لیست ساده TXT دانلود کنید.

وبلاگنحوه استخراج آدرس‌های ایمیل از یک فایل PDFخواندن راهنما

استخراج آدرس‌های ایمیل از دایرکتوری‌ها و گزارش‌ها

متن مخاطبین قابل انتخاب در یک فایل PDF را به یک لیست ایمیل قابل استفاده تبدیل کنید. آدرس‌های شناسایی شده شامل متن ایمیل‌های معمولی و مقاصد لینک mailto هستند. قبل از کپی یا دانلود، تعداد و صفحات منبع را بررسی کنید.

مقادیر شناسایی شده به لیستی با ارجاعات صفحه منبع تبدیل می‌شوند.
آموزش ویدیویی سریع نحوه استخراج آدرس‌های ایمیل از یک فایل PDF جزئیات تماس پراکنده را به یک لیست ایمیل تمیز تبدیل کنید. روایت انگلیسی مشاهده ویدیو

نحوه استخراج آدرس‌های ایمیل از یک فایل PDF

این کار چه زمانی مفید است؟

دایرکتوری‌ها

جمع‌آوری آدرس‌های تماس

یک دایرکتوری عضویت یا رویداد را به لیستی با ارجاعات صفحه تبدیل کنید.

تحقیق

جمع‌آوری مخاطبین نویسنده

آدرس‌های مکاتبات را در مقالات، رزومه‌ها یا گزارش‌ها پیدا کنید.

فایل‌های PDF طولانی

اجتناب از کپی کردن مکرر

آدرس‌های تکراری را گروه‌بندی کرده و بررسی کنید که چند بار ظاهر می‌شوند.

ویژگی‌ها و کنترل‌ها

تشخیص آدرس‌های ایمیل

جمع‌آوری آدرس‌ها از متن و لینک‌های ایمیل.

فرمت‌های ایمیل پشتیبانی‌شده

استخراج‌کننده به دنبال آدرس‌های مرسوم local-part@domain، شامل تگ‌های پلاس و نام‌های نقطه‌دار می‌گردد. این ابزار نام‌های دامنه بین‌المللی را می‌پذیرد اما نام‌های صندوق پستی غیر ASCII، بخش‌های محلی داخل کوتیشن یا آدرس‌های عمداً مبهم‌سازی شده را نمی‌پذیرد.

آدرس‌ها هنگام حذف موارد تکراری بدون در نظر گرفتن بزرگی و کوچکی حروف مقایسه می‌شوند. یک آدرس قابل مشاهده و هدف mailto یکسان در یک صفحه، صرفاً به دلیل قابل کلیک بودن متن، دو بار شمرده نمی‌شوند. نقشه‌های کاراکتر خراب PDF و آدرس‌هایی که در خطوط شکسته شده‌اند ممکن است نیاز به بررسی دستی داشته باشند.

بررسی مقادیر به همراه صفحات منبع آن‌ها

تعداد را بررسی کنید، به یک صفحه خاص از PDF بپرید و لیست نتایج را فیلتر کنید.

بررسی و سازماندهی

هر نتیجه موقعیت فیزیکی صفحه در PDF را ثبت می‌کند که ممکن است با شماره صفحات چاپی متفاوت باشد. روی یک برچسب صفحه کلیک کنید تا پیش‌نمایش با هایلایت تقریبی باز شود.

حذف موارد تکراری به‌صورت پیش‌فرض فعال است. تعداد، تکرارهای شناسایی‌شده از یک مقدار واحد را ترکیب می‌کند؛ آن را خاموش کنید تا موارد جداگانه را ببینید. مرتب‌سازی الفبایی ترتیب لیست را تغییر می‌دهد. فیلتر کردن هم بر کپی و دانلود و هم بر ردیف‌های قابل مشاهده اعمال می‌شود.

کپی مقادیر یا دانلود لیست ساختاریافته

CSV را برای تعداد و صفحات، یا TXT را برای یک مقدار در هر خط انتخاب کنید.

هر دانلود شامل چه مواردی است

CSV شامل ستون‌های نوع، مقدار، تعداد و صفحات است. انکودینگ UTF-8 از زبان فارسی و سایر خطوط پشتیبانی می‌کند. مقادیری که ممکن است به عنوان فرمول‌های صفحه گسترده تفسیر شوند، برای وارد کردن ایمن‌تر با یک آپاستروف پیش‌وند می‌شوند.

TXT و کپی همه فقط شامل مقادیر هستند، یکی در هر خط. تمام ردیف‌های منطبق با فیلتر گنجانده می‌شوند، حتی زمانی که جدول روی صفحه چندین صفحه نتیجه را در بر می‌گیرد. هیچ PDF جدیدی ایجاد نمی‌شود و PDF منبع بدون تغییر باقی می‌ماند.

مدیریت استخراج‌های بزرگ

یک PDF را در مرورگر خود با محدودیت‌های مشخص و اعلان‌های نتایج جزئی پردازش کنید.

فایل‌ها، محدودیت‌ها و صفحات اسکن‌شده

یک PDF تا ۵۰ مگابایت و ۵۰۰ صفحه را بارگذاری کنید. استخراج تا ۲۵۰,۰۰۰ کاراکتر و ۲,۰۰۰ تطبیق در هر صفحه، ۱۰ میلیون کاراکتر و ۲۰,۰۰۰ تطبیق در کل، و ۲,۰۰۰ حاشیه‌نویسی در هر صفحه را بررسی می‌کند. بودجه زمانی ۹۰ ثانیه‌ای برای استخراج، اجرای طولانی را محدود می‌کند. اسناد بسیار پیچیده ممکن است در صورت تقسیم به فایل‌های کوچک‌تر، بهتر کار کنند.

هنگامی که به محدودیت می‌رسید یا یک صفحه نمی‌تواند به‌طور کامل خوانده شود، نتایج یک اعلان نشان می‌دهند و اجراهای محدود یا ناموفق با عبارت partial در نام فایل صادر می‌شوند. صفحاتی که متن قابل انتخاب ندارند جداگانه شمرده می‌شوند. برای اسکن‌های فقط تصویری از PDF OCR استفاده کنید، سپس برای استخراج متن شناسایی‌شده بازگردید.

محتوای PDF به‌صورت محلی در این مرورگر پردازش می‌شود. اسناد آپلود شده به سرور استخراج ارسال نمی‌شوند. لینک‌ها، آدرس‌های ایمیل و شماره تلفن‌های یافت شده در داخل PDF هرگز به‌طور خودکار فراخوانی نمی‌شوند.

فایل‌های پشتیبانی‌شده و پردازش

ورودی
PDF
خروجی
CSV / TXT

یک فایل PDF تا 50 مگابایت و 750 صفحه را باز کنید. محدودیت‌های اضافی برای خروجی، حافظه و پردازش ممکن است برای اسناد پیچیده اعمال شود.

پردازش بدون بارگذاری سند، روی دستگاه شما انجام می‌شود. قبل از بستن صفحه، نتیجه را دانلود کنید؛ نسخه اصلی را جداگانه نگه دارید.

Advertisements
سوالات متداول

چند پاسخ مفید

قبل از شروع بدانید چه انتظاری داشته باشید.

روی دستگاه شما
این ابزار چه مواردی را می‌تواند شناسایی کند؟

متن‌های تماس قابل انتخاب در یک فایل PDF را به یک لیست ایمیل قابل استفاده تبدیل کنید. آدرس‌های شناسایی‌شده شامل متن ایمیل‌های متعارف و اهداف لینک‌های mailto هستند. قبل از کپی یا دانلود، تعداد و صفحات منبع را بررسی کنید. صفحات اسکن‌شده و آدرس‌های مبهم مانند name [at] example [dot] org نیاز به آماده‌سازی دارند. این ابزار تحویل، مالکیت یا رضایت برای تماس با افراد را تأیید نمی‌کند.

آیا می‌توانم داده‌ها را از فایل‌های PDF اسکن‌شده استخراج کنم؟

فقط متن‌های قابل انتخاب و اهداف لینک‌های شناسایی‌شده خوانده می‌شوند. صفحات صرفاً تصویری ابتدا نیاز به OCR دارند. عملیات OCR را اجرا کنید، فایل PDF قابل جستجو را دانلود کرده و سپس به این استخراج‌کننده بازگردید.

موارد تکراری و تعداد چگونه مدیریت می‌شوند؟

حذف موارد تکراری، مقادیر معادل شناسایی‌شده را ترکیب می‌کند. ستون Count تعداد دفعات مشاهده‌شده و ستون Pages موقعیت فیزیکی آن‌ها در صفحات PDF را نشان می‌دهد. برای جدا نگه داشتن موارد تکراری، این گزینه را غیرفعال کنید. یک هدف چاپ‌شده و لینک قابل کلیک منطبق بر آن در یک صفحه، دو بار شمرده نمی‌شوند.

تفاوت بین CSV و TXT چیست؟

فرمت CSV شامل نوع، مقدار، تعداد دفعات تکرار و ارجاعات صفحه است. فرمت‌های TXT و Copy all فقط مقادیر را به صورت یک مورد در هر خط ارائه می‌دهند. تمام ردیف‌های منطبق با فیلتر فعلی، نه فقط صفحه قابل مشاهده جدول، در خروجی لحاظ می‌شوند.

آیا PDF برای استخراج آپلود می‌شود؟

خیر. تجزیه، تطبیق و خروجی‌های PDF در همین مرورگر اجرا می‌شوند. PDF اصلی بدون تغییر باقی می‌ماند. هیچ لینک، ایمیل یا شماره تلفن استخراج‌شده‌ای به‌طور خودکار فراخوانی نمی‌شود.

محدودیت‌ها چیست؟

یک فایل PDF تا سقف 50 MiB و 500 صفحه. استخراج به 250,000 کاراکتر متنی و 2,000 مورد منطبق در هر صفحه، و در مجموع 10 میلیون کاراکتر و 20,000 مورد منطبق، و 2,000 حاشیه‌نویسی در هر صفحه محدود است. اگر محدودیت‌ها یا صفحات غیرقابل خواندن باعث ناقص شدن نتایج شوند، یک اعلان در نتایج نمایش داده می‌شود.

ادامه دهید

دوست دارید مرحله بعد چه کاری انجام دهید؟

یک ابزار انتخاب کنید. PDF نهایی شما همراهتان خواهد بود.

PDF

Advertisements

زبان38

English العربية Français Italiano Deutsch Español Português Nederlands Русский Türkçe 日本語 中文 हिन्दी Bahasa Indonesia Bahasa Melayu 한국어 Tiếng Việt ไทย Polski Svenska Українська Norsk বাংলা Ελληνικά فارسی اردو Čeština Dansk Magyar Română Suomi Български Filipino ქართული Slovenčina Azərbaycanca עברית Slovenščina