ツール150

便利なPDFタスクをシンプルに

PDFからメールアドレスを抽出.

PDF内の連絡先情報を整理されたメールリストに変換します。

Advertisements
あなたのPDFワークスペース
このデバイスで処理
またはここにファイルをドロップ
PDFはブラウザ内で処理されます。 PDF
Advertisements

PDFからメールアドレスを抽出する方法

  1. 01

    PDFを1つ選択

    テキスト選択可能なドキュメントを読み込むか、サンプルをお試しください。

  2. 02

    抽出と確認

    「抽出」を選択します。値、件数、ソースページを確認し、リストをフィルタリングまたは並べ替えます。

  3. 03

    コピーまたはダウンロード

    値をコピーするか、ページ参照付きのCSV、またはシンプルなTXTリストをダウンロードします。

ブログPDFからメールアドレスを抽出する方法ガイドを読む

ディレクトリやレポートからメールアドレスを抽出

PDF内の選択可能な連絡先テキストを再利用可能なメールリストに変換します。認識されるアドレスには、通常のメールテキストやmailtoリンクのターゲットが含まれます。コピーやダウンロードの前に、件数とソースページを確認してください。

認識された値は、ソースページの参照付きリストになります。
クイックビデオチュートリアル PDFからメールアドレスを抽出する方法 散らばった連絡先情報を整理されたメールリストに変換します。 英語ナレーション 動画を見る

PDFからメールアドレスを抽出する方法

どのような場合に役立ちますか?

ディレクトリ

連絡先アドレスを収集

会員名簿やイベントディレクトリを、ページ参照付きのリストに変換します。

リサーチ

著者の連絡先を収集

論文、履歴書、レポート内の連絡先アドレスを見つけます。

長いPDF

繰り返しのコピーを回避

繰り返されるアドレスをグループ化し、出現頻度を調査します。

機能とコントロール

メールアドレスの認識

テキストやメールリンクからアドレスを収集します。

サポートされているメール形式

抽出ツールは、プラスタグやドット付きの名前を含む、一般的なlocal-part@domain形式のアドレスを探します。国際化ドメイン名は受け入れますが、非ASCII文字のメールボックス名、引用符で囲まれたローカルパート、意図的に難読化されたアドレスは対象外です。

重複を削除する際、アドレスは大文字と小文字を区別せずに比較されます。同じページ上の同一の表示アドレスとmailtoターゲットは、テキストがクリック可能であるという理由だけで2回カウントされることはありません。PDFの文字マップが破損している場合や、アドレスが複数行にまたがっている場合は、手動確認が必要になることがあります。

ソースページで値を確認

件数の確認、PDFページへのジャンプ、結果リストのフィルタリングを行います。

確認と整理

各結果にはPDF内の物理的なページ位置が記録されます(印刷されたページ番号とは異なる場合があります)。ページチップを選択すると、概算のハイライト付きでプレビューが開きます。

「重複を削除」は有効状態で開始されます。件数は同じ値の認識された繰り返しを統合します。オフにすると個別の出現箇所が表示されます。「アルファベット順」でリストの順序を変更できます。フィルタリングは、表示されている行だけでなく、コピーやダウンロードにも適用されます。

値をコピーまたは構造化リストをダウンロード

件数とページ数にはCSVを、1行に1つの値にはTXTを選択します。

各ダウンロードの内容

CSVには「タイプ」、「値」、「件数」、「ページ」の列が含まれます。UTF-8エンコーディングにより、アラビア語やその他のスクリプトをサポートします。スプレッドシートの数式として解釈される可能性のある値には、安全にインポートできるようアポストロフィが接頭辞として付加されます。

TXTとコピーには値のみが1行に1つ含まれます。画面上のテーブルが複数の結果ページにまたがっている場合でも、フィルタに一致するすべての行が含まれます。新しいPDFは作成されず、ソースPDFも変更されません。

大規模な抽出を管理しやすくする

明確な制限と部分的な結果の通知により、ブラウザ内で1つのPDFを処理します。

ファイル、制限、スキャンされたページ

最大50 MiB、500ページまでのPDFを読み込めます。抽出は1ページあたり最大250,000文字と2,000件の照合、全体で1,000万文字と20,000件の照合、および1ページあたり2,000件の注釈を確認します。90秒の抽出予算が長時間の実行を制限します。非常に複雑なドキュメントは、小さなファイルに分割するとより適切に動作する場合があります。

制限に達した場合やページを完全に読み取れない場合、結果に通知が表示され、制限付きまたは失敗した実行はファイル名に「partial」を付けてエクスポートされます。選択可能なテキストがないページは個別にカウントされます。画像のみのスキャンにはPDF OCRを使用し、認識されたテキストを抽出してください。

PDFコンテンツはこのブラウザ内でローカルに処理されます。アップロードされたドキュメントが抽出サーバーに送信されることはありません。PDF内で見つかったリンク、メールアドレス、電話番号に自動的に連絡することはありません。

対応ファイルと処理

入力
PDF
出力
CSV / TXT

最大50 MB、750ページまでのPDFを1つ開けます。複雑なドキュメントでは、出力、メモリ、処理の制限が適用される場合があります。

処理はドキュメントをアップロードすることなく、お使いのデバイス上で行われます。ページを閉じる前に結果をダウンロードしてください。元のファイルは別途保管してください。

Advertisements
よくある質問

いくつかの役立つ回答

開始する前に、何が起こるかを確認してください。

このデバイスで処理
このツールは何を認識できますか?

1つのPDF内の選択可能な連絡先テキストを、再利用可能なメールリストに変換します。認識されるアドレスには、従来のメールテキストとmailtoリンクターゲットが含まれます。コピーまたはダウンロードする前に、カウントとソースページを確認してください。スキャンされたページや、name [at] example [dot] orgのような難読化されたアドレスは、事前の準備が必要です。このツールは、配信、所有権、または連絡への同意を検証するものではありません。

スキャンされたPDFからデータを抽出できますか?

選択可能なテキストと認識されたリンクターゲットのみが読み取られます。画像のみのページには、まずPDF OCRが必要です。OCRを実行し、検索可能なPDFをダウンロードしてから、この抽出ツールに戻ってください。

重複と件数はどのように処理されますか?

「重複を削除」は、認識された同等の値を結合します。「カウント」は検出された出現回数を示し、「ページ」は物理的なPDFのページ位置を一覧表示します。このオプションを無効にすると、出現箇所を個別に保持します。同じページ上の印刷されたターゲットと一致するクリック可能なリンクは、二重カウントされません。

CSVとTXTの違いは何ですか?

CSVには、タイプ、値、出現回数、ページ参照が含まれます。TXTおよび「すべてコピー」は、1行に1つずつ値のみを提供します。表示されているテーブルページだけでなく、現在のフィルターに一致するすべての行が含まれます。

PDFは抽出のためにアップロードされますか?

いいえ。PDFの解析、照合、エクスポートはすべてこのブラウザ内で実行されます。元のPDFは変更されません。抽出されたリンク、メールアドレス、電話番号に自動的に連絡することはありません。

制限事項は何ですか?

1つのPDFにつき最大50 MiB、500ページまでです。抽出は、1ページあたり最大250,000文字および2,000件の一致、全体で最大1,000万文字および20,000件の一致、1ページあたり2,000件の注釈に制限されています。制限や読み取り不可能なページにより結果が部分的になる場合は、その旨が通知されます。

続ける

次に何をしますか?

ツールを選択してください。完成したPDFはそのまま引き継がれます。

PDF

Advertisements

言語38

English العربية Français Italiano Deutsch Español Português Nederlands Русский Türkçe 日本語 中文 हिन्दी Bahasa Indonesia Bahasa Melayu 한국어 Tiếng Việt ไทย Polski Svenska Українська Norsk বাংলা Ελληνικά فارسی اردو Čeština Dansk Magyar Română Suomi Български Filipino ქართული Slovenčina Azərbaycanca עברית Slovenščina