連絡先アドレスを収集
会員名簿やイベントディレクトリを、ページ参照付きのリストに変換します。
PDF内の連絡先情報を整理されたメールリストに変換します。
| タイプ | 値 | 件数 | ページ |
|---|
コピーおよびダウンロードには、すべての結果ページにわたる一致する行がすべて含まれます。CSVには件数とPDFページ番号が含まれ、TXTには値のみが含まれます。
結果でページ番号を選択してソースを確認してください。ハイライトはおおよその位置を示しています。
リストの準備ができました。ダウンロードするか、戻って確認し、形式を変更してください。
テキスト選択可能なドキュメントを読み込むか、サンプルをお試しください。
「抽出」を選択します。値、件数、ソースページを確認し、リストをフィルタリングまたは並べ替えます。
値をコピーするか、ページ参照付きのCSV、またはシンプルなTXTリストをダウンロードします。
PDF内の選択可能な連絡先テキストを再利用可能なメールリストに変換します。認識されるアドレスには、通常のメールテキストやmailtoリンクのターゲットが含まれます。コピーやダウンロードの前に、件数とソースページを確認してください。
会員名簿やイベントディレクトリを、ページ参照付きのリストに変換します。
論文、履歴書、レポート内の連絡先アドレスを見つけます。
繰り返されるアドレスをグループ化し、出現頻度を調査します。
テキストやメールリンクからアドレスを収集します。
抽出ツールは、プラスタグやドット付きの名前を含む、一般的なlocal-part@domain形式のアドレスを探します。国際化ドメイン名は受け入れますが、非ASCII文字のメールボックス名、引用符で囲まれたローカルパート、意図的に難読化されたアドレスは対象外です。
重複を削除する際、アドレスは大文字と小文字を区別せずに比較されます。同じページ上の同一の表示アドレスとmailtoターゲットは、テキストがクリック可能であるという理由だけで2回カウントされることはありません。PDFの文字マップが破損している場合や、アドレスが複数行にまたがっている場合は、手動確認が必要になることがあります。
件数の確認、PDFページへのジャンプ、結果リストのフィルタリングを行います。
各結果にはPDF内の物理的なページ位置が記録されます(印刷されたページ番号とは異なる場合があります)。ページチップを選択すると、概算のハイライト付きでプレビューが開きます。
「重複を削除」は有効状態で開始されます。件数は同じ値の認識された繰り返しを統合します。オフにすると個別の出現箇所が表示されます。「アルファベット順」でリストの順序を変更できます。フィルタリングは、表示されている行だけでなく、コピーやダウンロードにも適用されます。
件数とページ数にはCSVを、1行に1つの値にはTXTを選択します。
CSVには「タイプ」、「値」、「件数」、「ページ」の列が含まれます。UTF-8エンコーディングにより、アラビア語やその他のスクリプトをサポートします。スプレッドシートの数式として解釈される可能性のある値には、安全にインポートできるようアポストロフィが接頭辞として付加されます。
TXTとコピーには値のみが1行に1つ含まれます。画面上のテーブルが複数の結果ページにまたがっている場合でも、フィルタに一致するすべての行が含まれます。新しいPDFは作成されず、ソースPDFも変更されません。
明確な制限と部分的な結果の通知により、ブラウザ内で1つのPDFを処理します。
最大50 MiB、500ページまでのPDFを読み込めます。抽出は1ページあたり最大250,000文字と2,000件の照合、全体で1,000万文字と20,000件の照合、および1ページあたり2,000件の注釈を確認します。90秒の抽出予算が長時間の実行を制限します。非常に複雑なドキュメントは、小さなファイルに分割するとより適切に動作する場合があります。
制限に達した場合やページを完全に読み取れない場合、結果に通知が表示され、制限付きまたは失敗した実行はファイル名に「partial」を付けてエクスポートされます。選択可能なテキストがないページは個別にカウントされます。画像のみのスキャンにはPDF OCRを使用し、認識されたテキストを抽出してください。
PDFコンテンツはこのブラウザ内でローカルに処理されます。アップロードされたドキュメントが抽出サーバーに送信されることはありません。PDF内で見つかったリンク、メールアドレス、電話番号に自動的に連絡することはありません。
最大50 MB、750ページまでのPDFを1つ開けます。複雑なドキュメントでは、出力、メモリ、処理の制限が適用される場合があります。
処理はドキュメントをアップロードすることなく、お使いのデバイス上で行われます。ページを閉じる前に結果をダウンロードしてください。元のファイルは別途保管してください。
開始する前に、何が起こるかを確認してください。
このデバイスで処理1つのPDF内の選択可能な連絡先テキストを、再利用可能なメールリストに変換します。認識されるアドレスには、従来のメールテキストとmailtoリンクターゲットが含まれます。コピーまたはダウンロードする前に、カウントとソースページを確認してください。スキャンされたページや、name [at] example [dot] orgのような難読化されたアドレスは、事前の準備が必要です。このツールは、配信、所有権、または連絡への同意を検証するものではありません。
選択可能なテキストと認識されたリンクターゲットのみが読み取られます。画像のみのページには、まずPDF OCRが必要です。OCRを実行し、検索可能なPDFをダウンロードしてから、この抽出ツールに戻ってください。
「重複を削除」は、認識された同等の値を結合します。「カウント」は検出された出現回数を示し、「ページ」は物理的なPDFのページ位置を一覧表示します。このオプションを無効にすると、出現箇所を個別に保持します。同じページ上の印刷されたターゲットと一致するクリック可能なリンクは、二重カウントされません。
CSVには、タイプ、値、出現回数、ページ参照が含まれます。TXTおよび「すべてコピー」は、1行に1つずつ値のみを提供します。表示されているテーブルページだけでなく、現在のフィルターに一致するすべての行が含まれます。
いいえ。PDFの解析、照合、エクスポートはすべてこのブラウザ内で実行されます。元のPDFは変更されません。抽出されたリンク、メールアドレス、電話番号に自動的に連絡することはありません。
1つのPDFにつき最大50 MiB、500ページまでです。抽出は、1ページあたり最大250,000文字および2,000件の一致、全体で最大1,000万文字および20,000件の一致、1ページあたり2,000件の注釈に制限されています。制限や読み取り不可能なページにより結果が部分的になる場合は、その旨が通知されます。
クイックビデオチュートリアル
PDFからメールアドレスを抽出する方法
散らばった連絡先情報を整理されたメールリストに変換します。
英語ナレーション
動画を見る