PDFからメールアドレスを抽出を開くと、1行ずつコピーすることなくPDFから値を収集できます。この比較では、実際のサンプルドキュメントとツールからダウンロードしたCSVを使用しています。3ページのサンプルから、4 件の出現箇所に基づき 2 件のユニークなメールアドレスが生成されます。
PDFを開く
PDFを1つアップロードするか、サンプルを試すを選択してこの例に従ってください。PDFのプレビューとページのサムネイルが表示されます。元のファイルは変更されず、抽出はブラウザ内で実行されます。
テキストベースのディレクトリ、レポート、研究論文、パンフレットなどが便利な出発点となります。画像のみのスキャンデータは、印刷されたテキストを認識するためにOCRが必要です。
便利なオプションを選択する
スマートフォンの場合は設定を開きます。デスクトップの場合は、プレビューの横にある設定パネルを使用します。
重複を削除を有効のままにします。アドレス順に並べ替えた連絡先リストが必要な場合は、アルファベット順に並べ替えをオンにします。この例では、デフォルトのソース順とCSV形式を維持します。
抽出して一致を確認する
抽出を選択します。処理が完了すると、結果タブに値、出現回数、ソースページが表示されます。円形のページ番号を選択してPDFプレビュー内の位置を確認し、結果に戻ります。
サンプルでは、events@example.org が 1 ページと 3 ページに、research@example.org が 1 ページと 2 ページに出現します。重複排除されたリストでは各アドレスが1回ずつ表示され、件数は 2 となります。すべての出現箇所を個別の行として必要な場合は、重複削除をオフにしてください。
結果をフィルタリング…を使用してリストを絞り込みます。コピーやダウンロードには、結果テーブルが複数の画面にまたがる場合でも、一致するすべての行が含まれます。
CSVまたはTXTをダウンロードする
CSVをダウンロードを選択し、準備完了画面のメインのダウンロードボタンを使用します。CSVには「タイプ」「値」「件数」「ページ」の列が含まれます。TXTとすべてコピーには、1行に1つの値が含まれます。
スプレッドシートの数式として解釈される可能性のあるCSV値は、先頭にアポストロフィを付けて保護されます。例えば、国際電話番号はプラス記号で始まります。スプレッドシート保護なしのプレーンなリストが必要な場合は、TXTを使用してください。
よくある質問
リストをメーリングツールで直接使用できますか?
「すべてコピー」またはTXTでは、1行に1つのアドレスが出力されます。CSVには件数とページ参照も保持されます。別のシステムにインポートする前に、リストと連絡先所有者への連絡の根拠を確認してください。
スキャンされたPDFはどうすればよいですか?
まずPDF OCRを実行してから、認識されたコピーをこのツールに読み込んでください。OCRの出力は慎重に確認してください。文字の誤認識により、アドレスや識別子が変更される可能性があります。
抽出の制限は何ですか?
50 MiB以下、750 ページ以下のPDFを1つ使用してください。抽出は全体で 20,000 件、1ページあたり 2,000 件の一致に制限され、90 秒の処理予算が設定されています。テキストおよび注釈の制限も適用されます。制限や読み取り不可能なページによってスキャンが中断された場合、ツールは部分的な結果の通知を表示し、エクスポートファイル名に「partial」とマークします。
PDFのリンクは自動的に開かれますか?
いいえ。抽出はブラウザ内でファイルを読み取るため、抽出された宛先にアクセスすることはありません。ページボタンはPDFプレビュー内を移動します。
値とそのコンテキストを保持する
目的のリストを抽出し、ソースページを確認し、次のステップに適した形式でダウンロードします。

