PDFから電話番号を抽出を開くと、PDFから値を1行ずつコピーすることなく収集できます。この比較では、実際のサンプルドキュメントとツールからダウンロードしたCSVを使用します。3ページのサンプルから、3 件の出現回数に基づき、2 件のユニークな国際電話番号が生成されます。
PDFを開く
PDFを1つアップロードするか、サンプルを試すを選択してこの例に従ってください。PDFのプレビューとページのサムネイルが表示されます。元のファイルは変更されず、抽出はブラウザ内で実行されます。
テキストベースのディレクトリ、レポート、研究論文、パンフレットなどが適しています。画像のみのスキャンデータは、印刷されたテキストを認識するためにOCRが必要です。
便利なオプションを選択
スマートフォンの場合は設定を開きます。デスクトップの場合は、プレビューの横にある設定パネルを使用します。
電話番号の地域のデフォルトは国際番号のみ (+)です。サンプルの場合はそのままにしてください。国番号のない国内番号が含まれるドキュメントの場合は、国を選択してください。重複を削除は有効のままにします。
抽出して一致を確認
抽出を選択します。処理が完了すると、結果タブに値、出現回数、ソースページが表示されます。円形のページ番号を選択するとPDFプレビュー内の位置を確認でき、その後結果に戻ることができます。
サンプルでは、1ページと2ページで +1 (202) 555-0123 が、1ページで +44 20 7946 0958 が見つかります。同じ番号の同等の形式は、国際形式と内線番号でグループ化されます。ソースページボタンを使用すると、一致したものが実際に連絡先番号であるかどうかを確認できます。
結果をフィルタリング…を使用してリストを絞り込みます。コピーやダウンロードには、結果テーブルが複数画面にわたる場合でも、一致するすべての行が含まれます。
CSVまたはTXTをダウンロード
CSVをダウンロードを選択し、準備完了画面のメインのダウンロードボタンを使用します。CSVには「タイプ」「値」「件数」「ページ」の列が含まれます。TXTとすべてコピーには、1行に1つの値が含まれます。
スプレッドシートの数式として解釈される可能性のあるCSV値は、先頭にアポストロフィを付けて保護されます。たとえば、国際電話番号はプラス記号で始まります。スプレッドシート保護なしの単純なリストが必要な場合は、TXTを使用してください。
よくある質問
ローカル番号が見つからなかったのはなぜですか?
「電話番号の地域」で国を選択し、再度「抽出」を選択してください。「国際番号のみ」モードでは、先頭にプラス記号が必要です。番号が不自然なレイアウトで分割されている場合や、選択可能なテキストがない場合は、ソースを修正するか、先にOCRを使用してください。
スキャンされたPDFはどうすればよいですか?
最初にPDF OCRを実行し、認識されたコピーをこのツールに読み込んでください。OCRの出力は慎重に確認してください。文字の誤りによってアドレスや識別子が変更される可能性があります。
抽出の制限は何ですか?
50 MiBおよび750ページまでのPDFを1つ使用してください。抽出は全体で20,000件、ページあたり2,000件の一致に制限されており、90秒の処理予算が設定されています。テキストおよび注釈の制限も適用されます。制限や読み取り不可能なページによってスキャンが中断された場合、ツールは部分的な結果の通知を表示し、エクスポートファイル名に「partial」とマークします。
PDFのリンクは自動的に開かれますか?
いいえ。抽出はブラウザ内でファイルを読み取るだけで、抽出された宛先にアクセスすることはありません。ページボタンはPDFプレビュー内を移動するためのものです。
値とそのコンテキストを保持する
目的のリストを抽出し、ソースページを確認し、次のステップに適した形式でダウンロードします。

