識別子を収集
DOIおよびISBNの値を、それらが出現するページと共に収集します。
必要なデータを見つけます。すべての結果にソースページを保持します。
| タイプ | 値 | 件数 | ページ |
|---|
コピーおよびダウンロードには、すべての結果ページにわたる一致する行がすべて含まれます。CSVには件数とPDFページ番号が含まれ、TXTには値のみが含まれます。
結果でページ番号を選択してソースを確認してください。ハイライトはおおよその位置を示しています。
リストの準備ができました。ダウンロードするか、戻って確認し、形式を変更してください。
テキスト選択可能なドキュメントを読み込むか、サンプルをお試しください。
「抽出」を選択します。値、件数、ソースページを確認し、リストをフィルタリングまたは並べ替えます。
値をコピーするか、ページ参照付きのCSV、またはシンプルなTXTリストをダウンロードします。
必要なデータ型(メールアドレス、電話番号、URL、数値日付、IPv4アドレス、ドメイン、DOI、ISBN、ハッシュタグ、MACアドレス)を選択します。抽出された値を件数とページ参照と共に確認します。
DOIおよびISBNの値を、それらが出現するページと共に収集します。
日付付きのエントリとIPv4アドレスを見つけます。
メールアドレス、電話番号、ウェブリンクを1つの構造化されたエクスポートにまとめます。
メールアドレス、電話番号、URLから開始し、特殊な値については「その他のデータ型」を開きます。
日付は4桁の年を含む数値形式である必要があります。曖昧な日/月の値はソースの順序を保持します。IPv4のオクテットは検証されますが、IPv6は含まれません。
ドメインは任意のファイル名からではなく、認識されたメールアドレスやウェブリンクから導出されます。DOI抽出は一般的な現代のDOI形式を対象としており、すべての歴史的な形式を網羅するものではありません。ISBN-13値には有効なチェックサムが必要です。ISBN-10にはISBNラベルも必要です。ハッシュタグにはアラビア語を含むUnicode文字を含めることができます。
MACアドレスは、コロンまたはハイフンで区切られた6つのペアを使用します。このツールが抽出されたアドレスや識別子に連絡することはありません。
件数の確認、PDFページへのジャンプ、結果リストのフィルタリングを行います。
各結果にはPDF内の物理的なページ位置が記録されます(印刷されたページ番号とは異なる場合があります)。ページチップを選択すると、概算のハイライト付きでプレビューが開きます。
「重複を削除」は有効状態で開始されます。件数は同じ値の認識された繰り返しを統合します。オフにすると個別の出現箇所が表示されます。「アルファベット順」でリストの順序を変更できます。フィルタリングは、表示されている行だけでなく、コピーやダウンロードにも適用されます。
件数とページ数にはCSVを、1行に1つの値にはTXTを選択します。
CSVには「タイプ」、「値」、「件数」、「ページ」の列が含まれます。UTF-8エンコーディングにより、アラビア語やその他のスクリプトをサポートします。スプレッドシートの数式として解釈される可能性のある値には、安全にインポートできるようアポストロフィが接頭辞として付加されます。
TXTとコピーには値のみが1行に1つ含まれます。画面上のテーブルが複数の結果ページにまたがっている場合でも、フィルタに一致するすべての行が含まれます。新しいPDFは作成されず、ソースPDFも変更されません。
明確な制限と部分的な結果の通知により、ブラウザ内で1つのPDFを処理します。
最大50 MiB、500ページまでのPDFを読み込めます。抽出は1ページあたり最大250,000文字と2,000件の照合、全体で1,000万文字と20,000件の照合、および1ページあたり2,000件の注釈を確認します。90秒の抽出予算が長時間の実行を制限します。非常に複雑なドキュメントは、小さなファイルに分割するとより適切に動作する場合があります。
制限に達した場合やページを完全に読み取れない場合、結果に通知が表示され、制限付きまたは失敗した実行はファイル名に「partial」を付けてエクスポートされます。選択可能なテキストがないページは個別にカウントされます。画像のみのスキャンにはPDF OCRを使用し、認識されたテキストを抽出してください。
PDFコンテンツはこのブラウザ内でローカルに処理されます。アップロードされたドキュメントが抽出サーバーに送信されることはありません。PDF内で見つかったリンク、メールアドレス、電話番号に自動的に連絡することはありません。
最大50 MB、750ページまでのPDFを1つ開けます。複雑なドキュメントでは、出力、メモリ、処理の制限が適用される場合があります。
処理はドキュメントをアップロードすることなく、お使いのデバイス上で行われます。ページを閉じる前に結果をダウンロードしてください。元のファイルは別途保管してください。
開始する前に、何が起こるかを確認してください。
このデバイスで処理メール、電話番号、URL、数値日付、IPv4アドレス、ドメイン、DOI、ISBN、ハッシュタグ、MACアドレスなど、必要なデータタイプを選択してください。抽出された値をカウントとページ参照とともに確認します。これはテーブル、請求書、または意味的なフィールドではなく、認識可能な値を抽出します。パターンとチェックサムはノイズを低減しますが、完全性を保証したり、識別子が本物であることを証明したりするものではありません。
選択可能なテキストと認識されたリンクターゲットのみが読み取られます。画像のみのページには、まずPDF OCRが必要です。OCRを実行し、検索可能なPDFをダウンロードしてから、この抽出ツールに戻ってください。
「重複を削除」は、認識された同等の値を結合します。「カウント」は検出された出現回数を示し、「ページ」は物理的なPDFのページ位置を一覧表示します。このオプションを無効にすると、出現箇所を個別に保持します。同じページ上の印刷されたターゲットと一致するクリック可能なリンクは、二重カウントされません。
CSVには、タイプ、値、出現回数、ページ参照が含まれます。TXTおよび「すべてコピー」は、1行に1つずつ値のみを提供します。表示されているテーブルページだけでなく、現在のフィルターに一致するすべての行が含まれます。
いいえ。PDFの解析、照合、エクスポートはすべてこのブラウザ内で実行されます。元のPDFは変更されません。抽出されたリンク、メールアドレス、電話番号に自動的に連絡することはありません。
1つのPDFにつき最大50 MiB、500ページまでです。抽出は、1ページあたり最大250,000文字および2,000件の一致、全体で最大1,000万文字および20,000件の一致、1ページあたり2,000件の注釈に制限されています。制限や読み取り不可能なページにより結果が部分的になる場合は、その旨が通知されます。
クイックビデオチュートリアル
PDFから構造化データを抽出する方法
連絡先や研究識別子を1つの整理されたリストに収集します。
英語ナレーション
動画を見る