ソースリンクを収集
レポートや研究資料から参考文献リストを作成します。
PDFから役立つリンクを取り出します。
| タイプ | 値 | 件数 | ページ |
|---|
コピーおよびダウンロードには、すべての結果ページにわたる一致する行がすべて含まれます。CSVには件数とPDFページ番号が含まれ、TXTには値のみが含まれます。
結果でページ番号を選択してソースを確認してください。ハイライトはおおよその位置を示しています。
リストの準備ができました。ダウンロードするか、戻って確認し、形式を変更してください。
テキスト選択可能なドキュメントを読み込むか、サンプルをお試しください。
「抽出」を選択します。値、件数、ソースページを確認し、リストをフィルタリングまたは並べ替えます。
値をコピーするか、ページ参照付きのCSV、またはシンプルなTXTリストをダウンロードします。
PDFから印刷されたHTTP/HTTPSアドレス、wwwアドレス、およびクリック可能なWebリンクターゲットを収集します。ページ参照を保持し、重複排除されたリストをCSVまたはTXTとしてダウンロードします。
レポートや研究資料から参考文献リストを作成します。
クリック可能なリソースラベルの背後にあるリンク先を抽出します。
他の場所で確認する前に、各リンクが見つかった場所を記録します。
ラベルが「続きを読む」のみの場合でも、リンク先を含めます。
http://、https://、またはwww.で始まる印刷されたリンクが認識されます。PDFのリンク注釈により、通常のテキストの背後にあるHTTP/HTTPSターゲットも明らかにできます。PDF上でURLがクリック可能なラベルとして表示されている必要はありません。
ページ上の同一の印刷されたターゲットと注釈は、重複してカウントされません。重複比較には正規化されたURL形式が使用されますが、最初に認識された綴りが表示されます。長く折り返されたURLや破損したURLは手動修正が必要な場合があります。抽出されたURLが自動的にフェッチされることはありません。
件数の確認、PDFページへのジャンプ、結果リストのフィルタリングを行います。
各結果にはPDF内の物理的なページ位置が記録されます(印刷されたページ番号とは異なる場合があります)。ページチップを選択すると、概算のハイライト付きでプレビューが開きます。
「重複を削除」は有効状態で開始されます。件数は同じ値の認識された繰り返しを統合します。オフにすると個別の出現箇所が表示されます。「アルファベット順」でリストの順序を変更できます。フィルタリングは、表示されている行だけでなく、コピーやダウンロードにも適用されます。
件数とページ数にはCSVを、1行に1つの値にはTXTを選択します。
CSVには「タイプ」、「値」、「件数」、「ページ」の列が含まれます。UTF-8エンコーディングにより、アラビア語やその他のスクリプトをサポートします。スプレッドシートの数式として解釈される可能性のある値には、安全にインポートできるようアポストロフィが接頭辞として付加されます。
TXTとコピーには値のみが1行に1つ含まれます。画面上のテーブルが複数の結果ページにまたがっている場合でも、フィルタに一致するすべての行が含まれます。新しいPDFは作成されず、ソースPDFも変更されません。
明確な制限と部分的な結果の通知により、ブラウザ内で1つのPDFを処理します。
最大50 MiB、500ページまでのPDFを読み込めます。抽出は1ページあたり最大250,000文字と2,000件の照合、全体で1,000万文字と20,000件の照合、および1ページあたり2,000件の注釈を確認します。90秒の抽出予算が長時間の実行を制限します。非常に複雑なドキュメントは、小さなファイルに分割するとより適切に動作する場合があります。
制限に達した場合やページを完全に読み取れない場合、結果に通知が表示され、制限付きまたは失敗した実行はファイル名に「partial」を付けてエクスポートされます。選択可能なテキストがないページは個別にカウントされます。画像のみのスキャンにはPDF OCRを使用し、認識されたテキストを抽出してください。
PDFコンテンツはこのブラウザ内でローカルに処理されます。アップロードされたドキュメントが抽出サーバーに送信されることはありません。PDF内で見つかったリンク、メールアドレス、電話番号に自動的に連絡することはありません。
最大50 MB、750ページまでのPDFを1つ開けます。複雑なドキュメントでは、出力、メモリ、処理の制限が適用される場合があります。
処理はドキュメントをアップロードすることなく、お使いのデバイス上で行われます。ページを閉じる前に結果をダウンロードしてください。元のファイルは別途保管してください。
開始する前に、何が起こるかを確認してください。
このデバイスで処理1つのPDFから、印刷されたHTTP/HTTPSアドレス、wwwアドレス、およびクリック可能なWebリンクターゲットを収集します。ページ参照を保持し、重複排除されたリストをCSVまたはTXTとしてダウンロードします。このツールはリンクが現在有効かどうかは確認しません。内部ページへの宛先、JavaScriptアクション、mailto、およびその他のWeb以外のスキームは、Webリンクとしてエクスポートされません。
選択可能なテキストと認識されたリンクターゲットのみが読み取られます。画像のみのページには、まずPDF OCRが必要です。OCRを実行し、検索可能なPDFをダウンロードしてから、この抽出ツールに戻ってください。
「重複を削除」は、認識された同等の値を結合します。「カウント」は検出された出現回数を示し、「ページ」は物理的なPDFのページ位置を一覧表示します。このオプションを無効にすると、出現箇所を個別に保持します。同じページ上の印刷されたターゲットと一致するクリック可能なリンクは、二重カウントされません。
CSVには、タイプ、値、出現回数、ページ参照が含まれます。TXTおよび「すべてコピー」は、1行に1つずつ値のみを提供します。表示されているテーブルページだけでなく、現在のフィルターに一致するすべての行が含まれます。
いいえ。PDFの解析、照合、エクスポートはすべてこのブラウザ内で実行されます。元のPDFは変更されません。抽出されたリンク、メールアドレス、電話番号に自動的に連絡することはありません。
1つのPDFにつき最大50 MiB、500ページまでです。抽出は、1ページあたり最大250,000文字および2,000件の一致、全体で最大1,000万文字および20,000件の一致、1ページあたり2,000件の注釈に制限されています。制限や読み取り不可能なページにより結果が部分的になる場合は、その旨が通知されます。
クイックビデオチュートリアル
PDFからリンクとURLを抽出する方法
1つずつ開くことなく、便利なWebリンクを保持します。
英語ナレーション
動画を見る