ツール150

便利なPDFタスクをシンプルに

PDFからリンクを抽出.

PDFから役立つリンクを取り出します。

Advertisements
あなたのPDFワークスペース
このデバイスで処理
またはここにファイルをドロップ
PDFはブラウザ内で処理されます。 PDF
Advertisements

PDFからリンクを抽出する方法

  1. 01

    PDFを1つ選択

    テキスト選択可能なドキュメントを読み込むか、サンプルをお試しください。

  2. 02

    抽出と確認

    「抽出」を選択します。値、件数、ソースページを確認し、リストをフィルタリングまたは並べ替えます。

  3. 03

    コピーまたはダウンロード

    値をコピーするか、ページ参照付きのCSV、またはシンプルなTXTリストをダウンロードします。

ブログPDFからリンクとURLを抽出する方法ガイドを読む

すべてのページを開かずにPDFリンクを抽出

PDFから印刷されたHTTP/HTTPSアドレス、wwwアドレス、およびクリック可能なWebリンクターゲットを収集します。ページ参照を保持し、重複排除されたリストをCSVまたはTXTとしてダウンロードします。

認識された値は、ソースページの参照付きリストになります。
クイックビデオチュートリアル PDFからリンクとURLを抽出する方法 1つずつ開くことなく、便利なWebリンクを保持します。 英語ナレーション 動画を見る

PDFからリンクとURLを抽出する方法

どのような場合に役立ちますか?

参考文献

ソースリンクを収集

レポートや研究資料から参考文献リストを作成します。

リソース

役立つリンク先を保存

クリック可能なリソースラベルの背後にあるリンク先を抽出します。

レビュー

監査リストを保持

他の場所で確認する前に、各リンクが見つかった場所を記録します。

機能とコントロール

表示およびクリック可能なリンクの検索

ラベルが「続きを読む」のみの場合でも、リンク先を含めます。

リンク抽出の仕組み

http://、https://、またはwww.で始まる印刷されたリンクが認識されます。PDFのリンク注釈により、通常のテキストの背後にあるHTTP/HTTPSターゲットも明らかにできます。PDF上でURLがクリック可能なラベルとして表示されている必要はありません。

ページ上の同一の印刷されたターゲットと注釈は、重複してカウントされません。重複比較には正規化されたURL形式が使用されますが、最初に認識された綴りが表示されます。長く折り返されたURLや破損したURLは手動修正が必要な場合があります。抽出されたURLが自動的にフェッチされることはありません。

ソースページで値を確認

件数の確認、PDFページへのジャンプ、結果リストのフィルタリングを行います。

確認と整理

各結果にはPDF内の物理的なページ位置が記録されます(印刷されたページ番号とは異なる場合があります)。ページチップを選択すると、概算のハイライト付きでプレビューが開きます。

「重複を削除」は有効状態で開始されます。件数は同じ値の認識された繰り返しを統合します。オフにすると個別の出現箇所が表示されます。「アルファベット順」でリストの順序を変更できます。フィルタリングは、表示されている行だけでなく、コピーやダウンロードにも適用されます。

値をコピーまたは構造化リストをダウンロード

件数とページ数にはCSVを、1行に1つの値にはTXTを選択します。

各ダウンロードの内容

CSVには「タイプ」、「値」、「件数」、「ページ」の列が含まれます。UTF-8エンコーディングにより、アラビア語やその他のスクリプトをサポートします。スプレッドシートの数式として解釈される可能性のある値には、安全にインポートできるようアポストロフィが接頭辞として付加されます。

TXTとコピーには値のみが1行に1つ含まれます。画面上のテーブルが複数の結果ページにまたがっている場合でも、フィルタに一致するすべての行が含まれます。新しいPDFは作成されず、ソースPDFも変更されません。

大規模な抽出を管理しやすくする

明確な制限と部分的な結果の通知により、ブラウザ内で1つのPDFを処理します。

ファイル、制限、スキャンされたページ

最大50 MiB、500ページまでのPDFを読み込めます。抽出は1ページあたり最大250,000文字と2,000件の照合、全体で1,000万文字と20,000件の照合、および1ページあたり2,000件の注釈を確認します。90秒の抽出予算が長時間の実行を制限します。非常に複雑なドキュメントは、小さなファイルに分割するとより適切に動作する場合があります。

制限に達した場合やページを完全に読み取れない場合、結果に通知が表示され、制限付きまたは失敗した実行はファイル名に「partial」を付けてエクスポートされます。選択可能なテキストがないページは個別にカウントされます。画像のみのスキャンにはPDF OCRを使用し、認識されたテキストを抽出してください。

PDFコンテンツはこのブラウザ内でローカルに処理されます。アップロードされたドキュメントが抽出サーバーに送信されることはありません。PDF内で見つかったリンク、メールアドレス、電話番号に自動的に連絡することはありません。

対応ファイルと処理

入力
PDF
出力
CSV / TXT

最大50 MB、750ページまでのPDFを1つ開けます。複雑なドキュメントでは、出力、メモリ、処理の制限が適用される場合があります。

処理はドキュメントをアップロードすることなく、お使いのデバイス上で行われます。ページを閉じる前に結果をダウンロードしてください。元のファイルは別途保管してください。

Advertisements
よくある質問

いくつかの役立つ回答

開始する前に、何が起こるかを確認してください。

このデバイスで処理
このツールは何を認識できますか?

1つのPDFから、印刷されたHTTP/HTTPSアドレス、wwwアドレス、およびクリック可能なWebリンクターゲットを収集します。ページ参照を保持し、重複排除されたリストをCSVまたはTXTとしてダウンロードします。このツールはリンクが現在有効かどうかは確認しません。内部ページへの宛先、JavaScriptアクション、mailto、およびその他のWeb以外のスキームは、Webリンクとしてエクスポートされません。

スキャンされたPDFからデータを抽出できますか?

選択可能なテキストと認識されたリンクターゲットのみが読み取られます。画像のみのページには、まずPDF OCRが必要です。OCRを実行し、検索可能なPDFをダウンロードしてから、この抽出ツールに戻ってください。

重複と件数はどのように処理されますか?

「重複を削除」は、認識された同等の値を結合します。「カウント」は検出された出現回数を示し、「ページ」は物理的なPDFのページ位置を一覧表示します。このオプションを無効にすると、出現箇所を個別に保持します。同じページ上の印刷されたターゲットと一致するクリック可能なリンクは、二重カウントされません。

CSVとTXTの違いは何ですか?

CSVには、タイプ、値、出現回数、ページ参照が含まれます。TXTおよび「すべてコピー」は、1行に1つずつ値のみを提供します。表示されているテーブルページだけでなく、現在のフィルターに一致するすべての行が含まれます。

PDFは抽出のためにアップロードされますか?

いいえ。PDFの解析、照合、エクスポートはすべてこのブラウザ内で実行されます。元のPDFは変更されません。抽出されたリンク、メールアドレス、電話番号に自動的に連絡することはありません。

制限事項は何ですか?

1つのPDFにつき最大50 MiB、500ページまでです。抽出は、1ページあたり最大250,000文字および2,000件の一致、全体で最大1,000万文字および20,000件の一致、1ページあたり2,000件の注釈に制限されています。制限や読み取り不可能なページにより結果が部分的になる場合は、その旨が通知されます。

続ける

次に何をしますか?

ツールを選択してください。完成したPDFはそのまま引き継がれます。

PDF

Advertisements

言語38

English العربية Français Italiano Deutsch Español Português Nederlands Русский Türkçe 日本語 中文 हिन्दी Bahasa Indonesia Bahasa Melayu 한국어 Tiếng Việt ไทย Polski Svenska Українська Norsk বাংলা Ελληνικά فارسی اردو Čeština Dansk Magyar Română Suomi Български Filipino ქართული Slovenčina Azərbaycanca עברית Slovenščina