ツール150

便利なPDFタスクをシンプルに

PDFからデータを抽出.

必要なデータを見つけます。すべての結果にソースページを保持します。

Advertisements
あなたのPDFワークスペース
このデバイスで処理
またはここにファイルをドロップ
PDFはブラウザ内で処理されます。 PDF
Advertisements

PDFからデータを抽出する方法

  1. 01

    PDFを1つ選択

    テキスト選択可能なドキュメントを読み込むか、サンプルをお試しください。

  2. 02

    抽出と確認

    「抽出」を選択します。値、件数、ソースページを確認し、リストをフィルタリングまたは並べ替えます。

  3. 03

    コピーまたはダウンロード

    値をコピーするか、ページ参照付きのCSV、またはシンプルなTXTリストをダウンロードします。

ブログPDFから構造化データを抽出する方法ガイドを読む

PDFから構造化された値をCSVまたはテキストに抽出

必要なデータ型(メールアドレス、電話番号、URL、数値日付、IPv4アドレス、ドメイン、DOI、ISBN、ハッシュタグ、MACアドレス)を選択します。抽出された値を件数とページ参照と共に確認します。

認識された値は、ソースページの参照付きリストになります。
クイックビデオチュートリアル PDFから構造化データを抽出する方法 連絡先や研究識別子を1つの整理されたリストに収集します。 英語ナレーション 動画を見る

PDFから構造化データを抽出する方法

どのような場合に役立ちますか?

リサーチ

識別子を収集

DOIおよびISBNの値を、それらが出現するページと共に収集します。

レポート

数値の詳細を取り出す

日付付きのエントリとIPv4アドレスを見つけます。

ディレクトリ

連絡先リストの作成

メールアドレス、電話番号、ウェブリンクを1つの構造化されたエクスポートにまとめます。

機能とコントロール

有用なデータ型の選択

メールアドレス、電話番号、URLから開始し、特殊な値については「その他のデータ型」を開きます。

認識ツールがサポートするもの

日付は4桁の年を含む数値形式である必要があります。曖昧な日/月の値はソースの順序を保持します。IPv4のオクテットは検証されますが、IPv6は含まれません。

ドメインは任意のファイル名からではなく、認識されたメールアドレスやウェブリンクから導出されます。DOI抽出は一般的な現代のDOI形式を対象としており、すべての歴史的な形式を網羅するものではありません。ISBN-13値には有効なチェックサムが必要です。ISBN-10にはISBNラベルも必要です。ハッシュタグにはアラビア語を含むUnicode文字を含めることができます。

MACアドレスは、コロンまたはハイフンで区切られた6つのペアを使用します。このツールが抽出されたアドレスや識別子に連絡することはありません。

ソースページで値を確認

件数の確認、PDFページへのジャンプ、結果リストのフィルタリングを行います。

確認と整理

各結果にはPDF内の物理的なページ位置が記録されます(印刷されたページ番号とは異なる場合があります)。ページチップを選択すると、概算のハイライト付きでプレビューが開きます。

「重複を削除」は有効状態で開始されます。件数は同じ値の認識された繰り返しを統合します。オフにすると個別の出現箇所が表示されます。「アルファベット順」でリストの順序を変更できます。フィルタリングは、表示されている行だけでなく、コピーやダウンロードにも適用されます。

値をコピーまたは構造化リストをダウンロード

件数とページ数にはCSVを、1行に1つの値にはTXTを選択します。

各ダウンロードの内容

CSVには「タイプ」、「値」、「件数」、「ページ」の列が含まれます。UTF-8エンコーディングにより、アラビア語やその他のスクリプトをサポートします。スプレッドシートの数式として解釈される可能性のある値には、安全にインポートできるようアポストロフィが接頭辞として付加されます。

TXTとコピーには値のみが1行に1つ含まれます。画面上のテーブルが複数の結果ページにまたがっている場合でも、フィルタに一致するすべての行が含まれます。新しいPDFは作成されず、ソースPDFも変更されません。

大規模な抽出を管理しやすくする

明確な制限と部分的な結果の通知により、ブラウザ内で1つのPDFを処理します。

ファイル、制限、スキャンされたページ

最大50 MiB、500ページまでのPDFを読み込めます。抽出は1ページあたり最大250,000文字と2,000件の照合、全体で1,000万文字と20,000件の照合、および1ページあたり2,000件の注釈を確認します。90秒の抽出予算が長時間の実行を制限します。非常に複雑なドキュメントは、小さなファイルに分割するとより適切に動作する場合があります。

制限に達した場合やページを完全に読み取れない場合、結果に通知が表示され、制限付きまたは失敗した実行はファイル名に「partial」を付けてエクスポートされます。選択可能なテキストがないページは個別にカウントされます。画像のみのスキャンにはPDF OCRを使用し、認識されたテキストを抽出してください。

PDFコンテンツはこのブラウザ内でローカルに処理されます。アップロードされたドキュメントが抽出サーバーに送信されることはありません。PDF内で見つかったリンク、メールアドレス、電話番号に自動的に連絡することはありません。

対応ファイルと処理

入力
PDF
出力
CSV / TXT

最大50 MB、750ページまでのPDFを1つ開けます。複雑なドキュメントでは、出力、メモリ、処理の制限が適用される場合があります。

処理はドキュメントをアップロードすることなく、お使いのデバイス上で行われます。ページを閉じる前に結果をダウンロードしてください。元のファイルは別途保管してください。

Advertisements
よくある質問

いくつかの役立つ回答

開始する前に、何が起こるかを確認してください。

このデバイスで処理
このツールは何を認識できますか?

メール、電話番号、URL、数値日付、IPv4アドレス、ドメイン、DOI、ISBN、ハッシュタグ、MACアドレスなど、必要なデータタイプを選択してください。抽出された値をカウントとページ参照とともに確認します。これはテーブル、請求書、または意味的なフィールドではなく、認識可能な値を抽出します。パターンとチェックサムはノイズを低減しますが、完全性を保証したり、識別子が本物であることを証明したりするものではありません。

スキャンされたPDFからデータを抽出できますか?

選択可能なテキストと認識されたリンクターゲットのみが読み取られます。画像のみのページには、まずPDF OCRが必要です。OCRを実行し、検索可能なPDFをダウンロードしてから、この抽出ツールに戻ってください。

重複と件数はどのように処理されますか?

「重複を削除」は、認識された同等の値を結合します。「カウント」は検出された出現回数を示し、「ページ」は物理的なPDFのページ位置を一覧表示します。このオプションを無効にすると、出現箇所を個別に保持します。同じページ上の印刷されたターゲットと一致するクリック可能なリンクは、二重カウントされません。

CSVとTXTの違いは何ですか?

CSVには、タイプ、値、出現回数、ページ参照が含まれます。TXTおよび「すべてコピー」は、1行に1つずつ値のみを提供します。表示されているテーブルページだけでなく、現在のフィルターに一致するすべての行が含まれます。

PDFは抽出のためにアップロードされますか?

いいえ。PDFの解析、照合、エクスポートはすべてこのブラウザ内で実行されます。元のPDFは変更されません。抽出されたリンク、メールアドレス、電話番号に自動的に連絡することはありません。

制限事項は何ですか?

1つのPDFにつき最大50 MiB、500ページまでです。抽出は、1ページあたり最大250,000文字および2,000件の一致、全体で最大1,000万文字および20,000件の一致、1ページあたり2,000件の注釈に制限されています。制限や読み取り不可能なページにより結果が部分的になる場合は、その旨が通知されます。

続ける

次に何をしますか?

ツールを選択してください。完成したPDFはそのまま引き継がれます。

PDF

Advertisements

言語38

English العربية Français Italiano Deutsch Español Português Nederlands Русский Türkçe 日本語 中文 हिन्दी Bahasa Indonesia Bahasa Melayu 한국어 Tiếng Việt ไทย Polski Svenska Українська Norsk বাংলা Ελληνικά فارسی اردو Čeština Dansk Magyar Română Suomi Български Filipino ქართული Slovenčina Azərbaycanca עברית Slovenščina