PDFからテキストへを開き、ページを選択してダウンロード形式を選びます。4ページのサンプルからは、抽出されたテキストを含む1つのUTF-8 TXTファイルが生成されます。
テキストが利用可能なPDFを読み込む
元のPDFを選択します。ビューアーでテキストが選択可能かどうかを確認してください。ピクセルのみで構成されたスキャンページの場合は、有用なテキストを得るためにPDF OCRが必要です。
ページとパッケージングを設定する
ページを空欄にするとドキュメント全体が対象となり、範囲を指定するとその一部が対象となります。プレビューに表示されているページは、エクスポートの範囲とは異なります。
例のように結合されたTXTが必要な場合は1つのテキストファイルを、ページごとのテキストファイルと結合ファイルを含むZIPが必要な場合は個別のファイルを選択してください。
テキストを抽出して確認する
開始を選択してダウンロードします。サンプルからは3,940バイトのファイルが生成され、4つのページセクションが改ページ文字で区切られています。
テキストエディタでTXTを開き、列、キャプション、表を確認してください。抽出時にPDF特有の不自然な間隔が残ることがあるため、テキストを貼り付ける前に整理してください。
よくある質問
スキャンしたファイルの結果が空になるのはなぜですか?
ページが画像のみで構成されている可能性があります。その場合はPDF OCRを使用して単語を認識させてください。このツールは既存のテキストレイヤーを抽出するものです。
見出しやメモに適したツールはどれですか?
見出しマーカーや段落構造が必要な場合は、PDFからMarkdownへをお試しください。推論された構造も確認してください。
自分のドキュメントで試す
結果を確認し、必要なバージョンを保存してください。

