PDFからJSONへを使用して、ページレコード、テキストブロック、および描画データをエクスポートします。当社の4ページPDFは、document.jsonと、ZIP内の参照されたPNG画像1点を生成します。
PDFページを選択する
PDFを読み込み、ページを空のままにするとドキュメント全体が対象となります。必要なサブセットを入力することも可能です。今回の例では全4ページを含めています。
エクスポートしてアセットをまとめて保持する
開始を選択します。画像アセットを含むエクスポートはZIPとしてダウンロードされます。アーカイブ全体を解凍し、imagesディレクトリをdocument.jsonの横に配置してください。
サンプルにはimages/page-001-image-005.pngが含まれています。画像参照はバイナリデータをJSONに埋め込むのではなく、アセットパスを指します。画像アセットを含まないエクスポートは、直接.jsonとしてダウンロードできます。
ドキュメント構造を読み取る
サンプルではバージョン1、単位pt、および左上原点が宣言されています。ページレコードには、ソースページ番号、寸法、回転、ブロック、および描画が含まれます。座標は回転前のページを表しているため、データを重ね合わせる際は回転を考慮してください。
JSONパーサーを使用してJSONを解析します。テキストやスタイリングについてはブロック、行、スパンを、ジオメトリについてはbbox値を確認してください。ネストされたオブジェクトは、単一のテキスト文字列ではなくレイアウトを記述します。
処理ワークフローでデータを使用する前に、元のPDFと照らし合わせて読み取り順序と画像参照を確認してください。
よくある質問
元のPDFを正確に再構築できますか?
完全な双方向の再構築が可能であるとは想定しないでください。エクスポートは利用可能なコンテンツとジオメトリを記述するものですが、PDFの機能やセマンティクスはより複雑な場合があります。
なぜZIPファイルが届いたのですか?
サンプルには画像が含まれています。ZIPはdocument.jsonと参照されたアセットをまとめて保持するため、画像を特定できます。
自分のドキュメントで試す
結果を確認し、必要なバージョンを保存してください。

