ツール150

実用的なPDFガイド

PDFをレイアウトデータ付きのXMLに変換する方法

独自のワークフロー用に構造化されたページデータを取得します。

PDFのテキスト、ページ寸法、描画データをXMLとしてエクスポートします。参照されている画像を保持し、コードで使用する前に構造を確認できます。

ガイドに従う
実際のツール例
変換前4ページ構成のPDFソースの1ページ目。
  • 4 PDFページ
変換後実際のdocument.xmlエクスポートの整形された冒頭の抜粋。
  • document.xml · 4 ページレコード
  • 1 参照されたPNGアセット
結果は構造化されたXMLデータで、抜粋として表示されています。完全なエクスポートには、全4ページと参照された画像アセットが含まれます。
Advertisements
クイックビデオチュートリアル PDFをレイアウトデータ付きのXMLに変換する方法 独自のワークフロー用に構造化されたページデータを取得します。 英語ナレーション 動画を見る

PDFをレイアウトデータ付きのXMLに変換する方法

Advertisements

PDFからXMLへを開き、ページレコード、テキストブロック、描画データをエクスポートします。当社の4ページPDFは、document.xmlと、ZIP内の参照されたPNG画像1点を生成します。

01

PDFページを選択

PDFを読み込み、ページを空のままにするとドキュメント全体が対象となります。必要なサブセットを入力することも可能です。この例では全4ページを含めています。

02

エクスポートしてアセットをまとめて保持

開始を選択します。画像アセットを含むエクスポートはZIPとしてダウンロードされます。アーカイブ全体を解凍し、document.xmlの横にimagesディレクトリを保持してください。

サンプルにはimages/page-001-image-005.pngが含まれています。画像参照はXML内にバイナリデータを埋め込むのではなく、アセットパスを指し示します。画像アセットを含まないエクスポートは、直接.xmlとしてダウンロードできます。

03

ドキュメント構造を読み取る

サンプルではバージョン 1、単位 pt、および top-left 原点が宣言されています。ページレコードには、ソースページ番号、寸法、回転、ブロック、および図面が含まれます。座標は回転前のページを表しているため、データをオーバーレイする際は回転を考慮してください。

XMLパーサーを使用してXMLを解析してください。繰り返し値にはitem要素が使用され、一部の幾何学的タプルはテキスト値となっています。DocBookのようなパブリッシングスキーマを前提とするのではなく、実際の構造を調査してください。

処理ワークフローでデータを使用する前に、読み取り順序と画像参照が元のPDFと一致しているか確認してください。

役立つ詳細情報

よくある質問

XMLにはセマンティックな章が含まれていますか?

これは抽出されたページデータを記述するものです。見出しの意味、読み取り順序、およびドキュメントのセマンティクスについては、独自に解釈する必要がある場合があります。

なぜZIPファイルが届いたのですか?

サンプルには画像が含まれています。ZIPファイルはdocument.xmlと参照されているアセットをまとめて保持するため、画像を特定することができます。

次はあなたの番です

お手元のドキュメントでお試しください

結果を確認し、必要なバージョンを保存してください。

PDFからXMLへを開く

画像詳細

Advertisements

言語38

English العربية Français Italiano Deutsch Español Português Nederlands Русский Türkçe 日本語 中文 हिन्दी Bahasa Indonesia Bahasa Melayu 한국어 Tiếng Việt ไทย Polski Svenska Українська Norsk বাংলা Ελληνικά فارسی اردو Čeština Dansk Magyar Română Suomi Български Filipino ქართული Slovenčina Azərbaycanca עברית Slovenščina