Mga Tool150

ISANG PRAKTIKAL NA GABAY SA PDF

Paano i-convert ang PDF sa XML na may layout data

Kumuha ng structured page data para sa iyong sariling workflow.

I-export ang text ng PDF, mga dimensyon ng pahina, at drawing data bilang XML. Panatilihing magkasama ang mga referenced image at suriin ang istruktura bago ito gamitin sa code.

Sundin ang gabay
ISANG HALIMBAWA NG TUNAY NA TOOL
BagoUnang pahina ng apat na pahinang PDF source.
  • 4 mga pahina ng PDF
PagkataposPretty-printed na pambungad na sipi ng aktwal na document.xml export.
  • document.xml · 4 mga record ng pahina
  • 1 referenced PNG asset
Ang resulta ay structured XML data, na ipinapakita bilang isang sipi. Ang kumpletong export ay kinabibilangan ng lahat ng apat na pahina at ang referenced image asset.
Advertisements
MABILIS NA VIDEO TUTORIAL Paano i-convert ang PDF sa XML na may layout data Kumuha ng structured page data para sa iyong sariling workflow. Pagsasalaysay sa Ingles Panoorin ang video

Paano i-convert ang PDF sa XML na may layout data

Advertisements

Buksan ang PDF to XML para i-export ang mga record ng pahina, text block, at drawing data. Ang aming apat na pahinang PDF ay gumagawa ng document.xml at isang referenced PNG image sa loob ng ZIP.

01

Piliin ang mga pahina ng PDF

I-load ang PDF at iwanang blangko ang Pages para sa buong dokumento, o ilagay ang subset na kailangan mo. Ang aming halimbawa ay kinabibilangan ng lahat ng apat na pahina.

02

I-export at panatilihing magkasama ang mga asset

Piliin ang Start. Ang isang export na may mga image asset ay mada-download bilang ZIP. I-extract ang buong archive at panatilihin ang images directory sa tabi ng document.xml.

Ang sample ay kinabibilangan ng images/page-001-image-005.png. Ang mga reference ng imahe ay tumuturo sa mga asset path sa halip na i-embed ang binary data sa XML. Ang isang export na walang mga image asset ay maaaring direktang ma-download bilang .xml.

03

Basahin ang istruktura ng dokumento

Ang sample ay nagdedeklara ng bersyon 1, mga unit na pt, at top-left na pinagmulan. Ang mga record ng pahina ay kinabibilangan ng source page number, mga dimensyon, pag-ikot, mga block, at mga drawing. Ang mga coordinate ay naglalarawan ng pahinang hindi pa naiikot; isaalang-alang ang pag-ikot kapag ipinapatong ang data.

I-parse ang XML gamit ang isang XML parser. Ang mga paulit-ulit na value ay gumagamit ng mga item element; ang ilang geometric tuple ay mga text value. Suriin ang aktwal na istruktura sa halip na umasa sa isang publishing schema gaya ng DocBook.

Suriin ang pagkakasunod-sunod ng pagbabasa at mga reference ng imahe laban sa orihinal na PDF bago gamitin ang data sa iyong processing workflow.

ILANG KAPAKI-PAKINABANG NA DETALYE

Mga karaniwang tanong

Naglalaman ba ang XML ng mga semantic chapter?

Inilalarawan nito ang na-extract na page data. Ang kahulugan ng heading, pagkakasunod-sunod ng pagbabasa, at semantics ng dokumento ay maaaring mangailangan ng sarili mong interpretasyon.

Bakit ako nakatanggap ng ZIP?

Ang sample ay naglalaman ng isang imahe. Pinapanatili ng ZIP ang document.xml at ang referenced asset nang magkasama upang mahanap ang imahe.

IKAW NA ANG SUSUNOD

Subukan ito sa iyong dokumento

Suriin ang resulta, pagkatapos ay i-save ang bersyong kailangan mo.

Buksan ang PDF to XML

Detalye ng larawan

Advertisements

Wika38

English العربية Français Italiano Deutsch Español Português Nederlands Русский Türkçe 日本語 中文 हिन्दी Bahasa Indonesia Bahasa Melayu 한국어 Tiếng Việt ไทย Polski Svenska Українська Norsk বাংলা Ελληνικά فارسی اردو Čeština Dansk Magyar Română Suomi Български Filipino ქართული Slovenčina Azərbaycanca עברית Slovenščina