Narzędzia150

PRAKTYCZNY PRZEWODNIK PDF

Jak przekonwertować PDF na XML z danymi układu

Uzyskaj ustrukturyzowane dane strony dla własnego przepływu pracy.

Eksportuj tekst PDF, wymiary stron i dane rysunkowe do formatu XML. Przechowuj powiązane obrazy razem i sprawdź strukturę przed użyciem jej w kodzie.

Postępuj zgodnie z przewodnikiem
PRZYKŁAD PRAWDZIWEGO NARZĘDZIA
PrzedPierwsza strona czterostronicowego źródła PDF.
  • 4 stron PDF
PoSformatowany fragment otwierający właściwego eksportu document.xml.
  • document.xml · 4 rekordów stron
  • 1 powiązany zasób PNG
Wynikiem są ustrukturyzowane dane XML, pokazane jako fragment. Pełny eksport obejmuje wszystkie cztery strony oraz powiązany zasób obrazu.
Advertisements
SZYBKI SAMOUCZEK WIDEO Jak przekonwertować PDF na XML z danymi układu Uzyskaj ustrukturyzowane dane strony dla własnego przepływu pracy. Narracja w języku angielskim Obejrzyj wideo

Jak przekonwertować PDF na XML z danymi układu

Advertisements

Otwórz PDF na XML, aby wyeksportować rekordy stron, bloki tekstu i dane rysunkowe. Nasz czterostronicowy plik PDF generuje document.xml oraz jeden powiązany obraz PNG wewnątrz pliku ZIP.

01

Wybierz strony PDF

Załaduj plik PDF i pozostaw Strony puste dla całego dokumentu lub wprowadź potrzebny podzbiór. Nasz przykład obejmuje wszystkie cztery strony.

02

Eksportuj i przechowuj zasoby razem

Wybierz Start. Eksport z zasobami obrazów pobiera się jako ZIP. Rozpakuj całe archiwum i przechowuj katalog images obok document.xml.

Przykład zawiera images/page-001-image-005.png. Odwołania do obrazów wskazują ścieżki do zasobów zamiast osadzania danych binarnych w XML. Eksport bez zasobów obrazów można pobrać bezpośrednio jako .xml.

03

Odczytaj strukturę dokumentu

Przykład deklaruje wersję 1, jednostki pt oraz punkt początkowy lewy-górny. Rekordy stron zawierają numer strony źródłowej, wymiary, rotację, bloki i rysunki. Współrzędne opisują stronę bez rotacji; uwzględnij rotację podczas nakładania danych.

Przeanalizuj XML za pomocą parsera XML. Powtarzające się wartości używają elementów item; niektóre krotki geometryczne są wartościami tekstowymi. Sprawdź rzeczywistą strukturę zamiast zakładać schemat publikacji, taki jak DocBook.

Sprawdź kolejność czytania i odwołania do obrazów względem oryginalnego pliku PDF przed użyciem danych w swoim procesie przetwarzania.

KILKA PRZYDATNYCH SZCZEGÓŁÓW

Często zadawane pytania

Czy XML zawiera rozdziały semantyczne?

Opisuje wyodrębnione dane strony. Znaczenie nagłówków, kolejność czytania i semantyka dokumentu mogą wymagać własnej interpretacji.

Dlaczego otrzymałem plik ZIP?

Przykład zawiera obraz. ZIP przechowuje document.xml i powiązany zasób razem, aby można było zlokalizować obraz.

TWOJA KOLEJ

Wypróbuj ze swoim dokumentem

Przejrzyj wynik, a następnie zapisz wersję, której potrzebujesz.

Otwórz PDF na XML

Szczegóły obrazu

Advertisements

Język38

English العربية Français Italiano Deutsch Español Português Nederlands Русский Türkçe 日本語 中文 हिन्दी Bahasa Indonesia Bahasa Melayu 한국어 Tiếng Việt ไทย Polski Svenska Українська Norsk বাংলা Ελληνικά فارسی اردو Čeština Dansk Magyar Română Suomi Български Filipino ქართული Slovenčina Azərbaycanca עברית Slovenščina