Otwórz PDF na XML, aby wyeksportować rekordy stron, bloki tekstu i dane rysunkowe. Nasz czterostronicowy plik PDF generuje document.xml oraz jeden powiązany obraz PNG wewnątrz pliku ZIP.
Wybierz strony PDF
Załaduj plik PDF i pozostaw Strony puste dla całego dokumentu lub wprowadź potrzebny podzbiór. Nasz przykład obejmuje wszystkie cztery strony.
Eksportuj i przechowuj zasoby razem
Wybierz Start. Eksport z zasobami obrazów pobiera się jako ZIP. Rozpakuj całe archiwum i przechowuj katalog images obok document.xml.
Przykład zawiera images/page-001-image-005.png. Odwołania do obrazów wskazują ścieżki do zasobów zamiast osadzania danych binarnych w XML. Eksport bez zasobów obrazów można pobrać bezpośrednio jako .xml.
Odczytaj strukturę dokumentu
Przykład deklaruje wersję 1, jednostki pt oraz punkt początkowy lewy-górny. Rekordy stron zawierają numer strony źródłowej, wymiary, rotację, bloki i rysunki. Współrzędne opisują stronę bez rotacji; uwzględnij rotację podczas nakładania danych.
Przeanalizuj XML za pomocą parsera XML. Powtarzające się wartości używają elementów item; niektóre krotki geometryczne są wartościami tekstowymi. Sprawdź rzeczywistą strukturę zamiast zakładać schemat publikacji, taki jak DocBook.
Sprawdź kolejność czytania i odwołania do obrazów względem oryginalnego pliku PDF przed użyciem danych w swoim procesie przetwarzania.
Często zadawane pytania
Czy XML zawiera rozdziały semantyczne?
Opisuje wyodrębnione dane strony. Znaczenie nagłówków, kolejność czytania i semantyka dokumentu mogą wymagać własnej interpretacji.
Dlaczego otrzymałem plik ZIP?
Przykład zawiera obraz. ZIP przechowuje document.xml i powiązany zasób razem, aby można było zlokalizować obraz.
Wypróbuj ze swoim dokumentem
Przejrzyj wynik, a następnie zapisz wersję, której potrzebujesz.

