Otwórz PDF to JSON, aby wyeksportować rekordy stron, bloki tekstu i dane rysunkowe. Nasz czterostronicowy plik PDF generuje document.json oraz jeden powiązany obraz PNG wewnątrz pliku ZIP.
Wybierz strony PDF
Załaduj plik PDF i pozostaw Pages puste dla całego dokumentu lub wprowadź potrzebny podzbiór. Nasz przykład zawiera wszystkie cztery strony.
Eksportuj i przechowuj zasoby razem
Wybierz Start. Eksport z zasobami obrazów pobiera się jako plik ZIP. Rozpakuj całe archiwum i przechowuj katalog images obok document.json.
Przykład zawiera images/page-001-image-005.png. Odwołania do obrazów wskazują ścieżki do zasobów zamiast osadzania danych binarnych w pliku JSON. Eksport bez zasobów obrazów można pobrać bezpośrednio jako .json.
Odczytaj strukturę dokumentu
Przykład deklaruje wersję 1, jednostki pt oraz punkt początkowy top-left. Rekordy stron zawierają numer strony źródłowej, wymiary, rotację, bloki i rysunki. Współrzędne opisują stronę bez rotacji; uwzględnij rotację podczas nakładania danych.
Przeanalizuj plik JSON za pomocą parsera JSON. Sprawdź bloki, linie i zakresy pod kątem tekstu i stylizacji, a wartości bbox pod kątem geometrii. Zagnieżdżone obiekty opisują układ, a nie pojedynczy ciąg tekstowy.
Sprawdź kolejność czytania i odwołania do obrazów w oryginalnym pliku PDF przed użyciem danych w swoim procesie przetwarzania.
Często zadawane pytania
Czy mogę dokładnie odtworzyć oryginalny plik PDF?
Nie zakładaj dokładnej rekonstrukcji dwukierunkowej. Eksport opisuje dostępne treści i geometrię, podczas gdy funkcje i semantyka PDF mogą być bardziej złożone.
Dlaczego otrzymałem plik ZIP?
Przykład zawiera obraz. ZIP przechowuje document.json i powiązany zasób razem, aby obraz mógł zostać zlokalizowany.
Wypróbuj ze swoim dokumentem
Przejrzyj wynik, a następnie zapisz wersję, której potrzebujesz.

