გახსენით PDF-დან XML-ში გვერდის ჩანაწერების, ტექსტური ბლოკებისა და ნახაზის მონაცემების ექსპორტისთვის. ჩვენი ოთხგვერდიანი PDF წარმოქმნის document.xml-ს და ერთ მითითებულ PNG სურათს ZIP არქივში.
აირჩიეთ PDF გვერდები
ჩატვირთეთ PDF და დატოვეთ გვერდები ცარიელი მთელი დოკუმენტისთვის, ან შეიყვანეთ საჭირო დიაპაზონი. ჩვენი მაგალითი მოიცავს ოთხივე გვერდს.
ექსპორტი და აქტივების ერთად შენახვა
აირჩიეთ დაწყება. ექსპორტი სურათების აქტივებით ჩამოიტვირთება როგორც ZIP. ამოაარქივეთ მთელი არქივი და შეინახეთ images დირექტორია document.xml-ის გვერდით.
ნიმუში მოიცავს images/page-001-image-005.png-ს. სურათების მითითებები მიუთითებს აქტივების გზებზე და არა ბინარული მონაცემების ჩასმაზე XML-ში. ექსპორტი სურათების გარეშე შეიძლება ჩამოიტვირთოს პირდაპირ როგორც .xml.
დოკუმენტის სტრუქტურის წაკითხვა
ნიმუში აცხადებს ვერსიას 1, ერთეულებს pt და ზედა-მარცხენა საწყის წერტილს. გვერდის ჩანაწერები მოიცავს წყაროს გვერდის ნომერს, ზომებს, ბრუნვას, ბლოკებს და ნახაზებს. კოორდინატები აღწერს არაბრუნვად გვერდს; გაითვალისწინეთ ბრუნვა მონაცემების გადაფარვისას.
დაამუშავეთ XML შესაბამისი პარსერით. განმეორებადი მნიშვნელობები იყენებს item ელემენტებს; ზოგიერთი გეომეტრიული ტუპლი ტექსტური მნიშვნელობებია. შეამოწმეთ რეალური სტრუქტურა და არა ისეთი საგამომცემლო სქემა, როგორიცაა DocBook.
მონაცემების თქვენს სამუშაო პროცესში გამოყენებამდე შეამოწმეთ კითხვის თანმიმდევრობა და სურათების მითითებები ორიგინალ PDF-თან.
ხშირად დასმული კითხვები
შეიცავს თუ არა XML სემანტიკურ თავებს?
ის აღწერს ამოღებულ გვერდის მონაცემებს. სათაურის მნიშვნელობა, კითხვის თანმიმდევრობა და დოკუმენტის სემანტიკა შესაძლოა საჭიროებდეს თქვენს ინტერპრეტაციას.
რატომ მივიღე ZIP ფაილი?
ნიმუში შეიცავს სურათს. ZIP ინახავს document.xml-ს და მითითებულ აქტივს ერთად, რათა სურათი იყოს ხელმისაწვდომი.
სცადეთ თქვენი დოკუმენტით
გადახედეთ შედეგს და შემდეგ შეინახეთ საჭირო ვერსია.

