PDF به JSON را باز کنید تا رکوردهای صفحه، بلوکهای متنی و دادههای ترسیمی را خروجی بگیرید. فایل PDF چهار صفحهای ما، document.json به همراه یک تصویر PNG ارجاعشده در داخل یک فایل ZIP تولید میکند.
صفحات PDF را انتخاب کنید
فایل PDF را بارگذاری کنید و Pages را برای کل سند خالی بگذارید، یا زیرمجموعه مورد نیاز خود را وارد کنید. مثال ما شامل هر چهار صفحه است.
خروجی بگیرید و داراییها را کنار هم نگه دارید
Start را انتخاب کنید. خروجی با داراییهای تصویری به صورت ZIP دانلود میشود. کل آرشیو را استخراج کنید و دایرکتوری images را در کنار document.json نگه دارید.
نمونه شامل images/page-001-image-005.png است. ارجاعات تصویر به جای جاسازی دادههای باینری در JSON، به مسیرهای دارایی اشاره میکنند. خروجی بدون داراییهای تصویری میتواند مستقیماً به صورت .json دانلود شود.
ساختار سند را بخوانید
نمونه نسخه 1، واحد pt و مبدأ top-left را اعلام میکند. رکوردهای صفحه شامل شماره صفحه منبع، ابعاد، چرخش، بلوکها و ترسیمات هستند. مختصات، صفحه بدون چرخش را توصیف میکنند؛ هنگام همپوشانی دادهها، چرخش را در نظر بگیرید.
JSON را با یک تجزیهکننده JSON تحلیل کنید. بلوکها، خطوط و بازهها را برای متن و استایل، و مقادیر bbox را برای هندسه بررسی کنید. اشیاء تو در تو به جای یک رشته متنی واحد، طرحبندی را توصیف میکنند.
قبل از استفاده از دادهها در گردش کار پردازش خود، ترتیب خواندن و ارجاعات تصویر را با PDF اصلی مطابقت دهید.
سوالات متداول
آیا میتوانم PDF اصلی را دقیقاً بازسازی کنم؟
فرض نکنید که بازسازی دقیق رفت و برگشتی امکانپذیر است. خروجی محتوا و هندسه موجود را توصیف میکند، در حالی که ویژگیها و معناشناسی PDF میتوانند پیچیدهتر باشند.
چرا یک فایل ZIP دریافت کردم؟
نمونه حاوی یک تصویر است. فایل ZIP فایل document.json و دارایی ارجاعشده را کنار هم نگه میدارد تا تصویر قابل مکانیابی باشد.
آن را با سند خود امتحان کنید
نتیجه را مرور کنید، سپس نسخه مورد نیاز خود را ذخیره کنید.

