পৃষ্ঠার রেকর্ড, টেক্সট ব্লক এবং ড্রয়িং ডেটা এক্সপোর্ট করতে PDF to JSON খুলুন। আমাদের চার পৃষ্ঠার PDF থেকে document.json এবং ZIP-এর ভেতরে একটি রেফারেন্স করা PNG ছবি তৈরি হয়।
PDF পৃষ্ঠাগুলো নির্বাচন করুন
PDF লোড করুন এবং পুরো ডকুমেন্টের জন্য Pages খালি রাখুন, অথবা আপনার প্রয়োজনীয় সাবসেটটি লিখুন। আমাদের উদাহরণে চারটি পৃষ্ঠাই অন্তর্ভুক্ত রয়েছে।
এক্সপোর্ট করুন এবং অ্যাসেটগুলো একসাথে রাখুন
Start নির্বাচন করুন। ইমেজ অ্যাসেটসহ একটি এক্সপোর্ট ZIP হিসেবে ডাউনলোড হবে। পুরো আর্কাইভটি এক্সট্র্যাক্ট করুন এবং document.json-এর পাশে images ডিরেক্টরিটি রাখুন।
নমুনাটিতে images/page-001-image-005.png অন্তর্ভুক্ত রয়েছে। ইমেজ রেফারেন্সগুলো JSON-এ বাইনারি ডেটা এমবেড করার পরিবর্তে অ্যাসেট পাথ নির্দেশ করে। ইমেজ অ্যাসেট ছাড়া এক্সপোর্ট সরাসরি .json হিসেবে ডাউনলোড হতে পারে।
ডকুমেন্টের কাঠামো পড়ুন
নমুনাটিতে ভার্সন 1, ইউনিট pt এবং একটি top-left অরিজিন ঘোষণা করা হয়েছে। পৃষ্ঠার রেকর্ডে সোর্স পৃষ্ঠার নম্বর, মাত্রা, রোটেশন, ব্লক এবং ড্রয়িং অন্তর্ভুক্ত থাকে। স্থানাঙ্কগুলো অ-ঘূর্ণায়মান পৃষ্ঠাকে বর্ণনা করে; ডেটা ওভারলে করার সময় রোটেশনের বিষয়টি বিবেচনায় রাখুন।
একটি JSON পার্সার দিয়ে JSON পার্স করুন। টেক্সট এবং স্টাইলিংয়ের জন্য ব্লক, লাইন এবং স্প্যানগুলো এবং জ্যামিতির জন্য bbox মানগুলো যাচাই করুন। নেস্টেড অবজেক্টগুলো একটি একক টেক্সট স্ট্রিংয়ের পরিবর্তে লেআউট বর্ণনা করে।
আপনার প্রসেসিং ওয়ার্কফ্লোতে ডেটা ব্যবহার করার আগে মূল PDF-এর সাথে রিডিং অর্ডার এবং ইমেজ রেফারেন্সগুলো যাচাই করুন।
সাধারণ প্রশ্নাবলী
আমি কি মূল PDF হুবহু পুনর্গঠন করতে পারি?
সঠিক রাউন্ড-ট্রিপ পুনর্গঠনের আশা করবেন না। এক্সপোর্টটি উপলব্ধ বিষয়বস্তু এবং জ্যামিতি বর্ণনা করে, যেখানে PDF বৈশিষ্ট্য এবং সেমান্টিক আরও জটিল হতে পারে।
আমি কেন একটি ZIP ফাইল পেয়েছি?
নমুনাটিতে একটি ছবি রয়েছে। ZIP ফাইলটি document.json এবং রেফারেন্স করা অ্যাসেটকে একসাথে রাখে যাতে ছবিটি খুঁজে পাওয়া যায়।
আপনার ডকুমেন্ট দিয়ে চেষ্টা করুন
ফলাফলটি পর্যালোচনা করুন, তারপর আপনার প্রয়োজনীয় ভার্সনটি সেভ করুন।

