Extract Links from PDF ওপেন করুন যাতে একটি PDF থেকে লাইন বাই লাইন কপি না করেই মানগুলো সংগ্রহ করা যায়। এই তুলনাটি আসল স্যাম্পল ডকুমেন্ট এবং টুল থেকে ডাউনলোড করা একটি CSV ব্যবহার করে। তিন পৃষ্ঠার এই স্যাম্পলটি ৫টি অকারেন্স থেকে ৪টি ইউনিক ওয়েব অ্যাড্রেস তৈরি করে।
আপনার PDF ওপেন করুন
একটি PDF আপলোড করুন, অথবা এই উদাহরণটি অনুসরণ করতে Try sample সিলেক্ট করুন। PDF প্রিভিউ এবং পেজ থাম্বনেইল দেখা যাবে। আপনার অরিজিনাল ফাইলটি অপরিবর্তিত থাকবে এবং এক্সট্র্যাকশন আপনার ব্রাউজারে চলবে।
একটি টেক্সট-ভিত্তিক ডিরেক্টরি, রিপোর্ট, রিসার্চ পেপার বা ব্রোশিওর হলো একটি দরকারি শুরুর পয়েন্ট। শুধুমাত্র ইমেজ স্ক্যান করা ফাইলের ক্ষেত্রে প্রিন্ট করা টেক্সট চেনার জন্য আগে OCR প্রয়োজন।
দরকারি অপশনগুলো বেছে নিন
ফোনে, Settings ওপেন করুন। ডেস্কটপে, প্রিভিউয়ের পাশে সেটিংস প্যানেল ব্যবহার করুন।
রিপিটেড টার্গেটগুলো গ্রুপ করতে Remove duplicates এনাবল রাখুন। যখন আপনার পেজ রেফারেন্স প্রয়োজন তখন CSV বেছে নিন, অথবা সাধারণ URL তালিকার জন্য TXT বেছে নিন। উদাহরণটিতে ডিফল্ট CSV ফরম্যাট এবং সোর্স অর্ডার ব্যবহার করা হয়েছে।
ম্যাচগুলো এক্সট্র্যাক্ট এবং চেক করুন
সিলেক্ট করুন Extract। প্রসেসিং শেষ হলে, Results ট্যাবে মান, অকারেন্সের সংখ্যা এবং সোর্স পৃষ্ঠাগুলো দেখা যাবে। PDF প্রিভিউতে এর অবস্থান পরীক্ষা করতে একটি বৃত্তাকার পৃষ্ঠা নম্বর সিলেক্ট করুন, তারপর Results-এ ফিরে আসুন।
স্যাম্পলটিতে https://example.org/events দুইবার এবং আরও তিনটি ওয়েব অ্যাড্রেস রয়েছে। এটি একটি ক্লিকযোগ্য লিঙ্কও প্রদর্শন করে যার দৃশ্যমান লেবেল তার টার্গেট থেকে আলাদা। একই পৃষ্ঠায় একটি প্রিন্ট করা URL এবং তার অভিন্ন ক্লিকযোগ্য টার্গেট দুইবার গণনা করা হয় না।
তালিকাটি ছোট করতে Filter results ব্যবহার করুন। কপি এবং ডাউনলোড করার সময় সব ম্যাচিং রো অন্তর্ভুক্ত থাকে, এমনকি যখন রেজাল্ট টেবিলটি বেশ কয়েকটি স্ক্রিন জুড়ে থাকে।
CSV বা TXT ডাউনলোড করুন
সিলেক্ট করুন Download CSV, তারপর রেডি স্ক্রিনে মূল Download বাটনটি ব্যবহার করুন। CSV-তে Type, Value, Count এবং Pages কলাম থাকে। TXT এবং Copy all-এ প্রতি লাইনে একটি করে মান থাকে।
যেসব CSV মান স্প্রেডশিট ফর্মুলা হিসেবে গণ্য হতে পারে, সেগুলোকে একটি অ্যাপোস্ট্রফি দিয়ে সুরক্ষিত করা হয়েছে। উদাহরণস্বরূপ, একটি আন্তর্জাতিক ফোন নম্বর প্লাস চিহ্ন দিয়ে শুরু হয়। স্প্রেডশিট সুরক্ষা ছাড়া সাধারণ তালিকার প্রয়োজন হলে TXT ব্যবহার করুন।
সাধারণ প্রশ্নাবলী
এটি কি “Read more”-এর মতো শব্দের পেছনে থাকা লিঙ্ক খুঁজে পেতে পারে?
হ্যাঁ, যখন সেই শব্দগুলোর PDF-এ একটি সমর্থিত HTTP বা HTTPS লিঙ্ক অ্যানোটেশন থাকে। এক্সপোর্ট করা মানটি হলো তার ওয়েব গন্তব্য। শুধুমাত্র একটি ভিজ্যুয়াল আন্ডারলাইন ক্লিকযোগ্য লিঙ্ক থাকার প্রমাণ দেয় না।
স্ক্যান করা PDF-এর ক্ষেত্রে আমার কী করা উচিত?
প্রথমে PDF OCR চালান, তারপর স্বীকৃত কপিটি এই টুলে লোড করুন। OCR আউটপুট সাবধানে চেক করুন: একটি ভুল অক্ষর একটি অ্যাড্রেস বা আইডেন্টিফায়ার বদলে দিতে পারে।
এক্সট্র্যাকশন লিমিটগুলো কী কী?
৫০ MiB এবং 750 পৃষ্ঠা পর্যন্ত একটি PDF ব্যবহার করুন। এক্সট্র্যাকশন সামগ্রিকভাবে ২০,০০০ ম্যাচ এবং প্রতি পৃষ্ঠায় ২,০০০ ম্যাচের মধ্যে সীমাবদ্ধ, যার প্রসেসিং বাজেট ৯০ সেকেন্ড। টেক্সট এবং অ্যানোটেশন লিমিটও প্রযোজ্য। যদি কোনো লিমিট বা অস্পষ্ট পৃষ্ঠা স্ক্যান বাধাগ্রস্ত করে, তবে টুলটি একটি আংশিক-ফলাফল নোটিশ দেখায় এবং এক্সপোর্ট ফাইলনামটিকে আংশিক হিসেবে চিহ্নিত করে।
আমার PDF লিঙ্কগুলো কি স্বয়ংক্রিয়ভাবে ওপেন হয়?
না। এক্সট্র্যাকশন ব্রাউজারে ফাইলটি পড়ে এবং এক্সট্র্যাক্ট করা গন্তব্যগুলো ভিজিট করে না। পেজ বাটনগুলো PDF প্রিভিউয়ের ভেতরে নেভিগেট করে।
মানগুলো এবং সেগুলোর কনটেক্সট রাখুন
একটি ফোকাসড তালিকা এক্সট্র্যাক্ট করুন, সোর্স পৃষ্ঠাগুলো চেক করুন এবং আপনার পরবর্তী ধাপের জন্য উপযুক্ত ফরম্যাটটি ডাউনলোড করুন।

