সোর্স লিঙ্ক সংগ্রহ করুন
রিপোর্ট এবং গবেষণাপত্র থেকে একটি রেফারেন্স তালিকা তৈরি করুন।
আপনার পিডিএফ থেকে প্রয়োজনীয় লিঙ্কগুলো বের করে আনুন।
| ধরন | মান | সংখ্যা | পৃষ্ঠা |
|---|
কপি এবং ডাউনলোডে সব রেজাল্ট পেজের ম্যাচিং সারি অন্তর্ভুক্ত থাকে। CSV-তে সংখ্যা ও PDF পৃষ্ঠার নম্বর থাকে; TXT-তে শুধুমাত্র মান থাকে।
এর উৎস চেক করতে ফলাফলে একটি পৃষ্ঠার নম্বর নির্বাচন করুন। হাইলাইটগুলো আনুমানিক অবস্থান নির্দেশ করে।
আপনার তালিকা প্রস্তুত। এটি ডাউনলোড করুন, অথবা ফরম্যাট পরিবর্তন করতে পেছনে ফিরে যান।
সিলেক্টযোগ্য টেক্সট আছে এমন একটি ডকুমেন্ট লোড করুন, অথবা স্যাম্পলটি ব্যবহার করে দেখুন।
এক্সট্র্যাক্ট নির্বাচন করুন। মান, সংখ্যা এবং সোর্স পৃষ্ঠাগুলো রিভিউ করুন; তালিকা ফিল্টার বা সাজান।
মানগুলো কপি করুন, অথবা পৃষ্ঠার রেফারেন্সসহ CSV বা সাধারণ TXT তালিকা ডাউনলোড করুন।
একটি পিডিএফ থেকে প্রিন্ট করা HTTP/HTTPS ঠিকানা, www ঠিকানা এবং ক্লিকযোগ্য ওয়েব-লিঙ্ক টার্গেট সংগ্রহ করুন। পৃষ্ঠার রেফারেন্সগুলো রাখুন এবং একটি ডুপ্লিকেটহীন তালিকা CSV বা TXT হিসেবে ডাউনলোড করুন।
রিপোর্ট এবং গবেষণাপত্র থেকে একটি রেফারেন্স তালিকা তৈরি করুন।
ক্লিকযোগ্য রিসোর্স লেবেলের পেছনের গন্তব্যগুলো বের করুন।
অন্য কোথাও পর্যালোচনা করার আগে প্রতিটি লিঙ্ক কোথায় পাওয়া গেছে তা রেকর্ড করুন।
লিঙ্কের লেবেলে শুধু “Read more” লেখা থাকলেও লিঙ্ক টার্গেট অন্তর্ভুক্ত করুন।
http://, https:// বা www. দিয়ে শুরু হওয়া মুদ্রিত লিঙ্কগুলো শনাক্ত করা হয়। পিডিএফ লিঙ্ক অ্যানোটেশনগুলো সাধারণ টেক্সটের পেছনের HTTP/HTTPS টার্গেটগুলোও প্রকাশ করতে পারে। পিডিএফ-এ ইউআরএল-টিকে ক্লিকযোগ্য লেবেল হিসেবে প্রদর্শিত হতে হবে এমন কোনো বাধ্যবাধকতা নেই।
একই পৃষ্ঠায় থাকা অভিন্ন মুদ্রিত টার্গেট এবং অ্যানোটেশনগুলোকে দুবার গণনা করা হয় না। ডুপ্লিকেট তুলনার জন্য নরমালাইজড ইউআরএল ফরম্যাট ব্যবহার করা হয়, তবে প্রথম শনাক্তকৃত বানানটি প্রদর্শিত হয়। দীর্ঘ, র্যাপড বা ক্ষতিগ্রস্ত ইউআরএলগুলো ম্যানুয়ালি সংশোধন করার প্রয়োজন হতে পারে। কোনো এক্সট্রাক্ট করা ইউআরএল স্বয়ংক্রিয়ভাবে ভিজিট করা হয় না।
গণনা যাচাই করুন, পিডিএফ-এর নির্দিষ্ট পৃষ্ঠায় যান এবং ফলাফলের তালিকা ফিল্টার করুন।
প্রতিটি ফলাফলে পিডিএফ-এর ফিজিক্যাল পেজ পজিশন রেকর্ড করা থাকে, যা মুদ্রিত পৃষ্ঠার নম্বর থেকে ভিন্ন হতে পারে। প্রিভিউ খুলতে এবং আনুমানিক হাইলাইট দেখতে একটি পেজ চিপ নির্বাচন করুন।
ডুপ্লিকেট অপসারণ অপশনটি চালু থাকে। একই মানের পুনরাবৃত্তিগুলো গণনা করা হয়; আলাদাভাবে দেখতে এটি বন্ধ করুন। বর্ণানুক্রমিকভাবে সাজালে তালিকার ক্রম পরিবর্তিত হয়। ফিল্টারিং কপি এবং ডাউনলোডসহ দৃশ্যমান সারিগুলোর ওপরও কার্যকর হয়।
গণনা এবং পৃষ্ঠার জন্য CSV, অথবা প্রতি লাইনে একটি মানের জন্য TXT বেছে নিন।
CSV-তে Type, Value, Count এবং Pages কলাম থাকে। UTF-8 এনকোডিং আরবি এবং অন্যান্য স্ক্রিপ্ট সমর্থন করে। স্প্রেডশিট ফর্মুলা হিসেবে গণ্য হতে পারে এমন মানগুলোর আগে একটি অ্যাপোস্ট্রফি যোগ করা হয় যাতে ইমপোর্ট করা নিরাপদ হয়।
TXT এবং Copy-তে শুধুমাত্র মান থাকে, প্রতি লাইনে একটি। ফিল্টারের সাথে মিলে যাওয়া সব সারি অন্তর্ভুক্ত থাকে, এমনকি অন-স্ক্রিন টেবিলটি একাধিক পৃষ্ঠায় বিস্তৃত থাকলেও। নতুন কোনো পিডিএফ তৈরি হয় না এবং মূল পিডিএফ অপরিবর্তিত থাকে।
আপনার ব্রাউজারে একটি পিডিএফ প্রসেস করুন, নির্দিষ্ট সীমা এবং আংশিক ফলাফলের নোটিশসহ।
৫০ MiB এবং ৫০০ পৃষ্ঠা পর্যন্ত একটি পিডিএফ লোড করুন। এক্সট্রাকশন প্রতি পৃষ্ঠায় ২৫০,০০০ ক্যারেক্টার এবং ২,০০০ ম্যাচ, সামগ্রিকভাবে ১০ মিলিয়ন ক্যারেক্টার এবং ২০,০০০ ম্যাচ, এবং প্রতি পৃষ্ঠায় ২,০০০ অ্যানোটেশন পর্যন্ত যাচাই করে। ৯০ সেকেন্ডের এক্সট্রাকশন বাজেট দীর্ঘ রানগুলোকে সীমাবদ্ধ করে। খুব জটিল ডকুমেন্টগুলো ছোট ফাইলে ভাগ করলে ভালো কাজ করতে পারে।
সীমা অতিক্রম করলে বা কোনো পৃষ্ঠা পুরোপুরি পড়া না গেলে, ফলাফলে একটি নোটিশ দেখানো হয় এবং সীমিত বা ব্যর্থ রানগুলো ফাইলনামে partial যুক্ত করে এক্সপোর্ট হয়। যে পৃষ্ঠাগুলোতে টেক্সট সিলেক্ট করা যায় না সেগুলো আলাদাভাবে গণনা করা হয়। শুধুমাত্র ছবির স্ক্যানের জন্য PDF OCR ব্যবহার করুন, তারপর শনাক্তকৃত টেক্সট এক্সট্রাক্ট করতে ফিরে আসুন।
পিডিএফ কন্টেন্ট এই ব্রাউজারে স্থানীয়ভাবে প্রসেস করা হয়। আপলোড করা ডকুমেন্ট কোনো এক্সট্রাকশন সার্ভারে পাঠানো হয় না। পিডিএফ-এর ভেতরে পাওয়া লিঙ্ক, ইমেইল অ্যাড্রেস এবং ফোন নম্বরের সাথে কখনোই স্বয়ংক্রিয়ভাবে যোগাযোগ করা হয় না।
50 MB এবং 750 পৃষ্ঠা পর্যন্ত একটি PDF খুলুন। জটিল নথির ক্ষেত্রে অতিরিক্ত আউটপুট, মেমরি এবং প্রসেসিং সীমা প্রযোজ্য হতে পারে।
ডকুমেন্ট আপলোড না করেই আপনার ডিভাইসে প্রসেসিং সম্পন্ন হয়। পৃষ্ঠা বন্ধ করার আগে আপনার ফলাফল ডাউনলোড করুন; মূল ফাইলটি আলাদাভাবে সংরক্ষণ করুন।
শুরু করার আগে জেনে নিন কী আশা করা যায়।
আপনার ডিভাইসেএকটি পিডিএফ থেকে প্রিন্ট করা HTTP/HTTPS ঠিকানা, www ঠিকানা এবং ক্লিকযোগ্য ওয়েব-লিঙ্ক টার্গেট সংগ্রহ করুন। পৃষ্ঠার রেফারেন্সগুলো রাখুন এবং একটি ডুপ্লিকেটমুক্ত তালিকা CSV বা TXT হিসেবে ডাউনলোড করুন। টুলটি লিঙ্কগুলো বর্তমানে কাজ করছে কি না তা যাচাই করে না। অভ্যন্তরীণ পৃষ্ঠার গন্তব্য, জাভাস্ক্রিপ্ট অ্যাকশন, mailto এবং অন্যান্য নন-ওয়েব স্কিমগুলো ওয়েব লিঙ্ক হিসেবে এক্সপোর্ট করা হয় না।
শুধুমাত্র সিলেক্টযোগ্য টেক্সট এবং শনাক্তকৃত লিঙ্ক টার্গেট পড়া হয়। শুধুমাত্র ইমেজযুক্ত পৃষ্ঠার জন্য প্রথমে PDF OCR প্রয়োজন। OCR চালান, সার্চযোগ্য পিডিএফ ডাউনলোড করুন, তারপর এই এক্সট্র্যাক্টরে ফিরে আসুন।
ডুপ্লিকেট অপসারণ করলে শনাক্তকৃত সমতুল্য মানগুলো একত্রিত হয়। কাউন্ট বা সংখ্যায় শনাক্তকৃত ঘটনার সংখ্যা এবং পেজ বা পৃষ্ঠায় পিডিএফ-এর ভৌত অবস্থান দেখানো হয়। ঘটনাগুলো আলাদা রাখতে এই অপশনটি নিষ্ক্রিয় করুন। একই পৃষ্ঠায় থাকা প্রিন্ট করা টার্গেট এবং সংশ্লিষ্ট ক্লিকযোগ্য লিঙ্ককে ডাবল-কাউন্ট করা হয় না।
CSV-তে টাইপ, মান, ঘটনার সংখ্যা এবং পৃষ্ঠার রেফারেন্স অন্তর্ভুক্ত থাকে। TXT এবং কপি অল শুধুমাত্র মান প্রদান করে, প্রতি লাইনে একটি করে। বর্তমান ফিল্টারের সাথে মিলে যাওয়া সমস্ত সারি অন্তর্ভুক্ত করা হয়, শুধুমাত্র দৃশ্যমান টেবিল পৃষ্ঠা নয়।
না। পিডিএফ পার্সিং, ম্যাচিং এবং এক্সপোর্ট এই ব্রাউজারেই চলে। মূল পিডিএফ অপরিবর্তিত থাকে। কোনো এক্সট্রাক্ট করা লিঙ্ক, ইমেইল বা ফোন নম্বরের সাথে স্বয়ংক্রিয়ভাবে যোগাযোগ করা হয় না।
একটি পিডিএফ সর্বোচ্চ ৫০ MiB এবং ৫০০ পৃষ্ঠা পর্যন্ত হতে পারে। এক্সট্র্যাকশন প্রতি পৃষ্ঠায় ২৫০,০০০ টেক্সট ক্যারেক্টার এবং ২,০০০ ম্যাচ, সামগ্রিকভাবে ১০ মিলিয়ন ক্যারেক্টার এবং ২০,০০০ ম্যাচ এবং প্রতি পৃষ্ঠায় ২,০০০ অ্যানোটেশনের মধ্যে সীমাবদ্ধ। সীমা অতিক্রম করলে বা পৃষ্ঠা অস্পষ্ট হলে ফলাফলে একটি নোটিশ দেওয়া হয়।
দ্রুত ভিডিও টিউটোরিয়াল
PDF থেকে লিঙ্ক এবং URL বের করার উপায়
একটি একটি করে ওপেন না করেই দরকারি ওয়েব লিঙ্কগুলো রাখুন।
ইংরেজি বর্ণনা
ভিডিওটি দেখুন