ინსტრუმენტები150

პრაქტიკული PDF გზამკვლევი

როგორ ამოვიღოთ სტრუქტურირებულიმონაცემები PDF-დან

შეაგროვეთ კონტაქტები და კვლევის იდენტიფიკატორები ერთ ორგანიზებულ სიაში.

არჩეული ელფოსტების, ტელეფონების, URL-ების, DOI, ISBN და IPv4-ით, სამგვერდიანი ნიმუში წარმოქმნის 11 უნიკალურ მწკრივს 15 შემთხვევისგან.

მიჰყევით სახელმძღვანელოს
რეალური ხელსაწყოს მაგალითი
PDF გვერდიგვერდი რეალური საცდელი PDF-დან
ამოღებული მნიშვნელობებიმნიშვნელობები და გვერდის მითითებები რეალური CSV ჩამოტვირთვიდან
ექვსი არჩეული მონაცემთა ტიპი წარმოქმნის 11 უნიკალურ სტრიქონს რეალურ CSV-ში, მათ შორის DOI, ISBN და IPv4 ჩანაწერებს 2 გვერდზე.
Advertisements
სწრაფი ვიდეო გაკვეთილი როგორ ამოვიღოთ სტრუქტურირებული მონაცემები PDF-დან შეაგროვეთ კონტაქტები და კვლევის იდენტიფიკატორები ერთ ორგანიზებულ სიაში. ინგლისური თხრობა ვიდეოს ყურება

როგორ ამოვიღოთ სტრუქტურირებული მონაცემები PDF-დან

Advertisements

გახსენით მონაცემების ამოღება PDF-დან, რათა შეაგროვოთ მნიშვნელობები ერთი PDF-დან, თითოეული ხაზის ხელით კოპირების გარეშე. შედარება იყენებს რეალურ საცდელ დოკუმენტს და ხელსაწყოდან ჩამოტვირთულ CSV-ს. არჩეული ელფოსტების, ტელეფონების, URL-ების, DOI-ს, ISBN-ისა და IPv4-ის შემთხვევაში, სამგვერდიანი ნიმუში წარმოქმნის 11 უნიკალურ სტრიქონს 15 შემთხვევისგან.

01

გახსენით თქვენი PDF

ატვირთეთ ერთი PDF, ან აირჩიეთ ნიმუშის მოსინჯვა ამ მაგალითის გასაყოლად. გამოჩნდება PDF-ის გადახედვა და გვერდების მინიატურები. თქვენი ორიგინალი ფაილი უცვლელი რჩება, ხოლო ამოღება ხორციელდება თქვენს ბრაუზერში.

ტექსტზე დაფუძნებული დირექტორია, ანგარიში, კვლევითი ნაშრომი ან ბროშურა სასარგებლო საწყისი წერტილია. მხოლოდ სურათებისგან შემდგარ სკანირებულ ფაილებს სჭირდებათ OCR, რათა მათი დაბეჭდილი ტექსტი ამოცნობადი გახდეს.

02

აირჩიეთ სასარგებლო პარამეტრები

ტელეფონზე გახსენით პარამეტრები. დესკტოპზე გამოიყენეთ პარამეტრების პანელი გადახედვის გვერდით.

რა უნდა ამოვიღოთ-ის ქვეშ, ელფოსტები, ტელეფონის ნომრები და URL-ები უკვე არჩეულია. გახსენით მონაცემთა მეტი ტიპი და ასევე აირჩიეთ DOI, ISBN და IPv4 მისამართები. დატოვეთ დუბლიკატების წაშლა ჩართული და აირჩიეთ CSV.

03

ამოიღეთ და შეამოწმეთ დამთხვევები

აირჩიეთ ამოღება. დამუშავების დასრულების შემდეგ, შედეგების ჩანართი აჩვენებს მნიშვნელობებს, შემთხვევების რაოდენობას და წყაროს გვერდებს. აირჩიეთ წრიული გვერდის ნომერი, რათა შეამოწმოთ მისი მდებარეობა PDF-ის გადახედვაში, შემდეგ დაბრუნდით შედეგებთან.

გამომავალი მონაცემები აერთიანებს საკონტაქტო სიას DOI 10.1000/182-თან, ISBN 978-0-306-40615-7-თან და IPv4 მისამართ 192.0.2.10-თან 2 გვერდიდან. „ტიპის“ სვეტი აიდენტიფიცირებს თითოეულ მნიშვნელობას. გაფილტრეთ შესაბამისი სიტყვით ან იდენტიფიკატორით, სანამ დააკოპირებთ ან ჩამოტვირთავთ უფრო მცირე ქვეჯგუფს.

გამოიყენეთ შედეგების გაფილტვრა სიის შესამცირებლად. კოპირება და ჩამოტვირთვა მოიცავს ყველა შესაბამის სტრიქონს, მაშინაც კი, თუ შედეგების ცხრილი რამდენიმე ეკრანზეა გადაჭიმული.

04

ჩამოტვირთეთ CSV ან TXT

აირჩიეთ ჩამოტვირთეთ CSV, შემდეგ გამოიყენეთ მთავარი ჩამოტვირთვა ღილაკი მზა ეკრანზე. CSV შეიცავს ტიპის, მნიშვნელობის, რაოდენობის და გვერდების სვეტებს. TXT და ყველას კოპირება შეიცავს თითო მნიშვნელობას თითო ხაზზე.

CSV მნიშვნელობები, რომლებიც შეიძლება ინტერპრეტირებული იყოს როგორც ცხრილის ფორმულები, დაცულია წამყვანი აპოსტროფით. მაგალითად, საერთაშორისო ტელეფონის ნომერი იწყება პლუსის ნიშნით. გამოიყენეთ TXT, თუ გჭირდებათ მარტივი სია ცხრილის დაცვის გარეშე.

რამდენიმე სასარგებლო დეტალი

ხშირად დასმული კითხვები

ამოიღებს თუ არა ეს ნებისმიერ რიცხვს ან ყველა იდენტიფიკატორს?

არა. თითოეულ არჩეულ კატეგორიას აქვს საკუთარი ამოცნობის წესები. IPv6, პროცენტები, ფასები და გადახდის ბარათის ნომრები არ ამოიღება. შეამოწმეთ დამთხვევები წყაროსთან; სწორი ფორმატირება არ ადასტურებს, რომ კონტაქტი ან იდენტიფიკატორი არსებობს.

რა უნდა გავაკეთო სკანირებულ PDF-თან?

ჯერ გაუშვით PDF OCR, შემდეგ ჩატვირთეთ ამოცნობილი ასლი ამ ხელსაწყოში. ყურადღებით შეამოწმეთ OCR-ის შედეგი: შეცდომით დაწერილმა სიმბოლომ შეიძლება შეცვალოს მისამართი ან იდენტიფიკატორი.

რა არის ამოღების ლიმიტები?

გამოიყენეთ ერთი PDF 50 MiB-მდე და 750 გვერდით. ამოღება შეზღუდულია 20,000 დამთხვევით საერთო ჯამში და 2,000-ით თითო გვერდზე, 90-წამიანი დამუშავების ბიუჯეტით. ასევე მოქმედებს ტექსტისა და ანოტაციის ლიმიტები. თუ ლიმიტი ან წაუკითხავი გვერდი შეაწყვეტინებს სკანირებას, ხელსაწყო აჩვენებს შეტყობინებას ნაწილობრივი შედეგების შესახებ და ექსპორტის ფაილის სახელს მონიშნავს როგორც ნაწილობრივს.

ავტომატურად იხსნება ჩემი PDF ბმულები?

არა. ამოღება კითხულობს ფაილს ბრაუზერში და არ სტუმრობს ამოღებულ დანიშნულების ადგილებს. გვერდის ღილაკები ახდენენ ნავიგაციას PDF-ის გადახედვის ფარგლებში.

თქვენი ჯერია

შეინახეთ მნიშვნელობები და მათი კონტექსტი

ამოიღეთ ფოკუსირებული სია, შეამოწმეთ წყაროს გვერდები და ჩამოტვირთეთ ფორმატი, რომელიც შეესაბამება თქვენს შემდეგ ნაბიჯს.

გახსენით მონაცემების ამოღება PDF-დან

სურათის დეტალები

Advertisements

Ენა38

English العربية Français Italiano Deutsch Español Português Nederlands Русский Türkçe 日本語 中文 हिन्दी Bahasa Indonesia Bahasa Melayu 한국어 Tiếng Việt ไทย Polski Svenska Українська Norsk বাংলা Ελληνικά فارسی اردو Čeština Dansk Magyar Română Suomi Български Filipino ქართული Slovenčina Azərbaycanca עברית Slovenščina