ინსტრუმენტები150

სასარგებლო PDF დავალება, გამარტივებული

მონაცემების ამოღება PDF-დან.

იპოვეთ საჭირო მონაცემები. შეინახეთ წყარო გვერდი თითოეულ შედეგთან ერთად.

Advertisements
თქვენი PDF სამუშაო სივრცე
თქვენს მოწყობილობაზე
ან ჩააგდეთ თქვენი ფაილები აქ
თქვენი PDF მუშავდება ამ ბრაუზერში. PDF
Advertisements

როგორ ამოვიღოთ მონაცემები PDF-დან

  1. 01

    აირჩიეთ ერთი PDF

    ჩატვირთეთ დოკუმენტი არჩევადი ტექსტით, ან სცადეთ ნიმუში.

  2. 02

    ამოღება და გადამოწმება

    აირჩიეთ ამოღება. გადაამოწმეთ მნიშვნელობები, რაოდენობა და წყაროს გვერდები; გაფილტრეთ ან დაალაგეთ სია.

  3. 03

    კოპირება ან ჩამოტვირთვა

    დააკოპირეთ მნიშვნელობები, ან ჩამოტვირთეთ CSV გვერდის მითითებებით ან მარტივი TXT სია.

ბლოგიროგორ ამოვიღოთ სტრუქტურირებული მონაცემები PDF-დანსახელმძღვანელოს წაკითხვა

სტრუქტურირებული მნიშვნელობების ამოღება PDF-დან CSV-ში ან ტექსტში

აირჩიეთ საჭირო მონაცემთა ტიპები: ელფოსტები, ტელეფონის ნომრები, URL-ები, ციფრული თარიღები, IPv4 მისამართები, დომენები, DOI, ISBN, ჰეშთეგები და MAC მისამართები. გადაამოწმეთ ამოღებული მნიშვნელობები რაოდენობითა და გვერდების მითითებებით.

ამოცნობილი მნიშვნელობები ხდება სია წყარო-გვერდის მითითებებით.
სწრაფი ვიდეო გაკვეთილი როგორ ამოვიღოთ სტრუქტურირებული მონაცემები PDF-დან შეაგროვეთ კონტაქტები და კვლევის იდენტიფიკატორები ერთ ორგანიზებულ სიაში. ინგლისური თხრობა ვიდეოს ყურება

როგორ ამოვიღოთ სტრუქტურირებული მონაცემები PDF-დან

როდის არის ეს სასარგებლო?

კვლევა

იდენტიფიკატორების შეგროვება

შეაგროვეთ DOI და ISBN მნიშვნელობები იმ გვერდებთან ერთად, სადაც ისინი ჩნდება.

ანგარიშები

ციფრული დეტალების გამოტანა

იპოვეთ დათარიღებული ჩანაწერები და IPv4 მისამართები.

დირექტორიები

საკონტაქტო სიის შექმნა

ელფოსტის, ტელეფონის ნომრებისა და ვებ-ბმულების გაერთიანება ერთ სტრუქტურირებულ ექსპორტში.

ფუნქციები და კონტროლი

სასარგებლო მონაცემთა ტიპების არჩევა

დაიწყეთ ელფოსტებით, ტელეფონებით და URL-ებით, შემდეგ გახსენით „მეტ მონაცემთა ტიპები“ სპეციალიზებული მნიშვნელობებისთვის.

რას უჭერს მხარს ამომცნობი

თარიღები უნდა იყენებდეს ციფრულ ფორმატს ოთხნიშნა წლით; გაურკვეველი დღე/თვის მნიშვნელობები ინარჩუნებს წყაროს თანმიმდევრობას. IPv4 ოქტეტები ვალიდურია; IPv6 არ შედის.

დომენები გამომდინარეობს ამოცნობილი ელფოსტებიდან და ვებ-ბმულებიდან და არა თვითნებური ფაილის სახელებიდან. DOI-ს ამოღება მოიცავს თანამედროვე DOI-ს გავრცელებულ ფორმებს და არა ყველა ისტორიულ ფორმას. ISBN-13 მნიშვნელობებს სჭირდება ვალიდური საკონტროლო ჯამი; ISBN-10-ს ასევე სჭირდება ISBN ეტიკეტი. ჰეშთეგები შეიძლება შეიცავდეს Unicode ასოებს, არაბულის ჩათვლით.

MAC მისამართები იყენებს ექვს ორწერტილიან ან დეფისით გამოყოფილ წყვილს. ინსტრუმენტი არასოდეს უკავშირდება ამოღებულ მისამართებს ან იდენტიფიკატორებს.

მნიშვნელობების გადამოწმება წყარო გვერდებთან ერთად

დაითვალეთ რაოდენობა, გადადით PDF-ის გვერდზე და გაფილტრეთ შედეგების სია.

გადახედვა და ორგანიზება

თითოეული შედეგი აღრიცხავს ფიზიკურ პოზიციას PDF-ში, რაც შეიძლება განსხვავდებოდეს დაბეჭდილი გვერდის ნომრებისგან. აირჩიეთ გვერდის ჩიპი გადახედვის გასახსნელად მიახლოებითი მონიშვნით.

დუბლიკატების წაშლა ჩართულია. რაოდენობები აერთიანებს ერთი და იმავე მნიშვნელობის ამოცნობილ გამეორებებს; გამორთეთ ის ცალკეული შემთხვევების სანახავად. ანბანური დახარისხება ცვლის სიის თანმიმდევრობას. ფილტრაცია ვრცელდება როგორც კოპირებაზე და ჩამოტვირთვაზე, ისე ხილულ მწკრივებზე.

მნიშვნელობების კოპირება ან სტრუქტურირებული სიის ჩამოტვირთვა

აირჩიეთ CSV რაოდენობებისა და გვერდებისთვის, ან TXT თითო მნიშვნელობისთვის თითო ხაზზე.

რას შეიცავს თითოეული ჩამოტვირთვა

CSV შეიცავს სვეტებს: ტიპი, მნიშვნელობა, რაოდენობა და გვერდები. UTF-8 კოდირება მხარს უჭერს არაბულ და სხვა დამწერლობებს. მნიშვნელობები, რომლებიც შეიძლება ინტერპრეტირებული იყოს როგორც ცხრილის ფორმულები, წინ უძღვის აპოსტროფი უფრო უსაფრთხო იმპორტისთვის.

TXT და კოპირება შეიცავს მხოლოდ მნიშვნელობებს, თითო ხაზზე. ფილტრის შესაბამისი ყველა მწკრივი შედის, მაშინაც კი, თუ ეკრანზე არსებული ცხრილი რამდენიმე გვერდზეა გაშლილი. ახალი PDF არ იქმნება და წყარო PDF უცვლელი რჩება.

დიდი მოცულობის ამოღების მართვა

დაამუშავეთ ერთი PDF თქვენს ბრაუზერში, მკაფიო ლიმიტებითა და ნაწილობრივი შედეგების შეტყობინებებით.

ფაილები, ლიმიტები და დასკანერებული გვერდები

ჩატვირთეთ ერთი PDF 50 MiB-მდე და 500 გვერდამდე. ამოღება ამოწმებს 250,000 სიმბოლომდე და 2,000 შესაბამისობამდე გვერდზე, 10 მილიონ სიმბოლომდე და 20,000 შესაბამისობამდე მთლიანობაში, და 2,000 ანოტაციამდე გვერდზე. 90-წამიანი ბიუჯეტი ზღუდავს ხანგრძლივ პროცესებს. ძალიან რთული დოკუმენტები შესაძლოა უკეთ მუშაობდეს უფრო მცირე ფაილებად დაყოფისას.

როდესაც ლიმიტი მიღწეულია ან გვერდის სრულად წაკითხვა შეუძლებელია, შედეგები აჩვენებს შეტყობინებას, ხოლო შეზღუდული ან წარუმატებელი პროცესები ექსპორტდება ფაილის სახელში partial-ით. გვერდები არჩევითი ტექსტის გარეშე ცალკე ითვლება. გამოიყენეთ PDF OCR მხოლოდ სურათიანი სკანირებისთვის, შემდეგ დაბრუნდით ამოცნობილი ტექსტის ამოსაღებად.

PDF შიგთავსი მუშავდება ადგილობრივად ამ ბრაუზერში. ატვირთული დოკუმენტები არ იგზავნება ამოღების სერვერზე. PDF-ში ნაპოვნი ბმულები, ელფოსტის მისამართები და ტელეფონის ნომრები არასოდეს უკავშირდება ავტომატურად.

მხარდაჭერილი ფაილები და დამუშავება

შეყვანა
PDF
გამოტანა
CSV / TXT

გახსენით ერთი PDF ფაილი 50 მბ-მდე და 750 გვერდამდე. რთული დოკუმენტებისთვის შესაძლოა დაწესდეს დამატებითი შეზღუდვები გამომავალ ფაილზე, მეხსიერებასა და დამუშავებაზე.

დამუშავება ხდება თქვენს მოწყობილობაზე, დოკუმენტის ატვირთვის გარეშე. ჩამოტვირთეთ შედეგი გვერდის დახურვამდე; ორიგინალი შეინახეთ ცალკე.

Advertisements
ხშირად დასმული კითხვები

რამდენიმე სასარგებლო პასუხი

იცოდეთ რას უნდა ელოდოთ დაწყებამდე.

თქვენს მოწყობილობაზე
რა სახის მონაცემების ამოცნობა შეუძლია ამ ხელსაწყოს?

აირჩიეთ თქვენთვის საჭირო მონაცემთა ტიპები: ელფოსტები, ტელეფონის ნომრები, URL-ები, რიცხვითი თარიღები, IPv4 მისამართები, დომენები, DOI, ISBN, ჰეშთეგები და MAC მისამართები. გადაამოწმეთ ამოღებული მნიშვნელობები რაოდენობებთან და გვერდების მითითებებთან ერთად. ეს ხელსაწყო ამოიღებს ამოცნობად მნიშვნელობებს და არა ცხრილებს, ინვოისებს ან სემანტიკურ ველებს. შაბლონები და საკონტროლო ჯამები ამცირებს ხმაურს, მაგრამ არ იძლევა სისრულის გარანტიას და არ ადასტურებს იდენტიფიკატორის ნამდვილობას.

შემიძლია თუ არა მონაცემების ამოღება დასკანერებული PDF ფაილებიდან?

იკითხება მხოლოდ ამოსარჩევი ტექსტი და ამოცნობილი ბმულის სამიზნეები. მხოლოდ სურათების შემცველ გვერდებს ჯერ ესაჭიროება PDF OCR. გაუშვით OCR, ჩამოტვირთეთ საძიებო PDF და შემდეგ დაბრუნდით ამ ექსტრაქტორთან.

როგორ ხდება დუბლიკატებისა და რაოდენობების დამუშავება?

დუბლიკატების წაშლა აერთიანებს ამოცნობილ ეკვივალენტურ მნიშვნელობებს. „რაოდენობა“ აჩვენებს აღმოჩენილ შემთხვევებს, ხოლო „გვერდები“ ჩამოთვლის PDF-ის ფიზიკურ გვერდებს. გამორთეთ ეს ოფცია, თუ გსურთ შემთხვევების ცალ-ცალკე შენარჩუნება. დაბეჭდილი სამიზნე და შესაბამისი დაწკაპუნებადი ბმული ერთსა და იმავე გვერდზე ორჯერ არ ითვლება.

რა განსხვავებაა CSV-სა და TXT-ს შორის?

CSV მოიცავს ტიპს, მნიშვნელობას, შემთხვევების რაოდენობას და გვერდების მითითებებს. TXT და „ყველას კოპირება“ უზრუნველყოფს მხოლოდ მნიშვნელობებს, თითოეულს თითო ხაზზე. შედის მიმდინარე ფილტრის შესაბამისი ყველა მწკრივი და არა მხოლოდ ცხრილის ხილული გვერდი.

იგზავნება თუ არა PDF ამოღებისთვის?

არა. PDF-ის ანალიზი, შესაბამისობა და ექსპორტი ხორციელდება ამ ბრაუზერში. ორიგინალი PDF უცვლელია. არცერთი ამოღებული ბმული, ელფოსტა ან ტელეფონის ნომერი არ უკავშირდება ავტომატურად.

რა შეზღუდვები არსებობს?

ერთი PDF ფაილი 50 MiB-მდე და 500 გვერდამდე. ამოღება შეზღუდულია 250,000 ტექსტური სიმბოლოთი და 2,000 დამთხვევით თითო გვერდზე, 10 მილიონი სიმბოლოთი და 20,000 დამთხვევით მთლიანობაში, და 2,000 ანოტაციით თითო გვერდზე. შედეგებს მოჰყვება შეტყობინება, თუ შეზღუდვების ან წაუკითხავი გვერდების გამო ისინი ნაწილობრივია.

გაგრძელება

რისი გაკეთება გსურთ შემდეგ?

აირჩიეთ ინსტრუმენტი. თქვენი დასრულებული PDF თქვენთან დარჩება.

PDF

შემდეგი შემოთავაზებული ნაბიჯები

Advertisements

Ენა38

English العربية Français Italiano Deutsch Español Português Nederlands Русский Türkçe 日本語 中文 हिन्दी Bahasa Indonesia Bahasa Melayu 한국어 Tiếng Việt ไทย Polski Svenska Українська Norsk বাংলা Ελληνικά فارسی اردو Čeština Dansk Magyar Română Suomi Български Filipino ქართული Slovenčina Azərbaycanca עברית Slovenščina