იდენტიფიკატორების შეგროვება
შეაგროვეთ DOI და ISBN მნიშვნელობები იმ გვერდებთან ერთად, სადაც ისინი ჩნდება.
იპოვეთ საჭირო მონაცემები. შეინახეთ წყარო გვერდი თითოეულ შედეგთან ერთად.
| ტიპი | მნიშვნელობა | რაოდენობა | გვერდები |
|---|
კოპირება და ჩამოტვირთვა მოიცავს ყველა შესაბამის მწკრივს, შედეგების ყველა გვერდიდან. CSV შეიცავს რაოდენობას და PDF გვერდის ნომრებს; TXT შეიცავს მხოლოდ მნიშვნელობებს.
აირჩიეთ გვერდის ნომერი შედეგებში მისი წყაროს შესამოწმებლად. მონიშვნები აჩვენებს სავარაუდო პოზიციებს.
თქვენი სია მზადაა. ჩამოტვირთეთ იგი, ან დაბრუნდით უკან გადასამოწმებლად და ფორმატის შესაცვლელად.
ჩატვირთეთ დოკუმენტი არჩევადი ტექსტით, ან სცადეთ ნიმუში.
აირჩიეთ ამოღება. გადაამოწმეთ მნიშვნელობები, რაოდენობა და წყაროს გვერდები; გაფილტრეთ ან დაალაგეთ სია.
დააკოპირეთ მნიშვნელობები, ან ჩამოტვირთეთ CSV გვერდის მითითებებით ან მარტივი TXT სია.
აირჩიეთ საჭირო მონაცემთა ტიპები: ელფოსტები, ტელეფონის ნომრები, URL-ები, ციფრული თარიღები, IPv4 მისამართები, დომენები, DOI, ISBN, ჰეშთეგები და MAC მისამართები. გადაამოწმეთ ამოღებული მნიშვნელობები რაოდენობითა და გვერდების მითითებებით.
შეაგროვეთ DOI და ISBN მნიშვნელობები იმ გვერდებთან ერთად, სადაც ისინი ჩნდება.
იპოვეთ დათარიღებული ჩანაწერები და IPv4 მისამართები.
ელფოსტის, ტელეფონის ნომრებისა და ვებ-ბმულების გაერთიანება ერთ სტრუქტურირებულ ექსპორტში.
დაიწყეთ ელფოსტებით, ტელეფონებით და URL-ებით, შემდეგ გახსენით „მეტ მონაცემთა ტიპები“ სპეციალიზებული მნიშვნელობებისთვის.
თარიღები უნდა იყენებდეს ციფრულ ფორმატს ოთხნიშნა წლით; გაურკვეველი დღე/თვის მნიშვნელობები ინარჩუნებს წყაროს თანმიმდევრობას. IPv4 ოქტეტები ვალიდურია; IPv6 არ შედის.
დომენები გამომდინარეობს ამოცნობილი ელფოსტებიდან და ვებ-ბმულებიდან და არა თვითნებური ფაილის სახელებიდან. DOI-ს ამოღება მოიცავს თანამედროვე DOI-ს გავრცელებულ ფორმებს და არა ყველა ისტორიულ ფორმას. ISBN-13 მნიშვნელობებს სჭირდება ვალიდური საკონტროლო ჯამი; ISBN-10-ს ასევე სჭირდება ISBN ეტიკეტი. ჰეშთეგები შეიძლება შეიცავდეს Unicode ასოებს, არაბულის ჩათვლით.
MAC მისამართები იყენებს ექვს ორწერტილიან ან დეფისით გამოყოფილ წყვილს. ინსტრუმენტი არასოდეს უკავშირდება ამოღებულ მისამართებს ან იდენტიფიკატორებს.
დაითვალეთ რაოდენობა, გადადით PDF-ის გვერდზე და გაფილტრეთ შედეგების სია.
თითოეული შედეგი აღრიცხავს ფიზიკურ პოზიციას PDF-ში, რაც შეიძლება განსხვავდებოდეს დაბეჭდილი გვერდის ნომრებისგან. აირჩიეთ გვერდის ჩიპი გადახედვის გასახსნელად მიახლოებითი მონიშვნით.
დუბლიკატების წაშლა ჩართულია. რაოდენობები აერთიანებს ერთი და იმავე მნიშვნელობის ამოცნობილ გამეორებებს; გამორთეთ ის ცალკეული შემთხვევების სანახავად. ანბანური დახარისხება ცვლის სიის თანმიმდევრობას. ფილტრაცია ვრცელდება როგორც კოპირებაზე და ჩამოტვირთვაზე, ისე ხილულ მწკრივებზე.
აირჩიეთ CSV რაოდენობებისა და გვერდებისთვის, ან TXT თითო მნიშვნელობისთვის თითო ხაზზე.
CSV შეიცავს სვეტებს: ტიპი, მნიშვნელობა, რაოდენობა და გვერდები. UTF-8 კოდირება მხარს უჭერს არაბულ და სხვა დამწერლობებს. მნიშვნელობები, რომლებიც შეიძლება ინტერპრეტირებული იყოს როგორც ცხრილის ფორმულები, წინ უძღვის აპოსტროფი უფრო უსაფრთხო იმპორტისთვის.
TXT და კოპირება შეიცავს მხოლოდ მნიშვნელობებს, თითო ხაზზე. ფილტრის შესაბამისი ყველა მწკრივი შედის, მაშინაც კი, თუ ეკრანზე არსებული ცხრილი რამდენიმე გვერდზეა გაშლილი. ახალი PDF არ იქმნება და წყარო PDF უცვლელი რჩება.
დაამუშავეთ ერთი PDF თქვენს ბრაუზერში, მკაფიო ლიმიტებითა და ნაწილობრივი შედეგების შეტყობინებებით.
ჩატვირთეთ ერთი PDF 50 MiB-მდე და 500 გვერდამდე. ამოღება ამოწმებს 250,000 სიმბოლომდე და 2,000 შესაბამისობამდე გვერდზე, 10 მილიონ სიმბოლომდე და 20,000 შესაბამისობამდე მთლიანობაში, და 2,000 ანოტაციამდე გვერდზე. 90-წამიანი ბიუჯეტი ზღუდავს ხანგრძლივ პროცესებს. ძალიან რთული დოკუმენტები შესაძლოა უკეთ მუშაობდეს უფრო მცირე ფაილებად დაყოფისას.
როდესაც ლიმიტი მიღწეულია ან გვერდის სრულად წაკითხვა შეუძლებელია, შედეგები აჩვენებს შეტყობინებას, ხოლო შეზღუდული ან წარუმატებელი პროცესები ექსპორტდება ფაილის სახელში partial-ით. გვერდები არჩევითი ტექსტის გარეშე ცალკე ითვლება. გამოიყენეთ PDF OCR მხოლოდ სურათიანი სკანირებისთვის, შემდეგ დაბრუნდით ამოცნობილი ტექსტის ამოსაღებად.
PDF შიგთავსი მუშავდება ადგილობრივად ამ ბრაუზერში. ატვირთული დოკუმენტები არ იგზავნება ამოღების სერვერზე. PDF-ში ნაპოვნი ბმულები, ელფოსტის მისამართები და ტელეფონის ნომრები არასოდეს უკავშირდება ავტომატურად.
გახსენით ერთი PDF ფაილი 50 მბ-მდე და 750 გვერდამდე. რთული დოკუმენტებისთვის შესაძლოა დაწესდეს დამატებითი შეზღუდვები გამომავალ ფაილზე, მეხსიერებასა და დამუშავებაზე.
დამუშავება ხდება თქვენს მოწყობილობაზე, დოკუმენტის ატვირთვის გარეშე. ჩამოტვირთეთ შედეგი გვერდის დახურვამდე; ორიგინალი შეინახეთ ცალკე.
იცოდეთ რას უნდა ელოდოთ დაწყებამდე.
თქვენს მოწყობილობაზეაირჩიეთ თქვენთვის საჭირო მონაცემთა ტიპები: ელფოსტები, ტელეფონის ნომრები, URL-ები, რიცხვითი თარიღები, IPv4 მისამართები, დომენები, DOI, ISBN, ჰეშთეგები და MAC მისამართები. გადაამოწმეთ ამოღებული მნიშვნელობები რაოდენობებთან და გვერდების მითითებებთან ერთად. ეს ხელსაწყო ამოიღებს ამოცნობად მნიშვნელობებს და არა ცხრილებს, ინვოისებს ან სემანტიკურ ველებს. შაბლონები და საკონტროლო ჯამები ამცირებს ხმაურს, მაგრამ არ იძლევა სისრულის გარანტიას და არ ადასტურებს იდენტიფიკატორის ნამდვილობას.
იკითხება მხოლოდ ამოსარჩევი ტექსტი და ამოცნობილი ბმულის სამიზნეები. მხოლოდ სურათების შემცველ გვერდებს ჯერ ესაჭიროება PDF OCR. გაუშვით OCR, ჩამოტვირთეთ საძიებო PDF და შემდეგ დაბრუნდით ამ ექსტრაქტორთან.
დუბლიკატების წაშლა აერთიანებს ამოცნობილ ეკვივალენტურ მნიშვნელობებს. „რაოდენობა“ აჩვენებს აღმოჩენილ შემთხვევებს, ხოლო „გვერდები“ ჩამოთვლის PDF-ის ფიზიკურ გვერდებს. გამორთეთ ეს ოფცია, თუ გსურთ შემთხვევების ცალ-ცალკე შენარჩუნება. დაბეჭდილი სამიზნე და შესაბამისი დაწკაპუნებადი ბმული ერთსა და იმავე გვერდზე ორჯერ არ ითვლება.
CSV მოიცავს ტიპს, მნიშვნელობას, შემთხვევების რაოდენობას და გვერდების მითითებებს. TXT და „ყველას კოპირება“ უზრუნველყოფს მხოლოდ მნიშვნელობებს, თითოეულს თითო ხაზზე. შედის მიმდინარე ფილტრის შესაბამისი ყველა მწკრივი და არა მხოლოდ ცხრილის ხილული გვერდი.
არა. PDF-ის ანალიზი, შესაბამისობა და ექსპორტი ხორციელდება ამ ბრაუზერში. ორიგინალი PDF უცვლელია. არცერთი ამოღებული ბმული, ელფოსტა ან ტელეფონის ნომერი არ უკავშირდება ავტომატურად.
ერთი PDF ფაილი 50 MiB-მდე და 500 გვერდამდე. ამოღება შეზღუდულია 250,000 ტექსტური სიმბოლოთი და 2,000 დამთხვევით თითო გვერდზე, 10 მილიონი სიმბოლოთი და 20,000 დამთხვევით მთლიანობაში, და 2,000 ანოტაციით თითო გვერდზე. შედეგებს მოჰყვება შეტყობინება, თუ შეზღუდვების ან წაუკითხავი გვერდების გამო ისინი ნაწილობრივია.
სწრაფი ვიდეო გაკვეთილი
როგორ ამოვიღოთ სტრუქტურირებული მონაცემები PDF-დან
შეაგროვეთ კონტაქტები და კვლევის იდენტიფიკატორები ერთ ორგანიზებულ სიაში.
ინგლისური თხრობა
ვიდეოს ყურება