Εργαλεία150

Μια χρήσιμη εργασία PDF, απλοποιημένη

Εξαγωγή δεδομένων από PDF.

Βρείτε τα δεδομένα που χρειάζεστε. Διατηρήστε τη σελίδα προέλευσης για κάθε αποτέλεσμα.

Advertisements
Ο χώρος εργασίας PDF σας
Στη συσκευή σας
ή αποθέστε τα αρχεία σας εδώ
Το PDF σας επεξεργάζεται σε αυτό το πρόγραμμα περιήγησης. PDF
Advertisements

Πώς να εξάγετε δεδομένα από PDF

  1. 01

    Επιλέξτε ένα PDF

    Φορτώστε ένα έγγραφο με επιλέξιμο κείμενο ή δοκιμάστε το δείγμα.

  2. 02

    Εξαγωγή και έλεγχος

    Επιλέξτε Εξαγωγή. Ελέγξτε τιμές, πλήθος και σελίδες προέλευσης· φιλτράρετε ή ταξινομήστε τη λίστα.

  3. 03

    Αντιγραφή ή λήψη

    Αντιγράψτε τις τιμές ή κατεβάστε CSV με αναφορές σελίδων ή μια απλή λίστα TXT.

ΙστολόγιοΠώς να εξάγετε δομημένα δεδομένα από ένα PDFΔιαβάστε τον οδηγό

Εξαγωγή δομημένων τιμών από ένα PDF σε CSV ή κείμενο

Επιλέξτε τους τύπους δεδομένων που χρειάζεστε: email, αριθμούς τηλεφώνου, URL, αριθμητικές ημερομηνίες, διευθύνσεις IPv4, τομείς, DOI, ISBN, hashtags και διευθύνσεις MAC. Ελέγξτε τις εξαχθείσες τιμές με καταμετρήσεις και αναφορές σελίδων.

Οι αναγνωρισμένες τιμές γίνονται λίστα με αναφορές σελίδων προέλευσης.
ΓΡΗΓΟΡΟ ΕΚΠΑΙΔΕΥΤΙΚΟ ΒΙΝΤΕΟ Πώς να εξάγετε δομημένα δεδομένα από ένα PDF Συλλέξτε επαφές και ερευνητικά αναγνωριστικά σε μια οργανωμένη λίστα. Αφήγηση στα αγγλικά Παρακολουθήστε το βίντεο

Πώς να εξάγετε δομημένα δεδομένα από ένα PDF

Πότε είναι χρήσιμο αυτό;

Έρευνα

Συλλογή αναγνωριστικών

Συλλέξτε τιμές DOI και ISBN με τις σελίδες όπου εμφανίζονται.

Αναφορές

Εξαγωγή αριθμητικών στοιχείων

Βρείτε καταχωρημένες ημερομηνίες και διευθύνσεις IPv4.

Κατάλογοι

Δημιουργήστε μια λίστα επαφών

Συνδυάστε email, τηλέφωνα και συνδέσμους ιστού σε μια δομημένη εξαγωγή.

Χαρακτηριστικά και στοιχεία ελέγχου

Επιλέξτε χρήσιμους τύπους δεδομένων

Ξεκινήστε με email, τηλέφωνα και URL, στη συνέχεια ανοίξτε τους Περισσότερους τύπους δεδομένων για εξειδικευμένες τιμές.

Τι υποστηρίζουν οι αναγνωριστές

Οι ημερομηνίες πρέπει να χρησιμοποιούν αριθμητική μορφή με έτος τεσσάρων ψηφίων· οι αμφίσημες τιμές ημέρας/μήνα διατηρούν τη σειρά προέλευσής τους. Τα οκτέτα IPv4 επικυρώνονται· το IPv6 δεν περιλαμβάνεται.

Οι τομείς (domains) προέρχονται από αναγνωρισμένα email και συνδέσμους ιστού, όχι από αυθαίρετα ονόματα αρχείων. Η εξαγωγή DOI καλύπτει κοινές σύγχρονες μορφές DOI, όχι κάθε ιστορική μορφή. Οι τιμές ISBN-13 χρειάζονται έγκυρο άθροισμα ελέγχου· το ISBN-10 χρειάζεται επίσης ετικέτα ISBN. Τα hashtags μπορούν να περιέχουν χαρακτήρες Unicode, συμπεριλαμβανομένων των αραβικών.

Οι διευθύνσεις MAC χρησιμοποιούν έξι ζεύγη που χωρίζονται με άνω-κάτω τελεία ή παύλα. Το εργαλείο δεν επικοινωνεί ποτέ με εξαχθείσες διευθύνσεις ή αναγνωριστικά.

Ελέγξτε τις τιμές με τις σελίδες προέλευσής τους

Ελέγξτε τα πλήθη, μεταβείτε σε μια σελίδα PDF και φιλτράρετε τη λίστα αποτελεσμάτων.

Επανεξέταση και οργάνωση

Κάθε αποτέλεσμα καταγράφει τη φυσική θέση της σελίδας στο PDF, η οποία μπορεί να διαφέρει από τους αριθμούς τυπωμένων σελίδων. Επιλέξτε ένα chip σελίδας για να ανοίξετε την προεπισκόπηση με μια κατά προσέγγιση επισήμανση.

Η αφαίρεση διπλοτύπων είναι ενεργοποιημένη εξ αρχής. Τα πλήθη συνδυάζουν αναγνωρισμένες επαναλήψεις της ίδιας τιμής· απενεργοποιήστε το για να δείτε ξεχωριστές εμφανίσεις. Η αλφαβητική ταξινόμηση αλλάζει τη σειρά της λίστας. Το φιλτράρισμα εφαρμόζεται στην αντιγραφή και τις λήψεις καθώς και στις ορατές σειρές.

Αντιγράψτε τιμές ή κατεβάστε μια δομημένη λίστα

Επιλέξτε CSV για πλήθη και σελίδες, ή TXT για μία τιμή ανά γραμμή.

Τι περιέχει κάθε λήψη

Το CSV περιέχει στήλες Τύπου, Τιμής, Πλήθους και Σελίδων. Η κωδικοποίηση UTF-8 υποστηρίζει αραβικά και άλλα αλφάβητα. Οι τιμές που θα μπορούσαν να ερμηνευθούν ως τύποι υπολογιστικών φύλλων προτάσσονται με απόστροφο για ασφαλέστερη εισαγωγή.

Το TXT και η Αντιγραφή όλων περιέχουν μόνο τιμές, μία ανά γραμμή. Περιλαμβάνονται όλες οι σειρές που ταιριάζουν με το φίλτρο, ακόμα και όταν ο πίνακας στην οθόνη εκτείνεται σε πολλές σελίδες αποτελεσμάτων. Δεν δημιουργείται νέο PDF και το αρχικό PDF παραμένει αμετάβλητο.

Διατηρήστε τις μεγάλες εξαγωγές διαχειρίσιμες

Επεξεργαστείτε ένα PDF στον περιηγητή σας, με ρητά όρια και ειδοποιήσεις μερικών αποτελεσμάτων.

Αρχεία, όρια και σαρωμένες σελίδες

Φορτώστε ένα PDF έως 50 MiB και 500 σελίδες. Η εξαγωγή ελέγχει έως 250.000 χαρακτήρες και 2.000 αντιστοιχίσεις ανά σελίδα, 10 εκατομμύρια χαρακτήρες και 20.000 αντιστοιχίσεις συνολικά, και 2.000 σχολιασμούς ανά σελίδα. Ένας προϋπολογισμός 90 δευτερολέπτων για την εξαγωγή περιορίζει τις χρονοβόρες εκτελέσεις. Τα πολύ σύνθετα έγγραφα ενδέχεται να λειτουργούν καλύτερα όταν χωρίζονται σε μικρότερα αρχεία.

Όταν επιτυγχάνεται ένα όριο ή μια σελίδα δεν μπορεί να διαβαστεί πλήρως, τα αποτελέσματα εμφανίζουν μια ειδοποίηση και οι περιορισμένες ή αποτυχημένες εκτελέσεις εξάγονται με την ένδειξη partial στο όνομα αρχείου. Οι σελίδες χωρίς επιλέξιμο κείμενο προσμετρώνται ξεχωριστά. Χρησιμοποιήστε PDF OCR για σαρώσεις μόνο εικόνας και, στη συνέχεια, επιστρέψτε για να εξαγάγετε το αναγνωρισμένο κείμενο.

Το περιεχόμενο PDF επεξεργάζεται τοπικά σε αυτόν τον περιηγητή. Τα μεταφορτωμένα έγγραφα δεν αποστέλλονται σε διακομιστή εξαγωγής. Οι σύνδεσμοι, οι διευθύνσεις email και οι αριθμοί τηλεφώνου που βρίσκονται μέσα στο PDF δεν επικοινωνούνται ποτέ αυτόματα.

Υποστηριζόμενα αρχεία & επεξεργασία

Είσοδος
PDF
Έξοδος
CSV / TXT

Ανοίξτε ένα PDF έως 50 MB και 750 σελίδες. Ενδέχεται να ισχύουν πρόσθετα όρια εξόδου, μνήμης και επεξεργασίας για σύνθετα έγγραφα.

Η επεξεργασία πραγματοποιείται στη συσκευή σας χωρίς να ανεβαίνει το έγγραφο. Κατεβάστε το αποτέλεσμά σας πριν κλείσετε τη σελίδα· κρατήστε το πρωτότυπο ξεχωριστά.

Advertisements
Συχνές ερωτήσεις

Μερικές χρήσιμες απαντήσεις

Μάθετε τι να περιμένετε πριν ξεκινήσετε.

Στη συσκευή σας
Τι μπορεί να αναγνωρίσει αυτό το εργαλείο;

Επιλέξτε τους τύπους δεδομένων που χρειάζεστε: email, αριθμούς τηλεφώνου, URL, αριθμητικές ημερομηνίες, διευθύνσεις IPv4, τομείς, DOI, ISBN, hashtags και διευθύνσεις MAC. Ελέγξτε τις εξαχθείσες τιμές με πλήθη και αναφορές σελίδων. Αυτό εξάγει αναγνωρίσιμες τιμές, όχι πίνακες, τιμολόγια ή σημασιολογικά πεδία. Τα μοτίβα και τα αθροίσματα ελέγχου μειώνουν τον θόρυβο, αλλά δεν εγγυώνται πληρότητα ούτε αποδεικνύουν ότι ένα αναγνωριστικό είναι γνήσιο.

Μπορώ να εξάγω δεδομένα από σαρωμένα PDF;

Αναγιγνώσκεται μόνο το επιλέξιμο κείμενο και οι αναγνωρισμένοι στόχοι συνδέσμων. Οι σελίδες που αποτελούνται μόνο από εικόνες χρειάζονται πρώτα OCR PDF. Εκτελέστε OCR, κατεβάστε το αναζητήσιμο PDF και μετά επιστρέψτε σε αυτόν τον εξαγωγέα.

Πώς αντιμετωπίζονται τα διπλότυπα και τα πλήθη;

Η αφαίρεση διπλοτύπων συνδυάζει αναγνωρισμένες ισοδύναμες τιμές. Το πλήθος δείχνει τις ανιχνευθείσες εμφανίσεις και οι σελίδες παραθέτουν τις φυσικές θέσεις των σελίδων PDF. Απενεργοποιήστε την επιλογή για να διατηρήσετε τις εμφανίσεις ξεχωριστές. Ένας εκτυπωμένος στόχος και ένας αντίστοιχος σύνδεσμος με δυνατότητα κλικ στην ίδια σελίδα δεν προσμετρώνται διπλά.

Ποια είναι η διαφορά μεταξύ CSV και TXT;

Το CSV περιλαμβάνει τύπο, τιμή, πλήθος εμφανίσεων και αναφορές σελίδων. Το TXT και η αντιγραφή όλων παρέχουν μόνο τιμές, μία ανά γραμμή. Περιλαμβάνονται όλες οι σειρές που ταιριάζουν με το τρέχον φίλτρο, όχι μόνο η ορατή σελίδα του πίνακα.

Μεταφορτώνεται το PDF για εξαγωγή;

Όχι. Η ανάλυση, η αντιστοίχιση και οι εξαγωγές PDF εκτελούνται σε αυτόν τον περιηγητή. Το αρχικό PDF παραμένει αμετάβλητο. Κανένας εξαχθείς σύνδεσμος, email ή αριθμός τηλεφώνου δεν επικοινωνείται αυτόματα.

Ποια είναι τα όρια;

Ένα PDF έως 50 MiB και 500 σελίδες. Η εξαγωγή περιορίζεται σε 250.000 χαρακτήρες κειμένου και 2.000 αντιστοιχίσεις ανά σελίδα, 10 εκατομμύρια χαρακτήρες και 20.000 αντιστοιχίσεις συνολικά, και 2.000 σχόλια ανά σελίδα. Τα αποτελέσματα φέρουν ειδοποίηση εάν τα όρια ή οι μη αναγνώσιμες σελίδες τα καθιστούν μερικά.

Συνέχεια

Τι θα θέλατε να κάνετε στη συνέχεια;

Επιλέξτε ένα εργαλείο. Το έτοιμο PDF σας θα σας ακολουθήσει.

PDF

Advertisements

Γλώσσα38

English العربية Français Italiano Deutsch Español Português Nederlands Русский Türkçe 日本語 中文 हिन्दी Bahasa Indonesia Bahasa Melayu 한국어 Tiếng Việt ไทย Polski Svenska Українська Norsk বাংলা Ελληνικά فارسی اردو Čeština Dansk Magyar Română Suomi Български Filipino ქართული Slovenčina Azərbaycanca עברית Slovenščina