Tools150

EIN PRAKTISCHER PDF-LEITFADEN

Wie man strukturierte Datenaus einem PDF extrahiert

Sammeln Sie Kontakte und Forschungskennungen in einer organisierten Liste.

Mit ausgewählten E-Mails, Telefonnummern, URLs, DOI, ISBN und IPv4 erzeugt das dreiseitige Beispiel 11 eindeutige Zeilen aus 15 Vorkommen.

Der Anleitung folgen
EIN ECHTES TOOL-BEISPIEL
PDF-SeiteEine Seite aus dem echten Beispiel-PDF
Extrahierte WerteWerte und Seitenreferenzen aus dem tatsächlichen CSV-Download
Sechs ausgewählte Datentypen erzeugen 11 eindeutige Zeilen in der tatsächlichen CSV, einschließlich DOI-, ISBN- und IPv4-Einträgen auf Seite 2.
Advertisements
KURZE VIDEOANLEITUNG Wie man strukturierte Daten aus einem PDF extrahiert Sammeln Sie Kontakte und Forschungskennungen in einer organisierten Liste. Englische Erzählung Video ansehen

Wie man strukturierte Daten aus einem PDF extrahiert

Advertisements

Öffnen Sie Daten aus PDF extrahieren, um Werte aus einem PDF zu sammeln, ohne sie Zeile für Zeile kopieren zu müssen. Der Vergleich verwendet das echte Beispieldokument und eine vom Tool heruntergeladene CSV-Datei. Mit ausgewählten E-Mails, Telefonnummern, URLs, DOI, ISBN und IPv4 erzeugt das dreiseitige Beispiel 11 eindeutige Zeilen aus 15 Vorkommen.

01

Öffnen Sie Ihr PDF

Laden Sie ein PDF hoch oder wählen Sie Beispiel versuchen, um diesem Beispiel zu folgen. Die PDF-Vorschau und Seitenvorschaubilder erscheinen. Ihre Originaldatei bleibt unverändert und die Extraktion erfolgt in Ihrem Browser.

Ein textbasiertes Verzeichnis, ein Bericht, ein Forschungspapier oder eine Broschüre sind ein nützlicher Ausgangspunkt. Reine Bild-Scans benötigen OCR, bevor ihr gedruckter Text erkannt werden kann.

02

Wählen Sie die nützlichen Optionen

Öffnen Sie auf einem Telefon Einstellungen. Verwenden Sie auf dem Desktop das Einstellungsfeld neben der Vorschau.

Unter Was extrahiert werden soll sind E-Mails, Telefonnummern und URLs bereits ausgewählt. Öffnen Sie Weitere Datentypen und wählen Sie zusätzlich DOI, ISBN und IPv4-Adressen. Lassen Sie die Duplikatentfernung aktiviert und wählen Sie CSV.

03

Extrahieren und prüfen Sie die Übereinstimmungen

Wählen Sie Extrahieren. Wenn der Vorgang abgeschlossen ist, zeigt der Tab Ergebnisse die Werte, Vorkommenshäufigkeiten und Quellseiten an. Wählen Sie eine kreisförmige Seitenzahl, um deren Position in der PDF-Vorschau zu prüfen, und kehren Sie dann zu den Ergebnissen zurück.

Die Ausgabe kombiniert die Kontaktliste mit DOI 10.1000/182, ISBN 978-0-306-40615-7 und IPv4-Adresse 192.0.2.10 von Seite 2. Die Spalte Typ identifiziert jeden Wert. Filtern Sie nach einem relevanten Wort oder Bezeichner, bevor Sie eine kleinere Teilmenge kopieren oder herunterladen.

Verwenden Sie Ergebnisse filtern…, um die Liste einzugrenzen. Kopieren und Herunterladen umfassen alle übereinstimmenden Zeilen, auch wenn die Ergebnistabelle mehrere Bildschirme umfasst.

04

CSV oder TXT herunterladen

Wählen Sie Download CSV und verwenden Sie dann die Hauptschaltfläche Herunterladen auf dem Bereitstellungsbildschirm. CSV enthält die Spalten Typ, Wert, Anzahl und Seiten. TXT und Alle kopieren enthalten einen Wert pro Zeile.

CSV-Werte, die als Tabellenkalkulationsformeln interpretiert werden könnten, werden mit einem führenden Apostroph geschützt. Eine internationale Telefonnummer beginnt beispielsweise mit einem Pluszeichen. Verwenden Sie TXT, wenn Sie eine einfache Liste ohne Tabellenschutz benötigen.

EINIGE NÜTZLICHE DETAILS

Häufige Fragen

Extrahiert dies jede Zahl oder jeden Bezeichner?

Nein. Jede ausgewählte Kategorie hat ihre eigenen Erkennungsregeln. IPv6, Prozentsätze, Preise und Zahlungskartennummern werden nicht extrahiert. Überprüfen Sie die Übereinstimmungen mit der Quelle; ein gültiges Format bestätigt nicht, dass ein Kontakt oder Bezeichner existiert.

Was soll ich mit einem gescannten PDF tun?

Führen Sie zuerst PDF-OCR aus und laden Sie dann die erkannte Kopie in dieses Tool. Überprüfen Sie die OCR-Ausgabe sorgfältig: Ein falsches Zeichen kann eine Adresse oder einen Bezeichner verändern.

Was sind die Extraktionslimits?

Verwenden Sie ein PDF mit bis zu 50 MiB und 750 Seiten. Die Extraktion ist auf insgesamt 20.000 Übereinstimmungen und 2.000 pro Seite begrenzt, bei einem Verarbeitungsbudget von 90 Sekunden. Text- und Anmerkungslimits gelten ebenfalls. Wenn ein Limit oder eine unlesbare Seite den Scan unterbricht, zeigt das Tool einen Hinweis auf Teilergebnisse an und markiert den Export-Dateinamen als partiell.

Werden meine PDF-Links automatisch geöffnet?

Nein. Die Extraktion liest die Datei im Browser und besucht keine extrahierten Ziele. Seitenschaltflächen navigieren innerhalb der PDF-Vorschau.

SIE SIND DRAN

Behalten Sie die Werte und ihren Kontext

Extrahieren Sie eine fokussierte Liste, prüfen Sie die Quellseiten und laden Sie das Format herunter, das für Ihren nächsten Schritt geeignet ist.

Öffnen Sie Daten aus PDF extrahieren

Bilddetail

Advertisements

Sprache38

English العربية Français Italiano Deutsch Español Português Nederlands Русский Türkçe 日本語 中文 हिन्दी Bahasa Indonesia Bahasa Melayu 한국어 Tiếng Việt ไทย Polski Svenska Українська Norsk বাংলা Ελληνικά فارسی اردو Čeština Dansk Magyar Română Suomi Български Filipino ქართული Slovenčina Azərbaycanca עברית Slovenščina