Öffnen Sie Daten aus PDF extrahieren, um Werte aus einem PDF zu sammeln, ohne sie Zeile für Zeile kopieren zu müssen. Der Vergleich verwendet das echte Beispieldokument und eine vom Tool heruntergeladene CSV-Datei. Mit ausgewählten E-Mails, Telefonnummern, URLs, DOI, ISBN und IPv4 erzeugt das dreiseitige Beispiel 11 eindeutige Zeilen aus 15 Vorkommen.
Öffnen Sie Ihr PDF
Laden Sie ein PDF hoch oder wählen Sie Beispiel versuchen, um diesem Beispiel zu folgen. Die PDF-Vorschau und Seitenvorschaubilder erscheinen. Ihre Originaldatei bleibt unverändert und die Extraktion erfolgt in Ihrem Browser.
Ein textbasiertes Verzeichnis, ein Bericht, ein Forschungspapier oder eine Broschüre sind ein nützlicher Ausgangspunkt. Reine Bild-Scans benötigen OCR, bevor ihr gedruckter Text erkannt werden kann.
Wählen Sie die nützlichen Optionen
Öffnen Sie auf einem Telefon Einstellungen. Verwenden Sie auf dem Desktop das Einstellungsfeld neben der Vorschau.
Unter Was extrahiert werden soll sind E-Mails, Telefonnummern und URLs bereits ausgewählt. Öffnen Sie Weitere Datentypen und wählen Sie zusätzlich DOI, ISBN und IPv4-Adressen. Lassen Sie die Duplikatentfernung aktiviert und wählen Sie CSV.
Extrahieren und prüfen Sie die Übereinstimmungen
Wählen Sie Extrahieren. Wenn der Vorgang abgeschlossen ist, zeigt der Tab Ergebnisse die Werte, Vorkommenshäufigkeiten und Quellseiten an. Wählen Sie eine kreisförmige Seitenzahl, um deren Position in der PDF-Vorschau zu prüfen, und kehren Sie dann zu den Ergebnissen zurück.
Die Ausgabe kombiniert die Kontaktliste mit DOI 10.1000/182, ISBN 978-0-306-40615-7 und IPv4-Adresse 192.0.2.10 von Seite 2. Die Spalte Typ identifiziert jeden Wert. Filtern Sie nach einem relevanten Wort oder Bezeichner, bevor Sie eine kleinere Teilmenge kopieren oder herunterladen.
Verwenden Sie Ergebnisse filtern…, um die Liste einzugrenzen. Kopieren und Herunterladen umfassen alle übereinstimmenden Zeilen, auch wenn die Ergebnistabelle mehrere Bildschirme umfasst.
CSV oder TXT herunterladen
Wählen Sie Download CSV und verwenden Sie dann die Hauptschaltfläche Herunterladen auf dem Bereitstellungsbildschirm. CSV enthält die Spalten Typ, Wert, Anzahl und Seiten. TXT und Alle kopieren enthalten einen Wert pro Zeile.
CSV-Werte, die als Tabellenkalkulationsformeln interpretiert werden könnten, werden mit einem führenden Apostroph geschützt. Eine internationale Telefonnummer beginnt beispielsweise mit einem Pluszeichen. Verwenden Sie TXT, wenn Sie eine einfache Liste ohne Tabellenschutz benötigen.
Häufige Fragen
Extrahiert dies jede Zahl oder jeden Bezeichner?
Nein. Jede ausgewählte Kategorie hat ihre eigenen Erkennungsregeln. IPv6, Prozentsätze, Preise und Zahlungskartennummern werden nicht extrahiert. Überprüfen Sie die Übereinstimmungen mit der Quelle; ein gültiges Format bestätigt nicht, dass ein Kontakt oder Bezeichner existiert.
Was soll ich mit einem gescannten PDF tun?
Führen Sie zuerst PDF-OCR aus und laden Sie dann die erkannte Kopie in dieses Tool. Überprüfen Sie die OCR-Ausgabe sorgfältig: Ein falsches Zeichen kann eine Adresse oder einen Bezeichner verändern.
Was sind die Extraktionslimits?
Verwenden Sie ein PDF mit bis zu 50 MiB und 750 Seiten. Die Extraktion ist auf insgesamt 20.000 Übereinstimmungen und 2.000 pro Seite begrenzt, bei einem Verarbeitungsbudget von 90 Sekunden. Text- und Anmerkungslimits gelten ebenfalls. Wenn ein Limit oder eine unlesbare Seite den Scan unterbricht, zeigt das Tool einen Hinweis auf Teilergebnisse an und markiert den Export-Dateinamen als partiell.
Werden meine PDF-Links automatisch geöffnet?
Nein. Die Extraktion liest die Datei im Browser und besucht keine extrahierten Ziele. Seitenschaltflächen navigieren innerhalb der PDF-Vorschau.
Behalten Sie die Werte und ihren Kontext
Extrahieren Sie eine fokussierte Liste, prüfen Sie die Quellseiten und laden Sie das Format herunter, das für Ihren nächsten Schritt geeignet ist.

