Tools150

Eine nützliche PDF-Aufgabe, einfach gemacht

Daten aus PDF extrahieren.

Finden Sie die benötigten Daten. Behalten Sie die Quellseite für jedes Ergebnis bei.

Advertisements
Ihr PDF-Arbeitsbereich
Auf deinem Gerät
oder ziehen Sie Ihre Dateien hierher
Ihr PDF wird in diesem Browser verarbeitet. PDF
Advertisements

Wie man Daten aus einem PDF extrahiert

  1. 01

    Wählen Sie ein PDF

    Laden Sie ein Dokument mit markierbarem Text oder probieren Sie das Beispiel aus.

  2. 02

    Extrahieren und überprüfen

    Wählen Sie Extrahieren. Überprüfen Sie Werte, Anzahl und Quellseiten; filtern oder sortieren Sie die Liste.

  3. 03

    Kopieren oder herunterladen

    Kopieren Sie die Werte oder laden Sie eine CSV mit Seitenreferenzen oder eine einfache TXT-Liste herunter.

BlogWie man strukturierte Daten aus einem PDF extrahiertAnleitung lesen

Strukturierte Werte aus einem PDF in CSV oder Text extrahieren

Wählen Sie die benötigten Datentypen: E-Mails, Telefonnummern, URLs, numerische Daten, IPv4-Adressen, Domains, DOI, ISBN, Hashtags und MAC-Adressen. Überprüfen Sie die extrahierten Werte mit Anzahl und Seitenreferenzen.

Erkannte Werte werden zu einer Liste mit Quellseitenreferenzen.
KURZE VIDEOANLEITUNG Wie man strukturierte Daten aus einem PDF extrahiert Sammeln Sie Kontakte und Forschungskennungen in einer organisierten Liste. Englische Erzählung Video ansehen

Wie man strukturierte Daten aus einem PDF extrahiert

Wann ist das nützlich?

Recherche

Identifikatoren sammeln

Sammeln Sie DOI- und ISBN-Werte mit den Seiten, auf denen sie erscheinen.

Berichte

Numerische Details herausziehen

Finden Sie datierte Einträge und IPv4-Adressen.

Verzeichnisse

Kontaktliste erstellen

E-Mails, Telefonnummern und Weblinks in einem strukturierten Export zusammenführen.

Funktionen und Steuerelemente

Nützliche Datentypen auswählen

Beginnen Sie mit E-Mails, Telefonnummern und URLs und öffnen Sie dann „Weitere Datentypen“ für spezialisierte Werte.

Was die Erkennung unterstützt

Daten müssen ein numerisches Format mit einer vierstelligen Jahreszahl verwenden; mehrdeutige Tag/Monat-Werte behalten ihre ursprüngliche Reihenfolge bei. IPv4-Oktette werden validiert; IPv6 ist nicht enthalten.

Domains werden aus erkannten E-Mails und Weblinks abgeleitet, nicht aus beliebigen Dateinamen. Die DOI-Extraktion deckt gängige moderne DOI-Formen ab, nicht jede historische Form. ISBN-13-Werte benötigen eine gültige Prüfsumme; ISBN-10 benötigt zusätzlich ein ISBN-Label. Hashtags können Unicode-Zeichen enthalten, einschließlich Arabisch.

MAC-Adressen verwenden sechs durch Doppelpunkte oder Bindestriche getrennte Paare. Das Tool kontaktiert niemals extrahierte Adressen oder Identifikatoren.

Werte mit ihren Quellseiten überprüfen

Anzahl prüfen, zu einer PDF-Seite springen und die Ergebnisliste filtern.

Überprüfen und organisieren

Jedes Ergebnis erfasst die physische Seitenposition im PDF, die von gedruckten Seitenzahlen abweichen kann. Wählen Sie einen Seiten-Chip, um die Vorschau mit einer ungefähren Markierung zu öffnen.

„Duplikate entfernen“ ist standardmäßig aktiviert. Die Anzahl kombiniert erkannte Wiederholungen desselben Wertes; schalten Sie dies aus, um separate Vorkommen zu sehen. „Alphabetisch sortieren“ ändert die Reihenfolge der Liste. Die Filterung gilt sowohl für das Kopieren und Herunterladen als auch für die sichtbaren Zeilen.

Werte kopieren oder eine strukturierte Liste herunterladen

Wählen Sie CSV für Anzahl und Seiten oder TXT für einen Wert pro Zeile.

Was jeder Download enthält

CSV enthält die Spalten Typ, Wert, Anzahl und Seiten. Die UTF-8-Kodierung unterstützt Arabisch und andere Schriften. Werte, die als Tabellenkalkulationsformeln interpretiert werden könnten, werden für einen sichereren Import mit einem Apostroph versehen.

TXT und „Alle kopieren“ enthalten nur Werte, einen pro Zeile. Alle Zeilen, die dem Filter entsprechen, sind enthalten, auch wenn die Tabelle auf dem Bildschirm mehrere Ergebnisseiten umfasst. Es wird kein neues PDF erstellt und das Quell-PDF bleibt unverändert.

Große Extraktionen überschaubar halten

Verarbeiten Sie ein PDF in Ihrem Browser mit expliziten Limits und Hinweisen auf Teilergebnisse.

Dateien, Limits und gescannte Seiten

Laden Sie ein PDF mit bis zu 50 MiB und 500 Seiten. Die Extraktion prüft bis zu 250.000 Zeichen und 2.000 Übereinstimmungen pro Seite, insgesamt 10 Millionen Zeichen und 20.000 Übereinstimmungen sowie 2.000 Anmerkungen pro Seite. Ein Extraktionsbudget von 90 Sekunden begrenzt lange Durchläufe. Sehr komplexe Dokumente funktionieren möglicherweise besser, wenn sie in kleinere Dateien aufgeteilt werden.

Wenn ein Limit erreicht wird oder eine Seite nicht vollständig gelesen werden kann, zeigen die Ergebnisse einen Hinweis an, und begrenzte oder fehlgeschlagene Durchläufe werden mit „partial“ im Dateinamen exportiert. Seiten ohne auswählbaren Text werden separat gezählt. Verwenden Sie PDF-OCR für reine Bildscans und kehren Sie dann zurück, um den erkannten Text zu extrahieren.

PDF-Inhalte werden lokal in diesem Browser verarbeitet. Hochgeladene Dokumente werden nicht an einen Extraktionsserver gesendet. Links, E-Mail-Adressen und Telefonnummern, die im PDF gefunden werden, werden niemals automatisch kontaktiert.

Unterstützte Dateien & Verarbeitung

Eingabe
PDF
Ausgabe
CSV / TXT

Öffnen Sie ein PDF mit bis zu 50 MB und 750 Seiten. Für komplexe Dokumente können zusätzliche Ausgabe-, Speicher- und Verarbeitungsgrenzen gelten.

Die Verarbeitung erfolgt auf Ihrem Gerät, ohne das Dokument hochzuladen. Laden Sie Ihr Ergebnis herunter, bevor Sie die Seite schließen; bewahren Sie das Original separat auf.

Advertisements
FAQ

Ein paar nützliche Antworten

Wissen Sie, was Sie erwartet, bevor Sie beginnen.

Auf deinem Gerät
Was kann dieses Tool erkennen?

Wählen Sie die benötigten Datentypen: E-Mails, Telefonnummern, URLs, numerische Daten, IPv4-Adressen, Domains, DOI, ISBN, Hashtags und MAC-Adressen. Überprüfen Sie die extrahierten Werte mit Anzahl und Seitenverweisen. Dies extrahiert erkennbare Werte, keine Tabellen, Rechnungen oder semantische Felder. Muster und Prüfsummen reduzieren Rauschen, garantieren jedoch keine Vollständigkeit und beweisen nicht, dass eine Kennung echt ist.

Kann ich Daten aus gescannten PDFs extrahieren?

Nur auswählbarer Text und erkannte Link-Ziele werden gelesen. Seiten, die nur aus Bildern bestehen, benötigen zuerst eine PDF-OCR. Führen Sie OCR aus, laden Sie die durchsuchbare PDF herunter und kehren Sie dann zu diesem Extraktor zurück.

Wie werden Duplikate und Zählungen gehandhabt?

„Duplikate entfernen“ kombiniert erkannte äquivalente Werte. Die Anzahl zeigt die erkannten Vorkommen und „Seiten“ listet die physischen PDF-Seitenpositionen auf. Deaktivieren Sie die Option, um Vorkommen getrennt zu halten. Ein gedrucktes Ziel und ein passender anklickbarer Link auf derselben Seite werden nicht doppelt gezählt.

Was ist der Unterschied zwischen CSV und TXT?

CSV enthält Typ, Wert, Vorkommensanzahl und Seitenverweise. TXT und „Alle kopieren“ liefern nur die Werte, einen pro Zeile. Alle Zeilen, die dem aktuellen Filter entsprechen, werden einbezogen, nicht nur die sichtbare Tabellenseite.

Wird das PDF für die Extraktion hochgeladen?

Nein. PDF-Parsing, Abgleich und Exporte laufen in diesem Browser. Das ursprüngliche PDF bleibt unverändert. Kein extrahierter Link, keine E-Mail-Adresse und keine Telefonnummer wird automatisch kontaktiert.

Was sind die Limits?

Eine PDF bis zu 50 MiB und 500 Seiten. Die Extraktion ist auf 250.000 Textzeichen und 2.000 Treffer pro Seite, 10 Millionen Zeichen und 20.000 Treffer insgesamt sowie 2.000 Anmerkungen pro Seite begrenzt. Die Ergebnisse enthalten einen Hinweis, falls Limits oder unlesbare Seiten sie unvollständig machen.

Weiter

Was möchten Sie als Nächstes tun?

Wählen Sie ein Tool. Ihr fertiges PDF begleitet Sie.

PDF

Advertisements

Sprache38

English العربية Français Italiano Deutsch Español Português Nederlands Русский Türkçe 日本語 中文 हिन्दी Bahasa Indonesia Bahasa Melayu 한국어 Tiếng Việt ไทย Polski Svenska Українська Norsk বাংলা Ελληνικά فارسی اردو Čeština Dansk Magyar Română Suomi Български Filipino ქართული Slovenčina Azərbaycanca עברית Slovenščina