Tools150

Een nuttige PDF-taak, eenvoudig gemaakt

Gegevens uit PDF extraheren.

Vind de gegevens die u nodig heeft. Behoud de bronpagina bij elk resultaat.

Advertisements
Uw PDF-werkruimte
Op je apparaat
of sleep uw bestanden hierheen
Uw PDF wordt in deze browser verwerkt. PDF
Advertisements

Hoe gegevens uit een PDF te extraheren

  1. 01

    Kies één PDF

    Laad een document met selecteerbare tekst, of probeer het voorbeeld.

  2. 02

    Extraheren en controleren

    Selecteer Extraheren. Controleer waarden, aantallen en bronpagina's; filter of sorteer de lijst.

  3. 03

    Kopiëren of downloaden

    Kopieer de waarden, of download CSV met paginaverwijzingen of een eenvoudige TXT-lijst.

BlogHoe gestructureerde gegevens uit een PDF te extraherenLees de handleiding

Gestructureerde waarden uit een PDF extraheren naar CSV of tekst

Kies de gegevenstypen die u nodig heeft: e-mails, telefoonnummers, URL's, numerieke datums, IPv4-adressen, domeinen, DOI, ISBN, hashtags en MAC-adressen. Controleer de geëxtraheerde waarden met aantallen en paginaverwijzingen.

Herkende waarden worden een lijst met bronpaginaverwijzingen.
SNELLE VIDEO-TUTORIAL Hoe gestructureerde gegevens uit een PDF te extraheren Verzamel contacten en onderzoeksidentificaties in één georganiseerde lijst. Engelse vertelling Bekijk de video

Hoe gestructureerde gegevens uit een PDF te extraheren

Wanneer is dit nuttig?

Onderzoek

Identificatiecodes verzamelen

Verzamel DOI- en ISBN-waarden met de pagina's waarop ze verschijnen.

Rapporten

Haal numerieke details eruit

Vind gedateerde vermeldingen en IPv4-adressen.

Mappen

Bouw een contactenlijst

Combineer e-mails, telefoonnummers en weblinks in één gestructureerde export.

Functies en bediening

Selecteer nuttige gegevenstypen

Begin met e-mails, telefoons en URL's, en open vervolgens Meer gegevenstypen voor gespecialiseerde waarden.

Wat de herkenners ondersteunen

Datums moeten een numeriek formaat gebruiken met een jaar van vier cijfers; ambigue dag/maand-waarden behouden hun bronvolgorde. IPv4-octetten worden gevalideerd; IPv6 is niet inbegrepen.

Domeinen zijn afgeleid van herkende e-mails en weblinks, niet van willekeurige bestandsnamen. DOI-extractie dekt gangbare moderne DOI-vormen, niet elke historische vorm. ISBN-13-waarden hebben een geldige controlesom nodig; ISBN-10 heeft ook een ISBN-label nodig. Hashtags kunnen Unicode-letters bevatten, inclusief Arabisch.

MAC-adressen gebruiken zes door dubbele punten of koppeltekens gescheiden paren. De tool neemt nooit contact op met geëxtraheerde adressen of identificatoren.

Controleer waarden met hun bronpagina's

Controleer aantallen, spring naar een PDF-pagina en filter de resultatenlijst.

Controleren en organiseren

Elk resultaat registreert de fysieke paginapositie in de PDF, die kan afwijken van geprinte paginanummers. Selecteer een paginachip om het voorbeeld te openen met een benaderde markering.

Dubbelen verwijderen staat standaard aan. Aantallen combineren herkende herhalingen van dezelfde waarde; schakel dit uit om afzonderlijke voorkomens te zien. Sorteren op alfabet verandert de lijstvolgorde. Filteren is van toepassing op kopiëren en downloaden, evenals op de zichtbare rijen.

Kopieer waarden of download een gestructureerde lijst

Kies CSV voor aantallen en pagina's, of TXT voor één waarde per regel.

Wat elke download bevat

CSV bevat kolommen voor Type, Waarde, Aantal en Pagina's. UTF-8-codering ondersteunt Arabisch en andere scripts. Waarden die als spreadsheetformules kunnen worden geïnterpreteerd, krijgen een apostrof als voorvoegsel voor veiliger importeren.

TXT en Kopiëren bevatten alleen waarden, één per regel. Alle rijen die aan het filter voldoen, zijn inbegrepen, zelfs als de tabel op het scherm meerdere resultaatpagina's beslaat. Er wordt geen nieuwe PDF gemaakt en de bron-PDF blijft ongewijzigd.

Houd grote extracties beheersbaar

Verwerk één PDF in uw browser, met expliciete limieten en meldingen over gedeeltelijke resultaten.

Bestanden, limieten en gescande pagina's

Laad één PDF tot 50 MiB en 500 pagina's. Extractie controleert tot 250.000 tekens en 2.000 matches per pagina, 10 miljoen tekens en 20.000 matches in totaal, en 2.000 annotaties per pagina. Een extractiebudget van 90 seconden beperkt lange runs. Zeer complexe documenten werken mogelijk beter wanneer ze worden opgesplitst in kleinere bestanden.

Wanneer een limiet is bereikt of een pagina niet volledig kan worden gelezen, tonen de resultaten een melding en beperkte of mislukte runs exporteren met 'partial' in de bestandsnaam. Pagina's zonder selecteerbare tekst worden afzonderlijk geteld. Gebruik PDF OCR voor scans die alleen uit afbeeldingen bestaan en keer daarna terug om de herkende tekst te extraheren.

PDF-inhoud wordt lokaal in deze browser verwerkt. Geüploade documenten worden niet naar een extractieserver verzonden. Links, e-mailadressen en telefoonnummers die in de PDF worden gevonden, worden nooit automatisch gecontacteerd.

Ondersteunde bestanden & verwerking

Invoer
PDF
Uitvoer
CSV / TXT

Open één PDF tot 50 MB en 750 pagina's. Aanvullende uitvoer-, geheugen- en verwerkingslimieten kunnen gelden voor complexe documenten.

De verwerking vindt plaats op uw apparaat zonder het document te uploaden. Download uw resultaat voordat u de pagina sluit; bewaar het origineel apart.

Advertisements
Veelgestelde vragen

Een paar nuttige antwoorden

Weet wat u kunt verwachten voordat u begint.

Op je apparaat
Wat kan deze tool herkennen?

Kies de datatypes die u nodig heeft: e-mails, telefoonnummers, URL's, numerieke datums, IPv4-adressen, domeinen, DOI, ISBN, hashtags en MAC-adressen. Controleer de geëxtraheerde waarden met aantallen en paginareferenties. Dit extraheert herkenbare waarden, geen tabellen, facturen of semantische velden. Patronen en checksums verminderen ruis, maar garanderen geen volledigheid en bewijzen niet dat een identificatiecode authentiek is.

Kan ik gegevens extraheren uit gescande PDF's?

Alleen selecteerbare tekst en herkende linkdoelen worden gelezen. Pagina's die alleen uit afbeeldingen bestaan, hebben eerst PDF OCR nodig. Voer OCR uit, download de doorzoekbare PDF en keer daarna terug naar deze extractor.

Hoe worden dubbelen en aantallen afgehandeld?

Verwijder duplicaten combineert herkende equivalente waarden. 'Aantal' toont gedetecteerde voorkomens en 'Pagina's' somt de fysieke PDF-paginalocaties op. Schakel de optie uit om voorkomens apart te houden. Een afgedrukt doel en een overeenkomende klikbare link op dezelfde pagina worden niet dubbel geteld.

Wat is het verschil tussen CSV en TXT?

CSV bevat type, waarde, aantal voorkomens en paginareferenties. TXT en 'Alles kopiëren' bieden alleen waarden, één per regel. Alle rijen die overeenkomen met het huidige filter worden opgenomen, niet alleen de zichtbare tabelpagina.

Wordt de PDF geüpload voor extractie?

Nee. PDF-parsing, matching en exports draaien in deze browser. De originele PDF blijft ongewijzigd. Geen enkele geëxtraheerde link, e-mail of telefoonnummer wordt automatisch gecontacteerd.

Wat zijn de limieten?

Eén PDF tot 50 MiB en 500 pagina's. Extractie is beperkt tot 250.000 teksttekens en 2.000 overeenkomsten per pagina, 10 miljoen tekens en 20.000 overeenkomsten in totaal, en 2.000 annotaties per pagina. Resultaten bevatten een melding als limieten of onleesbare pagina's ze gedeeltelijk maken.

Ga door

Wat wil je hierna doen?

Kies een tool. Je voltooide PDF gaat met je mee.

PDF

Advertisements

Taal38

English العربية Français Italiano Deutsch Español Português Nederlands Русский Türkçe 日本語 中文 हिन्दी Bahasa Indonesia Bahasa Melayu 한국어 Tiếng Việt ไทย Polski Svenska Українська Norsk বাংলা Ελληνικά فارسی اردو Čeština Dansk Magyar Română Suomi Български Filipino ქართული Slovenčina Azərbaycanca עברית Slovenščina