Open Gegevens uit PDF extraheren om waarden uit één PDF te verzamelen zonder ze regel voor regel te kopiëren. De vergelijking gebruikt het echte voorbeelddocument en een CSV die van de tool is gedownload. Met e-mails, telefoonnummers, URL's, DOI, ISBN en IPv4 geselecteerd, levert het voorbeeld van drie pagina's 11 unieke rijen op uit 15 voorkomens.
Open uw PDF
Upload één PDF, of selecteer Probeer voorbeeld om dit voorbeeld te volgen. Het PDF-voorbeeld en de paginaminiaturen verschijnen. Uw originele bestand blijft ongewijzigd en de extractie wordt in uw browser uitgevoerd.
Een tekstgebaseerde gids, rapport, onderzoeksartikel of brochure is een nuttig startpunt. Scans die alleen uit afbeeldingen bestaan, hebben OCR nodig voordat hun gedrukte tekst kan worden herkend.
Kies de nuttige opties
Open op een telefoon Instellingen. Gebruik op desktop het instellingenpaneel naast het voorbeeld.
Onder Wat te extraheren zijn e-mails, telefoonnummers en URL's standaard geselecteerd. Open Meer gegevenstypen en selecteer ook DOI, ISBN en IPv4-adressen. Laat het verwijderen van duplicaten ingeschakeld en kies CSV.
Extraheer en controleer de overeenkomsten
Selecteer Extraheren. Wanneer de verwerking is voltooid, toont het tabblad Resultaten de waarden, aantallen en bronpagina's. Selecteer een rond paginanummer om de locatie in het PDF-voorbeeld te inspecteren en keer daarna terug naar Resultaten.
De uitvoer combineert de contactenlijst met DOI 10.1000/182, ISBN 978-0-306-40615-7 en IPv4-adres 192.0.2.10 van pagina 2. De kolom Type identificeert elke waarde. Filter op een relevant woord of identificatie voordat u een kleinere subset kopieert of downloadt.
Gebruik Resultaten filteren… om de lijst te verfijnen. Kopiëren en downloaden omvat alle overeenkomende rijen, zelfs wanneer de resultattabel over meerdere schermen met rijen loopt.
Download CSV of TXT
Selecteer Download CSV en gebruik vervolgens de hoofdknop Downloaden op het gereed-scherm. CSV bevat de kolommen Type, Waarde, Aantal en Pagina's. TXT en Alles kopiëren bevatten één waarde per regel.
CSV-waarden die als spreadsheetformules kunnen worden geïnterpreteerd, worden beschermd met een voorafgaand apostrof. Een internationaal telefoonnummer begint bijvoorbeeld met een plusteken. Gebruik TXT als u een platte lijst zonder spreadsheetbeveiliging nodig heeft.
Veelgestelde vragen
Extraheert dit elk nummer of elke identificatie?
Nee. Elke geselecteerde categorie heeft zijn eigen herkenningsregels. IPv6, percentages, prijzen en betaalkaartnummers worden niet geëxtraheerd. Controleer overeenkomsten met de bron; een geldige opmaak kan niet bevestigen dat een contact of identificatie bestaat.
Wat moet ik doen met een gescande PDF?
Voer eerst PDF OCR uit en laad vervolgens de herkende kopie in deze tool. Controleer de OCR-uitvoer zorgvuldig: een verkeerd teken kan een adres of identificatie veranderen.
Wat zijn de extractielimieten?
Gebruik één PDF tot 50 MiB en 750 pagina's. Extractie is beperkt tot 20.000 overeenkomsten in totaal en 2.000 per pagina, met een verwerkingsbudget van 90 seconden. Er gelden ook limieten voor tekst en annotaties. Als een limiet of onleesbare pagina de scan onderbreekt, toont de tool een melding over gedeeltelijke resultaten en markeert de exportbestandsnaam als gedeeltelijk.
Worden mijn PDF-links automatisch geopend?
Nee. Extractie leest het bestand in de browser en bezoekt geen geëxtraheerde bestemmingen. Paginaknoppen navigeren binnen het PDF-voorbeeld.
Behoud de waarden en hun context
Extraheer een gerichte lijst, controleer de bronpagina's en download het formaat dat past bij uw volgende stap.

