Tools150

Een nuttige PDF-taak, eenvoudig gemaakt

Links uit PDF extraheren.

Haal de nuttige links uit uw PDF.

Advertisements
Uw PDF-werkruimte
Op je apparaat
of sleep uw bestanden hierheen
Uw PDF wordt in deze browser verwerkt. PDF
Advertisements

Hoe links uit een PDF te extraheren

  1. 01

    Kies één PDF

    Laad een document met selecteerbare tekst, of probeer het voorbeeld.

  2. 02

    Extraheren en controleren

    Selecteer Extraheren. Controleer waarden, aantallen en bronpagina's; filter of sorteer de lijst.

  3. 03

    Kopiëren of downloaden

    Kopieer de waarden, of download CSV met paginaverwijzingen of een eenvoudige TXT-lijst.

BlogHoe links en URL's uit een PDF te extraherenLees de handleiding

PDF-links extraheren zonder elke pagina te openen

Verzamel afgedrukte HTTP/HTTPS-adressen, www-adressen en klikbare weblink-doelen uit één PDF. Behoud paginaverwijzingen en download een gededupliceerde lijst als CSV of TXT.

Herkende waarden worden een lijst met bronpaginaverwijzingen.
SNELLE VIDEO-TUTORIAL Hoe links en URL's uit een PDF te extraheren Bewaar de nuttige weblinks zonder ze één voor één te openen. Engelse vertelling Bekijk de video

Hoe links en URL's uit een PDF te extraheren

Wanneer is dit nuttig?

Referenties

Bronlinks verzamelen

Bouw een referentielijst op uit rapporten en onderzoeksdocumenten.

Bronnen

Nuttige bestemmingen opslaan

Extraheer de bestemmingen achter klikbare bronlabels.

Controleren

Houd een auditlijst bij

Leg vast waar elke link is gevonden voordat u deze elders controleert.

Functies en bediening

Vind zichtbare en klikbare links

Voeg een linkdoel toe, zelfs als het label alleen "Lees meer" zegt.

Hoe linkextractie werkt

Geprinte links die beginnen met http://, https:// of www. worden herkend. PDF-linkannotaties kunnen ook HTTP/HTTPS-doelen achter gewone tekst onthullen. De PDF hoeft de URL niet als klikbaar label weer te geven.

Identieke geprinte doelen en annotaties op een pagina worden niet dubbel geteld. Genormaliseerde URL-vormen worden gebruikt voor dubbele vergelijking, terwijl de eerste herkende spelling wordt weergegeven. Lange, afgebroken of beschadigde URL's kunnen handmatige correctie vereisen. Geen enkele geëxtraheerde URL wordt automatisch opgehaald.

Controleer waarden met hun bronpagina's

Controleer aantallen, spring naar een PDF-pagina en filter de resultatenlijst.

Controleren en organiseren

Elk resultaat registreert de fysieke paginapositie in de PDF, die kan afwijken van geprinte paginanummers. Selecteer een paginachip om het voorbeeld te openen met een benaderde markering.

Dubbelen verwijderen staat standaard aan. Aantallen combineren herkende herhalingen van dezelfde waarde; schakel dit uit om afzonderlijke voorkomens te zien. Sorteren op alfabet verandert de lijstvolgorde. Filteren is van toepassing op kopiëren en downloaden, evenals op de zichtbare rijen.

Kopieer waarden of download een gestructureerde lijst

Kies CSV voor aantallen en pagina's, of TXT voor één waarde per regel.

Wat elke download bevat

CSV bevat kolommen voor Type, Waarde, Aantal en Pagina's. UTF-8-codering ondersteunt Arabisch en andere scripts. Waarden die als spreadsheetformules kunnen worden geïnterpreteerd, krijgen een apostrof als voorvoegsel voor veiliger importeren.

TXT en Kopiëren bevatten alleen waarden, één per regel. Alle rijen die aan het filter voldoen, zijn inbegrepen, zelfs als de tabel op het scherm meerdere resultaatpagina's beslaat. Er wordt geen nieuwe PDF gemaakt en de bron-PDF blijft ongewijzigd.

Houd grote extracties beheersbaar

Verwerk één PDF in uw browser, met expliciete limieten en meldingen over gedeeltelijke resultaten.

Bestanden, limieten en gescande pagina's

Laad één PDF tot 50 MiB en 500 pagina's. Extractie controleert tot 250.000 tekens en 2.000 matches per pagina, 10 miljoen tekens en 20.000 matches in totaal, en 2.000 annotaties per pagina. Een extractiebudget van 90 seconden beperkt lange runs. Zeer complexe documenten werken mogelijk beter wanneer ze worden opgesplitst in kleinere bestanden.

Wanneer een limiet is bereikt of een pagina niet volledig kan worden gelezen, tonen de resultaten een melding en beperkte of mislukte runs exporteren met 'partial' in de bestandsnaam. Pagina's zonder selecteerbare tekst worden afzonderlijk geteld. Gebruik PDF OCR voor scans die alleen uit afbeeldingen bestaan en keer daarna terug om de herkende tekst te extraheren.

PDF-inhoud wordt lokaal in deze browser verwerkt. Geüploade documenten worden niet naar een extractieserver verzonden. Links, e-mailadressen en telefoonnummers die in de PDF worden gevonden, worden nooit automatisch gecontacteerd.

Ondersteunde bestanden & verwerking

Invoer
PDF
Uitvoer
CSV / TXT

Open één PDF tot 50 MB en 750 pagina's. Aanvullende uitvoer-, geheugen- en verwerkingslimieten kunnen gelden voor complexe documenten.

De verwerking vindt plaats op uw apparaat zonder het document te uploaden. Download uw resultaat voordat u de pagina sluit; bewaar het origineel apart.

Advertisements
Veelgestelde vragen

Een paar nuttige antwoorden

Weet wat u kunt verwachten voordat u begint.

Op je apparaat
Wat kan deze tool herkennen?

Verzamel afgedrukte HTTP/HTTPS-adressen, www-adressen en klikbare weblink-doelen uit één PDF. Behoud paginareferenties en download een ontdubbelde lijst als CSV of TXT. De tool controleert niet of links nog werken. Interne paginabestemmingen, JavaScript-acties, mailto en andere niet-web-schema's worden niet geëxporteerd als weblinks.

Kan ik gegevens extraheren uit gescande PDF's?

Alleen selecteerbare tekst en herkende linkdoelen worden gelezen. Pagina's die alleen uit afbeeldingen bestaan, hebben eerst PDF OCR nodig. Voer OCR uit, download de doorzoekbare PDF en keer daarna terug naar deze extractor.

Hoe worden dubbelen en aantallen afgehandeld?

Verwijder duplicaten combineert herkende equivalente waarden. 'Aantal' toont gedetecteerde voorkomens en 'Pagina's' somt de fysieke PDF-paginalocaties op. Schakel de optie uit om voorkomens apart te houden. Een afgedrukt doel en een overeenkomende klikbare link op dezelfde pagina worden niet dubbel geteld.

Wat is het verschil tussen CSV en TXT?

CSV bevat type, waarde, aantal voorkomens en paginareferenties. TXT en 'Alles kopiëren' bieden alleen waarden, één per regel. Alle rijen die overeenkomen met het huidige filter worden opgenomen, niet alleen de zichtbare tabelpagina.

Wordt de PDF geüpload voor extractie?

Nee. PDF-parsing, matching en exports draaien in deze browser. De originele PDF blijft ongewijzigd. Geen enkele geëxtraheerde link, e-mail of telefoonnummer wordt automatisch gecontacteerd.

Wat zijn de limieten?

Eén PDF tot 50 MiB en 500 pagina's. Extractie is beperkt tot 250.000 teksttekens en 2.000 overeenkomsten per pagina, 10 miljoen tekens en 20.000 overeenkomsten in totaal, en 2.000 annotaties per pagina. Resultaten bevatten een melding als limieten of onleesbare pagina's ze gedeeltelijk maken.

Ga door

Wat wil je hierna doen?

Kies een tool. Je voltooide PDF gaat met je mee.

PDF

Advertisements

Taal38

English العربية Français Italiano Deutsch Español Português Nederlands Русский Türkçe 日本語 中文 हिन्दी Bahasa Indonesia Bahasa Melayu 한국어 Tiếng Việt ไทย Polski Svenska Українська Norsk বাংলা Ελληνικά فارسی اردو Čeština Dansk Magyar Română Suomi Български Filipino ქართული Slovenčina Azərbaycanca עברית Slovenščina