Verktøy150

En nyttig PDF-oppgave, gjort enkel

Trekk ut data fra PDF.

Finn dataene du trenger. Behold kildesiden for hvert resultat.

Advertisements
Ditt PDF-arbeidsområde
På enheten din
eller slipp filene dine her
PDF-en din behandles i denne nettleseren. PDF
Advertisements

Hvordan trekke ut data fra PDF

  1. 01

    Velg én PDF

    Last inn et dokument med tekst som kan velges, eller prøv eksempelet.

  2. 02

    Trekk ut og gå gjennom

    Velg Trekk ut. Gå gjennom verdier, antall og kildesider; filtrer eller sorter listen.

  3. 03

    Kopier eller last ned

    Kopier verdiene, eller last ned CSV med sidehenvisninger eller en enkel TXT-liste.

BloggHvordan trekke ut strukturerte data fra en PDFLes guiden

Trekk ut strukturerte verdier fra en PDF til CSV eller tekst

Velg datatypene du trenger: e-poster, telefonnumre, URL-er, numeriske datoer, IPv4-adresser, domener, DOI, ISBN, emneknagger og MAC-adresser. Gå gjennom de uttrekkede verdiene med antall og sideoppføringer.

Gjenkjente verdier blir til en liste med referanser til kildesider.
RASK VIDEOVEILEDNING Hvordan trekke ut strukturerte data fra en PDF Samle kontakter og forskningsidentifikatorer i én organisert liste. Engelsk fortellerstemme Se videoen

Hvordan trekke ut strukturerte data fra en PDF

Når er dette nyttig?

Forskning

Samle identifikatorer

Samle DOI- og ISBN-verdier med sidene der de vises.

Rapporter

Hent ut numeriske detaljer

Finn daterte oppføringer og IPv4-adresser.

Kataloger

Bygg en kontaktliste

Kombiner e-poster, telefonnumre og nettlenker i én strukturert eksport.

Funksjoner og kontroller

Velg nyttige datatyper

Start med e-poster, telefonnumre og URL-er, og åpne deretter Flere datatyper for spesialiserte verdier.

Hva gjenkjennerne støtter

Datoer må bruke et numerisk format med et firesifret årstall; tvetydige dag/måned-verdier beholder kilderekkefølgen. IPv4-oktetter valideres; IPv6 er ikke inkludert.

Domener utledes fra gjenkjente e-poster og nettlenker, ikke vilkårlige filnavn. DOI-uttrekk dekker vanlige moderne DOI-former, ikke alle historiske former. ISBN-13-verdier trenger en gyldig kontrollsum; ISBN-10 trenger også en ISBN-etikett. Hashtags kan inneholde Unicode-bokstaver, inkludert arabiske.

MAC-adresser bruker seks kolon- eller bindestrek-separerte par. Verktøyet kontakter aldri uttrukne adresser eller identifikatorer.

Gjennomgå verdier med kildesidene deres

Sjekk antall, hopp til en PDF-side, og filtrer resultatlisten.

Gjennomgå og organiser

Hvert resultat registrerer den fysiske sideposisjonen i PDF-en, som kan avvike fra trykte sidetall. Velg en sidebrikke for å åpne forhåndsvisningen med en omtrentlig utheving.

Fjern duplikater er aktivert som standard. Antall kombinerer gjenkjente repetisjoner av samme verdi; slå den av for å se separate forekomster. Sorter alfabetisk endrer listerekkefølgen. Filtrering gjelder for kopiering og nedlasting, så vel som for de synlige radene.

Kopier verdier eller last ned en strukturert liste

Velg CSV for antall og sider, eller TXT for én verdi per linje.

Hva hver nedlasting inneholder

CSV inneholder kolonnene Type, Verdi, Antall og Sider. UTF-8-koding støtter arabisk og andre skrifttyper. Verdier som kan tolkes som regnearkformler, får et apostrof-prefiks for tryggere import.

TXT og Kopier alle inneholder kun verdier, én per linje. Alle rader som samsvarer med filteret er inkludert, selv når tabellen på skjermen strekker seg over flere resultatsider. Ingen ny PDF opprettes, og kilde-PDF-en forblir uendret.

Hold store uttrekk håndterbare

Behandle én PDF i nettleseren din, med eksplisitte grenser og varsler om delvise resultater.

Filer, grenser og skannede sider

Last inn én PDF på opptil 50 MiB og 500 sider. Uttrekk sjekker opptil 250 000 tegn og 2 000 treff per side, 10 millioner tegn og 20 000 treff totalt, samt 2 000 annoteringer per side. Et 90-sekunders uttrekksbudsjett begrenser lange kjøringer. Svært komplekse dokumenter kan fungere bedre når de deles opp i mindre filer.

Når en grense nås eller en side ikke kan leses fullstendig, viser resultatene et varsel, og begrensede eller mislykkede kjøringer eksporteres med «partial» i filnavnet. Sider uten valgbar tekst telles separat. Bruk PDF OCR for bildebaserte skanninger, og gå deretter tilbake for å trekke ut den gjenkjente teksten.

PDF-innhold behandles lokalt i denne nettleseren. Opplastede dokumenter sendes ikke til en uttrekks-server. Lenker, e-postadresser og telefonnumre funnet i PDF-en blir aldri kontaktet automatisk.

Støttede filer og behandling

Inndata
PDF
Utdata
CSV / TXT

Åpne én PDF på opptil 50 MB og 750 sider. Ytterligere begrensninger for utdata, minne og behandling kan gjelde for komplekse dokumenter.

Behandlingen skjer på enheten din uten at dokumentet lastes opp. Last ned resultatet før du lukker siden; ta vare på originalen separat.

Advertisements
FAQ

Noen nyttige svar

Vit hva du kan forvente før du starter.

På enheten din
Hva kan dette verktøyet gjenkjenne?

Velg datatypene du trenger: e-poster, telefonnumre, URL-er, numeriske datoer, IPv4-adresser, domener, DOI, ISBN, emneknagger og MAC-adresser. Se gjennom de ekstraherte verdiene med antall og sidehenvisninger. Dette henter ut gjenkjennelige verdier, ikke tabeller, fakturaer eller semantiske felt. Mønstre og kontrollsummer reduserer støy, men garanterer ikke fullstendighet eller beviser at en identifikator er ekte.

Kan jeg hente ut data fra skannede PDF-er?

Kun valgbar tekst og gjenkjente lenkemål leses. Sider som kun består av bilder trenger PDF-OCR først. Kjør OCR, last ned den søkbare PDF-en, og gå deretter tilbake til denne ekstraktoren.

Hvordan håndteres duplikater og antall?

Fjern duplikater kombinerer gjenkjente like verdier. Antall viser oppdagede forekomster og Sider lister opp fysiske PDF-sideplasseringer. Deaktiver alternativet for å beholde forekomster separat. Et utskrevet mål og en matchende klikkbar lenke på samme side telles ikke dobbelt.

Hva er forskjellen på CSV og TXT?

CSV inkluderer type, verdi, antall forekomster og sidehenvisninger. TXT og Kopier alle gir kun verdier, én per linje. Alle rader som samsvarer med gjeldende filter inkluderes, ikke bare den synlige tabellsiden.

Blir PDF-en lastet opp for uttrekk?

Nei. PDF-parsing, samsvarskontroll og eksport kjøres i denne nettleseren. Den originale PDF-en forblir uendret. Ingen uttrukket lenke, e-post eller telefonnummer kontaktes automatisk.

Hva er begrensningene?

Én PDF på opptil 50 MiB og 500 sider. Ekstraksjon er begrenset til 250 000 teksttegn og 2 000 treff per side, 10 millioner tegn og 20 000 treff totalt, samt 2 000 merknader per side. Resultatene inneholder et varsel hvis begrensninger eller uleselige sider gjør dem delvise.

Fortsett

Hva vil du gjøre videre?

Velg et verktøy. Den ferdige PDF-en din følger med deg.

PDF

Advertisements

Språk38

English العربية Français Italiano Deutsch Español Português Nederlands Русский Türkçe 日本語 中文 हिन्दी Bahasa Indonesia Bahasa Melayu 한국어 Tiếng Việt ไทย Polski Svenska Українська Norsk বাংলা Ελληνικά فارسی اردو Čeština Dansk Magyar Română Suomi Български Filipino ქართული Slovenčina Azərbaycanca עברית Slovenščina