Åbn Udtræk data fra PDF for at indsamle værdier fra én PDF uden at kopiere dem linje for linje. Sammenligningen bruger det rigtige eksempel-dokument og en CSV hentet fra værktøjet. Med e-mails, telefonnumre, URL'er, DOI, ISBN og IPv4 valgt, producerer eksemplet på tre sider 11 unikke rækker ud af 15 forekomster.
Åbn din PDF
Upload én PDF, eller vælg Prøv eksempel for at følge dette eksempel. PDF-forhåndsvisningen og sidetotalsbilleder vises. Din originale fil forbliver uændret, og udtrækningen kører i din browser.
Et tekstbaseret bibliotek, rapport, forskningsartikel eller brochure er et nyttigt udgangspunkt. Billedbaserede scanninger kræver OCR, før deres trykte tekst kan genkendes.
Vælg de nyttige indstillinger
På en telefon skal du åbne Indstillinger. På computeren skal du bruge indstillingspanelet ved siden af forhåndsvisningen.
Under Hvad skal udtrækkes er e-mails, telefonnumre og URL'er valgt som standard. Åbn Flere datatyper og vælg også DOI, ISBN og IPv4-adresser. Lad fjernelse af dubletter være aktiveret og vælg CSV.
Udtræk og tjek matches
Vælg Udtræk. Når behandlingen er færdig, viser fanen Resultater værdierne, antallet af forekomster og kildesiderne. Vælg et cirkulært sidetal for at inspicere dets placering i PDF-forhåndsvisningen, og vend derefter tilbage til Resultater.
Outputtet kombinerer kontaktlisten med DOI 10.1000/182, ISBN 978-0-306-40615-7 og IPv4-adresse 192.0.2.10 fra side 2. Type-kolonnen identificerer hver værdi. Filtrér til et relevant ord eller identifikator, før du kopierer eller downloader en mindre delmængde.
Brug Filtrér resultater… for at indsnævre listen. Kopiering og download inkluderer alle matchende rækker, selv når resultattabellen strækker sig over flere skærmbilleder.
Download CSV eller TXT
Vælg Download CSV, og brug derefter hovedknappen Hent på skærmen, når den er klar. CSV indeholder kolonnerne Type, Værdi, Antal og Sider. TXT og Kopiér alt indeholder én værdi pr. linje.
CSV-værdier, der kan tolkes som regnearksformler, beskyttes med en indledende apostrof. For eksempel starter et internationalt telefonnummer med et plustegn. Brug TXT, hvis du har brug for en ren liste uden regnearksbeskyttelse.
Almindelige spørgsmål
Udtrækker dette ethvert tal eller enhver identifikator?
Nej. Hver valgt kategori har sine egne genkendelsesregler. IPv6, procenter, priser og betalingskortnumre udtrækkes ikke. Gennemgå matches mod kilden; gyldig formatering kan ikke bekræfte, at en kontakt eller identifikator eksisterer.
Hvad skal jeg gøre med en scannet PDF?
Kør PDF-OCR først, og indlæs derefter den genkendte kopi i dette værktøj. Tjek OCR-outputtet omhyggeligt: et forkert tegn kan ændre en adresse eller identifikator.
Hvad er grænserne for udtrækning?
Brug én PDF på op til 50 MiB og 750 sider. Udtrækning er begrænset til 20.000 matches i alt og 2.000 pr. side, med et tidsbudget på 90 sekunder. Grænser for tekst og annotering gælder også. Hvis en grænse eller en ulæselig side afbryder scanningen, viser værktøjet en meddelelse om delvise resultater og markerer eksportfilnavnet som delvist.
Bliver mine PDF-links åbnet automatisk?
Nej. Udtrækningen læser filen i browseren og besøger ikke de udtrukne destinationer. Sideknapper navigerer inden for PDF-forhåndsvisningen.
Behold værdierne og deres kontekst
Udtræk en fokuseret liste, tjek kildesiderne, og download det format, der passer til dit næste skridt.

