Työkalut150

Hyödyllinen PDF-työkalu, tehty yksinkertaiseksi

Poimi tiedot PDF-tiedostosta.

Löydä tarvitsemasi tiedot. Säilytä lähdesivu jokaisen tuloksen kohdalla.

Advertisements
PDF-työtilasi
Omalla laitteellasi
tai pudota tiedostosi tähän
PDF-tiedostosi käsitellään tässä selaimessa. PDF
Advertisements

Kuinka poimia tiedot PDF-tiedostosta

  1. 01

    Valitse yksi PDF

    Lataa asiakirja, jossa on valittavissa olevaa tekstiä, tai kokeile näytettä.

  2. 02

    Poimi ja tarkista

    Valitse Poimi. Tarkista arvot, määrät ja lähdesivut; suodata tai lajittele luettelo.

  3. 03

    Kopioi tai lataa

    Kopioi arvot tai lataa CSV sivuviitteillä tai yksinkertainen TXT-luettelo.

BlogiKuinka poimia jäsenneltyä tietoa PDF-tiedostostaLue opas

Poimi jäsennellyt arvot PDF-tiedostosta CSV- tai tekstitiedostoon

Valitse tarvitsemasi tietotyypit: sähköpostit, puhelinnumerot, URL-osoitteet, numeeriset päivämäärät, IPv4-osoitteet, verkkotunnukset, DOI, ISBN, hashtagit ja MAC-osoitteet. Tarkista poimitut arvot määrien ja sivuviitteiden kera.

Tunnistetut arvot muodostavat luettelon, jossa on viittaukset lähdesivuihin.
LYHYT VIDEO-OPAS Kuinka poimia jäsenneltyä tietoa PDF-tiedostosta Kerää yhteystiedot ja tutkimustunnisteet yhteen järjestettyyn luetteloon. Englanninkielinen kerronta Katso video

Kuinka poimia jäsenneltyä tietoa PDF-tiedostosta

Milloin tämä on hyödyllistä?

Tutkimus

Kerää tunnisteet

Kerää DOI- ja ISBN-arvot sekä sivut, joilla ne esiintyvät.

Raportit

Poimi numeeriset tiedot

Etsi päivätyt merkinnät ja IPv4-osoitteet.

Hakemistot

Rakenna yhteystietoluettelo

Yhdistä sähköpostit, puhelinnumerot ja verkkolinkit yhdeksi jäsennellyksi vienniksi.

Ominaisuudet ja hallintatyökalut

Valitse hyödylliset tietotyypit

Aloita sähköposteilla, puhelinnumeroilla ja URL-osoitteilla, ja avaa sitten Lisää tietotyyppejä erikoistuneita arvoja varten.

Mitä tunnistimet tukevat

Päivämäärien on käytettävä numeerista muotoa, jossa on nelinumeroinen vuosi; epäselvät päivä/kuukausi-arvot säilyttävät lähdejärjestyksensä. IPv4-oktetit validoidaan; IPv6 ei sisälly.

Verkkotunnukset johdetaan tunnistetuista sähköposteista ja verkkolinkeistä, ei mielivaltaisista tiedostonimistä. DOI-poiminta kattaa yleiset nykyaikaiset DOI-muodot, ei kaikkia historiallisia muotoja. ISBN-13-arvot vaativat kelvollisen tarkistussumman; ISBN-10 vaatii myös ISBN-tunnisteen. Hashtagit voivat sisältää Unicode-kirjaimia, mukaan lukien arabialaiset.

MAC-osoitteet käyttävät kuutta kaksoispisteellä tai yhdysviivalla erotettua paria. Työkalu ei koskaan ota yhteyttä poimittuihin osoitteisiin tai tunnisteisiin.

Tarkista arvot lähdesivujen avulla

Tarkista määrät, siirry PDF-sivulle ja suodata tulosluetteloa.

Tarkista ja järjestä

Jokainen tulos tallentaa fyysisen sivun sijainnin PDF-tiedostossa, mikä voi poiketa tulostetuista sivunumeroista. Valitse sivupainike avataksesi esikatselun, jossa on summittainen korostus.

Kaksoiskappaleiden poisto on oletuksena käytössä. Määrät yhdistävät saman arvon tunnistetut toistot; kytke se pois päältä nähdäksesi erilliset esiintymät. Aakkosjärjestys muuttaa luettelon järjestystä. Suodatus koskee kopiointia ja latauksia sekä näkyviä rivejä.

Kopioi arvot tai lataa jäsennelty luettelo

Valitse CSV määriä ja sivuja varten tai TXT, jos haluat yhden arvon per rivi.

Mitä kukin lataus sisältää

CSV sisältää sarakkeet Tyyppi, Arvo, Määrä ja Sivut. UTF-8-koodaus tukee arabiaa ja muita kirjoitusjärjestelmiä. Arvot, jotka voidaan tulkita taulukkolaskentakaavoiksi, on varustettu heittomerkillä turvallisempaa tuontia varten.

TXT ja Kopioi kaikki sisältävät vain arvot, yhden per rivi. Kaikki suodatinta vastaavat rivit sisällytetään, vaikka näytöllä oleva taulukko jakautuisi usealle tulossivulle. Uutta PDF-tiedostoa ei luoda, ja lähde-PDF pysyy muuttumattomana.

Pidä suuret poiminnat hallittavina

Käsittele yksi PDF selaimessasi, selkeillä rajoituksilla ja osittaisten tulosten ilmoituksilla.

Tiedostot, rajoitukset ja skannatut sivut

Lataa yksi PDF, jonka koko on enintään 50 MiB ja sivumäärä 500. Poiminta tarkistaa enintään 250 000 merkkiä ja 2 000 osumaa per sivu, yhteensä 10 miljoonaa merkkiä ja 20 000 osumaa, sekä 2 000 huomautusta per sivu. 90 sekunnin poimintabudjetti rajoittaa pitkiä ajoja. Erittäin monimutkaiset asiakirjat toimivat paremmin, kun ne jaetaan pienempiin tiedostoihin.

Kun raja saavutetaan tai sivua ei voida lukea kokonaan, tulokset näyttävät ilmoituksen, ja rajoitetut tai epäonnistuneet ajot viedään tiedostonimellä, jossa on merkintä partial. Sivut, joissa ei ole valittavaa tekstiä, lasketaan erikseen. Käytä PDF OCR -toimintoa vain kuvia sisältäville skannauksille ja palaa sitten poimimaan tunnistettu teksti.

PDF-sisältö käsitellään paikallisesti tässä selaimessa. Ladattuja asiakirjoja ei lähetetä poimintapalvelimelle. PDF-tiedostosta löytyviin linkkeihin, sähköpostiosoitteisiin ja puhelinnumeroihin ei oteta koskaan automaattisesti yhteyttä.

Tuetut tiedostot ja käsittely

Syöte
PDF
Tuloste
CSV / TXT

Avaa yksi PDF, jonka koko on enintään 50 Mt ja sivumäärä 750. Monimutkaisten asiakirjojen kohdalla voi ilmetä lisärajoituksia tulosteen, muistin ja käsittelyn suhteen.

Käsittely tapahtuu laitteellasi ilman asiakirjan lataamista palvelimelle. Lataa tulos ennen sivun sulkemista; säilytä alkuperäinen tiedosto erikseen.

Advertisements
UKK

Muutama hyödyllinen vastaus

Tiedä mitä odottaa ennen aloittamista.

Omalla laitteellasi
Mitä tämä työkalu tunnistaa?

Valitse tarvitsemasi tietotyypit: sähköpostit, puhelinnumerot, URL-osoitteet, numeeriset päivämäärät, IPv4-osoitteet, verkkotunnukset, DOI, ISBN, hashtag-tunnisteet ja MAC-osoitteet. Tarkista poimitut arvot määrien ja sivuviitteiden kera. Tämä poimii tunnistettavia arvoja, ei taulukoita, laskuja tai semanttisia kenttiä. Mallit ja tarkistussummat vähentävät kohinaa, mutta eivät takaa täydellisyyttä tai todista tunnisteen aitoutta.

Voinko poimia tietoja skannatuista PDF-tiedostoista?

Vain valittavissa oleva teksti ja tunnistetut linkkikohteet luetaan. Vain kuvia sisältävät sivut vaativat ensin PDF OCR -käsittelyn. Suorita OCR, ladata haettavissa oleva PDF ja palaa sitten tähän poimintatyökaluun.

Miten duplikaatteja ja määriä käsitellään?

Poista duplikaatit -toiminto yhdistää tunnistetut vastaavat arvot. Määrä näyttää havaitut esiintymät ja Sivut-luettelo ilmoittaa fyysiset PDF-sivujen sijainnit. Poista valinta käytöstä, jos haluat pitää esiintymät erillään. Tulostettua kohdetta ja vastaavaa klikattavaa linkkiä samalla sivulla ei lasketa kahdesti.

Mitä eroa on CSV- ja TXT-tiedostoilla?

CSV sisältää tyypin, arvon, esiintymiskerrat ja sivuviitteet. TXT ja Kopioi kaikki tarjoavat vain arvot, yhden per rivi. Kaikki nykyistä suodatinta vastaavat rivit sisällytetään, ei vain näkyvissä oleva taulukkosivu.

Ladataanko PDF-tiedosto palvelimelle tiedonhakua varten?

Ei. PDF-tiedoston jäsennys, täsmäytys ja vienti tapahtuvat tässä selaimessa. Alkuperäinen PDF-tiedosto pysyy muuttumattomana. Mitään poimittua linkkiä, sähköpostiosoitetta tai puhelinnumeroa ei oteta automaattisesti yhteyttä.

Mitkä ovat rajoitukset?

Yksi PDF-tiedosto, enintään 50 MiB ja 500 sivua. Tiedonhaku on rajoitettu 250 000 tekstimerkkiin ja 2 000 osumaan sivua kohden, yhteensä 10 miljoonaan merkkiin ja 20 000 osumaan, sekä 2 000 huomautukseen sivua kohden. Tulokset sisältävät ilmoituksen, jos rajoitukset tai lukukelvottomat sivut tekevät niistä osittaisia.

Jatka

Mitä haluaisit tehdä seuraavaksi?

Valitse työkalu. Valmis PDF kulkee mukanasi.

PDF

Advertisements

Kieli38

English العربية Français Italiano Deutsch Español Português Nederlands Русский Türkçe 日本語 中文 हिन्दी Bahasa Indonesia Bahasa Melayu 한국어 Tiếng Việt ไทย Polski Svenska Українська Norsk বাংলা Ελληνικά فارسی اردو Čeština Dansk Magyar Română Suomi Български Filipino ქართული Slovenčina Azərbaycanca עברית Slovenščina