Kerää lähdelinkit
Muodosta viiteluettelo raporteista ja tutkimusasiakirjoista.
Poimi hyödylliset linkit PDF-tiedostostasi.
| Tyyppi | Arvo | Määrä | Sivut |
|---|
Kopiointi ja lataus sisältävät kaikki täsmäävät rivit kaikilta tulossivuilta. CSV sisältää määrät ja PDF-sivunumerot; TXT sisältää vain arvot.
Valitse sivunumero Tuloksista tarkistaaksesi sen lähteen. Korostukset näyttävät likimääräiset sijainnit.
Luettelosi on valmis. Lataa se tai palaa takaisin tarkistamaan ja muuttamaan muotoa.
Lataa asiakirja, jossa on valittavissa olevaa tekstiä, tai kokeile näytettä.
Valitse Poimi. Tarkista arvot, määrät ja lähdesivut; suodata tai lajittele luettelo.
Kopioi arvot tai lataa CSV sivuviitteillä tai yksinkertainen TXT-luettelo.
Kerää painetut HTTP/HTTPS-osoitteet, www-osoitteet ja klikattavat verkkolinkkien kohteet yhdestä PDF-tiedostosta. Säilytä sivuviitteet ja ladata duplikaateista puhdistettu luettelo CSV- tai TXT-muodossa.
Muodosta viiteluettelo raporteista ja tutkimusasiakirjoista.
Poimi klikattavien resurssilinkkien takana olevat kohteet.
Tallenna jokaisen linkin löytöpaikka ennen sen tarkistamista muualla.
Sisällytä linkin kohde, vaikka sen tekstinä olisi vain ”Lue lisää”.
Tulostetut linkit, jotka alkavat http://, https:// tai www., tunnistetaan. PDF-linkkien huomautukset voivat myös paljastaa HTTP/HTTPS-kohteet tavallisen tekstin takaa. PDF-tiedoston ei tarvitse näyttää URL-osoitetta klikattavana tekstinä.
Sivulla olevia identtisiä tulostettuja kohteita ja huomautuksia ei lasketa kahdesti. Normalisoituja URL-muotoja käytetään kaksoiskappaleiden vertailuun, mutta ensimmäisenä tunnistettu kirjoitusasu näytetään. Pitkät, rivitetyt tai vioittuneet URL-osoitteet saattavat vaatia manuaalista korjausta. Mitään poimittua URL-osoitetta ei haeta automaattisesti.
Tarkista määrät, siirry PDF-sivulle ja suodata tulosluetteloa.
Jokainen tulos tallentaa fyysisen sivun sijainnin PDF-tiedostossa, mikä voi poiketa tulostetuista sivunumeroista. Valitse sivupainike avataksesi esikatselun, jossa on summittainen korostus.
Kaksoiskappaleiden poisto on oletuksena käytössä. Määrät yhdistävät saman arvon tunnistetut toistot; kytke se pois päältä nähdäksesi erilliset esiintymät. Aakkosjärjestys muuttaa luettelon järjestystä. Suodatus koskee kopiointia ja latauksia sekä näkyviä rivejä.
Valitse CSV määriä ja sivuja varten tai TXT, jos haluat yhden arvon per rivi.
CSV sisältää sarakkeet Tyyppi, Arvo, Määrä ja Sivut. UTF-8-koodaus tukee arabiaa ja muita kirjoitusjärjestelmiä. Arvot, jotka voidaan tulkita taulukkolaskentakaavoiksi, on varustettu heittomerkillä turvallisempaa tuontia varten.
TXT ja Kopioi kaikki sisältävät vain arvot, yhden per rivi. Kaikki suodatinta vastaavat rivit sisällytetään, vaikka näytöllä oleva taulukko jakautuisi usealle tulossivulle. Uutta PDF-tiedostoa ei luoda, ja lähde-PDF pysyy muuttumattomana.
Käsittele yksi PDF selaimessasi, selkeillä rajoituksilla ja osittaisten tulosten ilmoituksilla.
Lataa yksi PDF, jonka koko on enintään 50 MiB ja sivumäärä 500. Poiminta tarkistaa enintään 250 000 merkkiä ja 2 000 osumaa per sivu, yhteensä 10 miljoonaa merkkiä ja 20 000 osumaa, sekä 2 000 huomautusta per sivu. 90 sekunnin poimintabudjetti rajoittaa pitkiä ajoja. Erittäin monimutkaiset asiakirjat toimivat paremmin, kun ne jaetaan pienempiin tiedostoihin.
Kun raja saavutetaan tai sivua ei voida lukea kokonaan, tulokset näyttävät ilmoituksen, ja rajoitetut tai epäonnistuneet ajot viedään tiedostonimellä, jossa on merkintä partial. Sivut, joissa ei ole valittavaa tekstiä, lasketaan erikseen. Käytä PDF OCR -toimintoa vain kuvia sisältäville skannauksille ja palaa sitten poimimaan tunnistettu teksti.
PDF-sisältö käsitellään paikallisesti tässä selaimessa. Ladattuja asiakirjoja ei lähetetä poimintapalvelimelle. PDF-tiedostosta löytyviin linkkeihin, sähköpostiosoitteisiin ja puhelinnumeroihin ei oteta koskaan automaattisesti yhteyttä.
Avaa yksi PDF, jonka koko on enintään 50 Mt ja sivumäärä 750. Monimutkaisten asiakirjojen kohdalla voi ilmetä lisärajoituksia tulosteen, muistin ja käsittelyn suhteen.
Käsittely tapahtuu laitteellasi ilman asiakirjan lataamista palvelimelle. Lataa tulos ennen sivun sulkemista; säilytä alkuperäinen tiedosto erikseen.
Tiedä mitä odottaa ennen aloittamista.
Omalla laitteellasiKerää tulostetut HTTP/HTTPS-osoitteet, www-osoitteet ja klikattavat verkkolinkkikohteet yhdestä PDF-tiedostosta. Säilytä sivuviitteet ja lataa duplikaateista puhdistettu luettelo CSV- tai TXT-muodossa. Työkalu ei tarkista, toimivatko linkit edelleen. Sisäisiä sivukohteita, JavaScript-toimintoja, mailto-osoitteita tai muita kuin verkko-osoitteita ei viedä verkkolinkkeinä.
Vain valittavissa oleva teksti ja tunnistetut linkkikohteet luetaan. Vain kuvia sisältävät sivut vaativat ensin PDF OCR -käsittelyn. Suorita OCR, ladata haettavissa oleva PDF ja palaa sitten tähän poimintatyökaluun.
Poista duplikaatit -toiminto yhdistää tunnistetut vastaavat arvot. Määrä näyttää havaitut esiintymät ja Sivut-luettelo ilmoittaa fyysiset PDF-sivujen sijainnit. Poista valinta käytöstä, jos haluat pitää esiintymät erillään. Tulostettua kohdetta ja vastaavaa klikattavaa linkkiä samalla sivulla ei lasketa kahdesti.
CSV sisältää tyypin, arvon, esiintymiskerrat ja sivuviitteet. TXT ja Kopioi kaikki tarjoavat vain arvot, yhden per rivi. Kaikki nykyistä suodatinta vastaavat rivit sisällytetään, ei vain näkyvissä oleva taulukkosivu.
Ei. PDF-tiedoston jäsennys, täsmäytys ja vienti tapahtuvat tässä selaimessa. Alkuperäinen PDF-tiedosto pysyy muuttumattomana. Mitään poimittua linkkiä, sähköpostiosoitetta tai puhelinnumeroa ei oteta automaattisesti yhteyttä.
Yksi PDF-tiedosto, enintään 50 MiB ja 500 sivua. Tiedonhaku on rajoitettu 250 000 tekstimerkkiin ja 2 000 osumaan sivua kohden, yhteensä 10 miljoonaan merkkiin ja 20 000 osumaan, sekä 2 000 huomautukseen sivua kohden. Tulokset sisältävät ilmoituksen, jos rajoitukset tai lukukelvottomat sivut tekevät niistä osittaisia.
LYHYT VIDEO-OPAS
Kuinka poimia linkit ja URL-osoitteet PDF-tiedostosta
Säilytä hyödylliset verkkolinkit avaamatta niitä yksitellen.
Englanninkielinen kerronta
Katso video