Eszközök150

Hasznos PDF-feladat, egyszerűen

Linkek kinyerése PDF-ből.

Emelje ki a hasznos linkeket a PDF-jéből.

Advertisements
Az Ön PDF-munkaterülete
Az eszközödön
vagy ejtse ide a fájlokat
A PDF feldolgozása ebben a böngészőben történik. PDF
Advertisements

Hogyan nyerjünk ki linkeket PDF-ből

  1. 01

    Válasszon egy PDF-et

    Töltsön be egy kijelölhető szövegű dokumentumot, vagy próbálja ki a mintát.

  2. 02

    Kinyerés és ellenőrzés

    Válassza a Kinyerés lehetőséget. Ellenőrizze az értékeket, a darabszámokat és a forrásoldalakat; szűrje vagy rendezze a listát.

  3. 03

    Másolás vagy letöltés

    Másolja ki az értékeket, vagy töltse le CSV-ként oldalhivatkozásokkal, esetleg egyszerű TXT listaként.

BlogHogyan nyerjünk ki linkeket és URL-eket PDF-bőlÚtmutató elolvasása

PDF linkek kinyerése az egyes oldalak megnyitása nélkül

Gyűjtse össze a nyomtatott HTTP/HTTPS címeket, www címeket és kattintható webes linkcélokat egy PDF-ből. Tartsa meg az oldalhivatkozásokat, és töltse le a duplikátumoktól mentes listát CSV vagy TXT formátumban.

A felismert értékek forrásoldal-hivatkozásokkal ellátott listává válnak.
GYORS VIDEÓTUTORIÁL Hogyan nyerjünk ki linkeket és URL-eket PDF-ből Tartsa meg a hasznos webes linkeket anélkül, hogy egyenként megnyitná őket. Angol narráció Videó megtekintése

Hogyan nyerjünk ki linkeket és URL-eket PDF-ből

Mikor hasznos ez?

Hivatkozások

Forráslinkek gyűjtése

Építsen hivatkozási listát jelentésekből és kutatási dokumentumokból.

Források

Hasznos célpontok mentése

Nyerje ki a kattintható erőforrás-címkék mögötti célpontokat.

Ellenőrzés

Ellenőrző lista vezetése

Jegyezze fel, hol található az egyes linkek, mielőtt máshol ellenőrizné őket.

Funkciók és vezérlők

Látható és kattintható linkek keresése

Linkcél belefoglalása akkor is, ha a címke csak annyit mond, hogy „Bővebben”.

Hogyan működik a linkek kinyerése

A http://, https:// vagy www. kezdetű nyomtatott linkeket felismerjük. A PDF-linkek annotációi felfedhetik a HTTP/HTTPS célokat a normál szöveg mögött is. A PDF-nek nem kell megjelenítenie az URL-t kattintható címkeként.

Az azonos nyomtatott célokat és annotációkat egy oldalon belül nem számoljuk duplán. A duplikátumok összehasonlításához normalizált URL-formákat használunk, miközben az elsőként felismert írásmódot jelenítjük meg. A hosszú, sortöréssel ellátott vagy sérült URL-ek manuális javítást igényelhetnek. Egyetlen kinyert URL-t sem hívunk le automatikusan.

Értékek áttekintése a forrásoldalakkal

Ellenőrizze a darabszámokat, ugorjon egy PDF-oldalra, és szűrje az eredménylistát.

Áttekintés és rendszerezés

Minden eredmény rögzíti a fizikai oldalpozíciót a PDF-ben, amely eltérhet a nyomtatott oldalszámoktól. Válasszon ki egy oldalcímkét az előnézet megnyitásához, hozzávetőleges kiemeléssel.

A duplikátumok eltávolítása alapértelmezetten be van kapcsolva. A darabszámok összevonják ugyanazon érték felismert ismétlődéseit; kapcsolja ki, ha külön előfordulásokat szeretne látni. Az ábécé szerinti rendezés megváltoztatja a lista sorrendjét. A szűrés a másolásra, a Letöltés gombra és a látható sorokra is vonatkozik.

Értékek másolása vagy strukturált lista letöltése

Válassza a CSV-t a darabszámokhoz és oldalakhoz, vagy a TXT-t az értékenkénti soronkénti formátumhoz.

Mit tartalmaz az egyes letöltések

A CSV tartalmazza a Típus, Érték, Darabszám és Oldalak oszlopokat. Az UTF-8 kódolás támogatja az arab és más írásrendszereket. Azokat az értékeket, amelyek táblázatkezelő képletként értelmezhetők, aposztróffal látjuk el a biztonságosabb importálás érdekében.

A TXT és a Másolás csak értékeket tartalmaz, soronként egyet. A szűrőnek megfelelő összes sor szerepel benne, még akkor is, ha a képernyőn látható táblázat több eredményoldalra terjed ki. Nem jön létre új PDF, és az eredeti PDF változatlan marad.

Nagy kinyerések kezelhető szinten tartása

Dolgozzon fel egy PDF-et a böngészőjében, explicit korlátokkal és részeredmény-értesítésekkel.

Fájlok, korlátok és szkennelt oldalak

Töltsön be egy legfeljebb 50 MiB méretű és 500 oldalas PDF-et. A kinyerés oldalanként legfeljebb 250 000 karaktert és 2 000 találatot, összesen 10 millió karaktert és 20 000 találatot, valamint oldalanként 2 000 annotációt ellenőriz. Egy 90 másodperces kinyerési keret korlátozza a hosszú folyamatokat. A nagyon összetett dokumentumok jobban működhetnek, ha kisebb fájlokra osztják őket.

Amikor egy korlát elérése történik, vagy egy oldal nem olvasható teljesen, az eredmények értesítést jelenítenek meg, a korlátozott vagy sikertelen futtatások pedig partial jelöléssel exportálódnak a fájlnévben. A kijelölhető szöveg nélküli oldalakat külön számoljuk. Használja a PDF OCR-t a csak képet tartalmazó szkennelésekhez, majd térjen vissza a felismert szöveg kinyeréséhez.

A PDF-tartalom feldolgozása helyileg, ebben a böngészőben történik. A feltöltött dokumentumokat nem küldjük kinyerő szerverre. A PDF-ben található linkeket, e-mail címeket és telefonszámokat soha nem hívjuk meg automatikusan.

Támogatott fájlok és feldolgozás

Bemenet
PDF
Kimenet
CSV / TXT

Nyisson meg egy PDF-et legfeljebb 50 MB méretig és 750 oldalig. Összetett dokumentumoknál további kimeneti, memória- és feldolgozási korlátok érvényesülhetnek.

A feldolgozás az Ön eszközén történik, a dokumentum feltöltése nélkül. Töltse le az eredményt az oldal bezárása előtt; az eredetit külön őrizze meg.

Advertisements
GYIK

Néhány hasznos válasz

Tudja meg, mire számíthat, mielőtt elkezdené.

Az eszközödön
Mit képes felismerni ez az eszköz?

Gyűjtsön össze nyomtatott HTTP/HTTPS-címeket, www-címeket és kattintható webes hivatkozáscélokat egy PDF-ből. Tartsa meg az oldalreferenciákat, és töltse le a deduplikált listát CSV vagy TXT formátumban. Az eszköz nem ellenőrzi, hogy a hivatkozások működnek-e. A belső oldal-célállomások, JavaScript-műveletek, mailto és egyéb nem webes sémák nem kerülnek exportálásra webes hivatkozásként.

Kinyerhetek adatokat beolvasott PDF-ekből?

Csak a kijelölhető szöveg és a felismert hivatkozáscélok kerülnek beolvasásra. A csak képet tartalmazó oldalakhoz először PDF OCR szükséges. Futtassa az OCR-t, töltse le a kereshető PDF-et, majd térjen vissza ehhez a kinyerőhöz.

Hogyan kezeljük a duplikátumokat és a darabszámokat?

A duplikátumok eltávolítása egyesíti a felismert egyenértékű értékeket. A darabszám a észlelt előfordulásokat mutatja, az Oldalak pedig felsorolja a fizikai PDF-oldalak pozícióit. Tiltsa le ezt az opciót, ha külön szeretné tartani az előfordulásokat. Egy nyomtatott cél és a hozzá tartozó kattintható hivatkozás ugyanazon az oldalon nem számít duplán.

Mi a különbség a CSV és a TXT között?

A CSV tartalmazza a típust, az értéket, az előfordulások számát és az oldalreferenciákat. A TXT és az Összes másolása csak az értékeket biztosítja, soronként egyet. Az aktuális szűrőnek megfelelő összes sor bekerül, nem csak a látható táblázatoldal.

Fel van töltve a PDF a kinyeréshez?

Nem. A PDF-elemzés, az illesztés és az exportálás ebben a böngészőben fut. Az eredeti PDF változatlan marad. Egyetlen kinyert linket, e-mailt vagy telefonszámot sem hívunk meg automatikusan.

Mik a korlátok?

Egy PDF legfeljebb 50 MiB és 500 oldal lehet. A kinyerés oldalanként 250 000 szöveges karakterre és 2000 találatra, összesen 10 millió karakterre és 20 000 találatra, valamint oldalanként 2000 megjegyzésre korlátozódik. Az eredmények figyelmeztetést tartalmaznak, ha a korlátok vagy az olvashatatlan oldalak miatt részlegesek.

Folytatás

Mit szeretne tenni legközelebb?

Válasszon egy eszközt. Az elkészült PDF-et magával viheti.

PDF

Advertisements

Nyelv38

English العربية Français Italiano Deutsch Español Português Nederlands Русский Türkçe 日本語 中文 हिन्दी Bahasa Indonesia Bahasa Melayu 한국어 Tiếng Việt ไทย Polski Svenska Українська Norsk বাংলা Ελληνικά فارسی اردو Čeština Dansk Magyar Română Suomi Български Filipino ქართული Slovenčina Azərbaycanca עברית Slovenščina