Eszközök150

Hasznos PDF-feladat, egyszerűen

Adatok kinyerése PDF-ből.

Találja meg a szükséges adatokat. Tartsa meg a forrásoldalt minden eredménynél.

Advertisements
Az Ön PDF-munkaterülete
Az eszközödön
vagy ejtse ide a fájlokat
A PDF feldolgozása ebben a böngészőben történik. PDF
Advertisements

Hogyan nyerjünk ki adatokat PDF-ből

  1. 01

    Válasszon egy PDF-et

    Töltsön be egy kijelölhető szövegű dokumentumot, vagy próbálja ki a mintát.

  2. 02

    Kinyerés és ellenőrzés

    Válassza a Kinyerés lehetőséget. Ellenőrizze az értékeket, a darabszámokat és a forrásoldalakat; szűrje vagy rendezze a listát.

  3. 03

    Másolás vagy letöltés

    Másolja ki az értékeket, vagy töltse le CSV-ként oldalhivatkozásokkal, esetleg egyszerű TXT listaként.

BlogHogyan nyerjünk ki strukturált adatokat PDF-bőlÚtmutató elolvasása

Strukturált értékek kinyerése PDF-ből CSV-be vagy szövegbe

Válassza ki a szükséges adattípusokat: e-mailek, telefonszámok, URL-ek, numerikus dátumok, IPv4 címek, domainek, DOI, ISBN, hashtagek és MAC címek. Tekintse át a kinyert értékeket darabszámokkal és oldalhivatkozásokkal.

A felismert értékek forrásoldal-hivatkozásokkal ellátott listává válnak.
GYORS VIDEÓTUTORIÁL Hogyan nyerjünk ki strukturált adatokat PDF-ből Gyűjtse össze a névjegyeket és kutatási azonosítókat egy rendezett listába. Angol narráció Videó megtekintése

Hogyan nyerjünk ki strukturált adatokat PDF-ből

Mikor hasznos ez?

Kutatás

Azonosítók gyűjtése

Gyűjtse össze a DOI és ISBN értékeket azokkal az oldalakkal együtt, ahol megjelennek.

Jelentések

Numerikus adatok kinyerése

Keressen dátumozott bejegyzéseket és IPv4 címeket.

Címtárak

Névjegyzék összeállítása

E-mailek, telefonszámok és webes linkek egyesítése egy strukturált exportban.

Funkciók és vezérlők

Hasznos adattípusok kiválasztása

Kezdje az e-mailekkel, telefonokkal és URL-ekkel, majd nyissa meg a További adattípusok menüt a speciális értékekért.

Mit támogatnak a felismerők

A dátumoknak négyjegyű évszámot tartalmazó numerikus formátumot kell használniuk; a kétértelmű nap/hónap értékek megőrzik a forrás szerinti sorrendet. Az IPv4 oktetteket érvényesítjük; az IPv6 nem szerepel.

A domainek a felismert e-mailekből és webes linkekből származnak, nem tetszőleges fájlnevekből. A DOI-kinyerés a gyakori modern DOI-formákat fedi le, nem az összes történelmi formát. Az ISBN-13 értékeknek érvényes ellenőrző összeggel kell rendelkezniük; az ISBN-10-hez ISBN-címke is szükséges. A hashtagek tartalmazhatnak Unicode karaktereket, beleértve az arabot is.

A MAC-címek hat kettősponttal vagy kötőjellel elválasztott párt használnak. Az eszköz soha nem lép kapcsolatba a kinyert címekkel vagy azonosítókkal.

Értékek áttekintése a forrásoldalakkal

Ellenőrizze a darabszámokat, ugorjon egy PDF-oldalra, és szűrje az eredménylistát.

Áttekintés és rendszerezés

Minden eredmény rögzíti a fizikai oldalpozíciót a PDF-ben, amely eltérhet a nyomtatott oldalszámoktól. Válasszon ki egy oldalcímkét az előnézet megnyitásához, hozzávetőleges kiemeléssel.

A duplikátumok eltávolítása alapértelmezetten be van kapcsolva. A darabszámok összevonják ugyanazon érték felismert ismétlődéseit; kapcsolja ki, ha külön előfordulásokat szeretne látni. Az ábécé szerinti rendezés megváltoztatja a lista sorrendjét. A szűrés a másolásra, a Letöltés gombra és a látható sorokra is vonatkozik.

Értékek másolása vagy strukturált lista letöltése

Válassza a CSV-t a darabszámokhoz és oldalakhoz, vagy a TXT-t az értékenkénti soronkénti formátumhoz.

Mit tartalmaz az egyes letöltések

A CSV tartalmazza a Típus, Érték, Darabszám és Oldalak oszlopokat. Az UTF-8 kódolás támogatja az arab és más írásrendszereket. Azokat az értékeket, amelyek táblázatkezelő képletként értelmezhetők, aposztróffal látjuk el a biztonságosabb importálás érdekében.

A TXT és a Másolás csak értékeket tartalmaz, soronként egyet. A szűrőnek megfelelő összes sor szerepel benne, még akkor is, ha a képernyőn látható táblázat több eredményoldalra terjed ki. Nem jön létre új PDF, és az eredeti PDF változatlan marad.

Nagy kinyerések kezelhető szinten tartása

Dolgozzon fel egy PDF-et a böngészőjében, explicit korlátokkal és részeredmény-értesítésekkel.

Fájlok, korlátok és szkennelt oldalak

Töltsön be egy legfeljebb 50 MiB méretű és 500 oldalas PDF-et. A kinyerés oldalanként legfeljebb 250 000 karaktert és 2 000 találatot, összesen 10 millió karaktert és 20 000 találatot, valamint oldalanként 2 000 annotációt ellenőriz. Egy 90 másodperces kinyerési keret korlátozza a hosszú folyamatokat. A nagyon összetett dokumentumok jobban működhetnek, ha kisebb fájlokra osztják őket.

Amikor egy korlát elérése történik, vagy egy oldal nem olvasható teljesen, az eredmények értesítést jelenítenek meg, a korlátozott vagy sikertelen futtatások pedig partial jelöléssel exportálódnak a fájlnévben. A kijelölhető szöveg nélküli oldalakat külön számoljuk. Használja a PDF OCR-t a csak képet tartalmazó szkennelésekhez, majd térjen vissza a felismert szöveg kinyeréséhez.

A PDF-tartalom feldolgozása helyileg, ebben a böngészőben történik. A feltöltött dokumentumokat nem küldjük kinyerő szerverre. A PDF-ben található linkeket, e-mail címeket és telefonszámokat soha nem hívjuk meg automatikusan.

Támogatott fájlok és feldolgozás

Bemenet
PDF
Kimenet
CSV / TXT

Nyisson meg egy PDF-et legfeljebb 50 MB méretig és 750 oldalig. Összetett dokumentumoknál további kimeneti, memória- és feldolgozási korlátok érvényesülhetnek.

A feldolgozás az Ön eszközén történik, a dokumentum feltöltése nélkül. Töltse le az eredményt az oldal bezárása előtt; az eredetit külön őrizze meg.

Advertisements
GYIK

Néhány hasznos válasz

Tudja meg, mire számíthat, mielőtt elkezdené.

Az eszközödön
Mit képes felismerni ez az eszköz?

Válassza ki a szükséges adattípusokat: e-mailek, telefonszámok, URL-ek, numerikus dátumok, IPv4-címek, domainek, DOI, ISBN, hashtagek és MAC-címek. Tekintse át a kinyert értékeket a darabszámokkal és az oldalreferenciákkal együtt. Ez az eszköz felismerhető értékeket nyer ki, nem táblázatokat, számlákat vagy szemantikai mezőket. A minták és ellenőrző összegek csökkentik a zajt, de nem garantálják a teljességet, és nem bizonyítják, hogy egy azonosító valódi.

Kinyerhetek adatokat beolvasott PDF-ekből?

Csak a kijelölhető szöveg és a felismert hivatkozáscélok kerülnek beolvasásra. A csak képet tartalmazó oldalakhoz először PDF OCR szükséges. Futtassa az OCR-t, töltse le a kereshető PDF-et, majd térjen vissza ehhez a kinyerőhöz.

Hogyan kezeljük a duplikátumokat és a darabszámokat?

A duplikátumok eltávolítása egyesíti a felismert egyenértékű értékeket. A darabszám a észlelt előfordulásokat mutatja, az Oldalak pedig felsorolja a fizikai PDF-oldalak pozícióit. Tiltsa le ezt az opciót, ha külön szeretné tartani az előfordulásokat. Egy nyomtatott cél és a hozzá tartozó kattintható hivatkozás ugyanazon az oldalon nem számít duplán.

Mi a különbség a CSV és a TXT között?

A CSV tartalmazza a típust, az értéket, az előfordulások számát és az oldalreferenciákat. A TXT és az Összes másolása csak az értékeket biztosítja, soronként egyet. Az aktuális szűrőnek megfelelő összes sor bekerül, nem csak a látható táblázatoldal.

Fel van töltve a PDF a kinyeréshez?

Nem. A PDF-elemzés, az illesztés és az exportálás ebben a böngészőben fut. Az eredeti PDF változatlan marad. Egyetlen kinyert linket, e-mailt vagy telefonszámot sem hívunk meg automatikusan.

Mik a korlátok?

Egy PDF legfeljebb 50 MiB és 500 oldal lehet. A kinyerés oldalanként 250 000 szöveges karakterre és 2000 találatra, összesen 10 millió karakterre és 20 000 találatra, valamint oldalanként 2000 megjegyzésre korlátozódik. Az eredmények figyelmeztetést tartalmaznak, ha a korlátok vagy az olvashatatlan oldalak miatt részlegesek.

Folytatás

Mit szeretne tenni legközelebb?

Válasszon egy eszközt. Az elkészült PDF-et magával viheti.

PDF

Advertisements

Nyelv38

English العربية Français Italiano Deutsch Español Português Nederlands Русский Türkçe 日本語 中文 हिन्दी Bahasa Indonesia Bahasa Melayu 한국어 Tiếng Việt ไทย Polski Svenska Українська Norsk বাংলা Ελληνικά فارسی اردو Čeština Dansk Magyar Română Suomi Български Filipino ქართული Slovenčina Azərbaycanca עברית Slovenščina