Azonosítók gyűjtése
Gyűjtse össze a DOI és ISBN értékeket azokkal az oldalakkal együtt, ahol megjelennek.
Találja meg a szükséges adatokat. Tartsa meg a forrásoldalt minden eredménynél.
| Típus | Érték | Darabszám | Oldalak |
|---|
A másolás és a letöltés minden találati sort tartalmaz az összes eredménylapon. A CSV tartalmazza a darabszámokat és a PDF oldalszámokat; a TXT csak az értékeket.
Válasszon ki egy oldalszámot az Eredményeknél a forrás ellenőrzéséhez. A kiemelések a hozzávetőleges pozíciókat mutatják.
A lista készen áll. Töltse le, vagy térjen vissza az ellenőrzéshez és a formátum módosításához.
Töltsön be egy kijelölhető szövegű dokumentumot, vagy próbálja ki a mintát.
Válassza a Kinyerés lehetőséget. Ellenőrizze az értékeket, a darabszámokat és a forrásoldalakat; szűrje vagy rendezze a listát.
Másolja ki az értékeket, vagy töltse le CSV-ként oldalhivatkozásokkal, esetleg egyszerű TXT listaként.
Válassza ki a szükséges adattípusokat: e-mailek, telefonszámok, URL-ek, numerikus dátumok, IPv4 címek, domainek, DOI, ISBN, hashtagek és MAC címek. Tekintse át a kinyert értékeket darabszámokkal és oldalhivatkozásokkal.
Gyűjtse össze a DOI és ISBN értékeket azokkal az oldalakkal együtt, ahol megjelennek.
Keressen dátumozott bejegyzéseket és IPv4 címeket.
E-mailek, telefonszámok és webes linkek egyesítése egy strukturált exportban.
Kezdje az e-mailekkel, telefonokkal és URL-ekkel, majd nyissa meg a További adattípusok menüt a speciális értékekért.
A dátumoknak négyjegyű évszámot tartalmazó numerikus formátumot kell használniuk; a kétértelmű nap/hónap értékek megőrzik a forrás szerinti sorrendet. Az IPv4 oktetteket érvényesítjük; az IPv6 nem szerepel.
A domainek a felismert e-mailekből és webes linkekből származnak, nem tetszőleges fájlnevekből. A DOI-kinyerés a gyakori modern DOI-formákat fedi le, nem az összes történelmi formát. Az ISBN-13 értékeknek érvényes ellenőrző összeggel kell rendelkezniük; az ISBN-10-hez ISBN-címke is szükséges. A hashtagek tartalmazhatnak Unicode karaktereket, beleértve az arabot is.
A MAC-címek hat kettősponttal vagy kötőjellel elválasztott párt használnak. Az eszköz soha nem lép kapcsolatba a kinyert címekkel vagy azonosítókkal.
Ellenőrizze a darabszámokat, ugorjon egy PDF-oldalra, és szűrje az eredménylistát.
Minden eredmény rögzíti a fizikai oldalpozíciót a PDF-ben, amely eltérhet a nyomtatott oldalszámoktól. Válasszon ki egy oldalcímkét az előnézet megnyitásához, hozzávetőleges kiemeléssel.
A duplikátumok eltávolítása alapértelmezetten be van kapcsolva. A darabszámok összevonják ugyanazon érték felismert ismétlődéseit; kapcsolja ki, ha külön előfordulásokat szeretne látni. Az ábécé szerinti rendezés megváltoztatja a lista sorrendjét. A szűrés a másolásra, a Letöltés gombra és a látható sorokra is vonatkozik.
Válassza a CSV-t a darabszámokhoz és oldalakhoz, vagy a TXT-t az értékenkénti soronkénti formátumhoz.
A CSV tartalmazza a Típus, Érték, Darabszám és Oldalak oszlopokat. Az UTF-8 kódolás támogatja az arab és más írásrendszereket. Azokat az értékeket, amelyek táblázatkezelő képletként értelmezhetők, aposztróffal látjuk el a biztonságosabb importálás érdekében.
A TXT és a Másolás csak értékeket tartalmaz, soronként egyet. A szűrőnek megfelelő összes sor szerepel benne, még akkor is, ha a képernyőn látható táblázat több eredményoldalra terjed ki. Nem jön létre új PDF, és az eredeti PDF változatlan marad.
Dolgozzon fel egy PDF-et a böngészőjében, explicit korlátokkal és részeredmény-értesítésekkel.
Töltsön be egy legfeljebb 50 MiB méretű és 500 oldalas PDF-et. A kinyerés oldalanként legfeljebb 250 000 karaktert és 2 000 találatot, összesen 10 millió karaktert és 20 000 találatot, valamint oldalanként 2 000 annotációt ellenőriz. Egy 90 másodperces kinyerési keret korlátozza a hosszú folyamatokat. A nagyon összetett dokumentumok jobban működhetnek, ha kisebb fájlokra osztják őket.
Amikor egy korlát elérése történik, vagy egy oldal nem olvasható teljesen, az eredmények értesítést jelenítenek meg, a korlátozott vagy sikertelen futtatások pedig partial jelöléssel exportálódnak a fájlnévben. A kijelölhető szöveg nélküli oldalakat külön számoljuk. Használja a PDF OCR-t a csak képet tartalmazó szkennelésekhez, majd térjen vissza a felismert szöveg kinyeréséhez.
A PDF-tartalom feldolgozása helyileg, ebben a böngészőben történik. A feltöltött dokumentumokat nem küldjük kinyerő szerverre. A PDF-ben található linkeket, e-mail címeket és telefonszámokat soha nem hívjuk meg automatikusan.
Nyisson meg egy PDF-et legfeljebb 50 MB méretig és 750 oldalig. Összetett dokumentumoknál további kimeneti, memória- és feldolgozási korlátok érvényesülhetnek.
A feldolgozás az Ön eszközén történik, a dokumentum feltöltése nélkül. Töltse le az eredményt az oldal bezárása előtt; az eredetit külön őrizze meg.
Tudja meg, mire számíthat, mielőtt elkezdené.
Az eszközödönVálassza ki a szükséges adattípusokat: e-mailek, telefonszámok, URL-ek, numerikus dátumok, IPv4-címek, domainek, DOI, ISBN, hashtagek és MAC-címek. Tekintse át a kinyert értékeket a darabszámokkal és az oldalreferenciákkal együtt. Ez az eszköz felismerhető értékeket nyer ki, nem táblázatokat, számlákat vagy szemantikai mezőket. A minták és ellenőrző összegek csökkentik a zajt, de nem garantálják a teljességet, és nem bizonyítják, hogy egy azonosító valódi.
Csak a kijelölhető szöveg és a felismert hivatkozáscélok kerülnek beolvasásra. A csak képet tartalmazó oldalakhoz először PDF OCR szükséges. Futtassa az OCR-t, töltse le a kereshető PDF-et, majd térjen vissza ehhez a kinyerőhöz.
A duplikátumok eltávolítása egyesíti a felismert egyenértékű értékeket. A darabszám a észlelt előfordulásokat mutatja, az Oldalak pedig felsorolja a fizikai PDF-oldalak pozícióit. Tiltsa le ezt az opciót, ha külön szeretné tartani az előfordulásokat. Egy nyomtatott cél és a hozzá tartozó kattintható hivatkozás ugyanazon az oldalon nem számít duplán.
A CSV tartalmazza a típust, az értéket, az előfordulások számát és az oldalreferenciákat. A TXT és az Összes másolása csak az értékeket biztosítja, soronként egyet. Az aktuális szűrőnek megfelelő összes sor bekerül, nem csak a látható táblázatoldal.
Nem. A PDF-elemzés, az illesztés és az exportálás ebben a böngészőben fut. Az eredeti PDF változatlan marad. Egyetlen kinyert linket, e-mailt vagy telefonszámot sem hívunk meg automatikusan.
Egy PDF legfeljebb 50 MiB és 500 oldal lehet. A kinyerés oldalanként 250 000 szöveges karakterre és 2000 találatra, összesen 10 millió karakterre és 20 000 találatra, valamint oldalanként 2000 megjegyzésre korlátozódik. Az eredmények figyelmeztetést tartalmaznak, ha a korlátok vagy az olvashatatlan oldalak miatt részlegesek.
GYORS VIDEÓTUTORIÁL
Hogyan nyerjünk ki strukturált adatokat PDF-ből
Gyűjtse össze a névjegyeket és kutatási azonosítókat egy rendezett listába.
Angol narráció
Videó megtekintése