Colectează identificatori
Adună valori DOI și ISBN împreună cu paginile în care apar.
Găsește datele de care ai nevoie. Păstrează pagina sursă pentru fiecare rezultat.
| Tip | Valoare | Număr | Pagini |
|---|
Copierea și descărcarea includ toate rândurile potrivite, din fiecare pagină de rezultate. CSV include numărători și numerele paginilor PDF; TXT conține doar valorile.
Selectează un număr de pagină în Rezultate pentru a verifica sursa. Evidențierile arată pozițiile aproximative.
Lista ta este gata. Descarc-o sau revino pentru a verifica și schimba formatul.
Încarcă un document cu text selectabil sau încearcă exemplul.
Selectează Extrage. Verifică valorile, numărătorile și paginile sursă; filtrează sau sortează lista.
Copiază valorile sau descarcă CSV cu referințe de pagină ori o listă TXT simplă.
Alege tipurile de date de care ai nevoie: e-mailuri, numere de telefon, URL-uri, date numerice, adrese IPv4, domenii, DOI, ISBN, hashtag-uri și adrese MAC. Verifică valorile extrase cu numărători și referințe la pagini.
Adună valori DOI și ISBN împreună cu paginile în care apar.
Găsește intrări datate și adrese IPv4.
Combină e-mailuri, telefoane și linkuri web într-o singură exportare structurată.
Începe cu e-mailuri, telefoane și URL-uri, apoi deschide Mai multe tipuri de date pentru valori specializate.
Datele trebuie să utilizeze un format numeric cu un an din patru cifre; valorile ambigue zi/lună își păstrează ordinea sursă. Octeții IPv4 sunt validați; IPv6 nu este inclus.
Domeniile sunt derivate din e-mailuri și linkuri web recunoscute, nu din nume de fișiere arbitrare. Extragerea DOI acoperă formele moderne comune de DOI, nu toate formele istorice. Valorile ISBN-13 necesită o sumă de control validă; ISBN-10 necesită, de asemenea, o etichetă ISBN. Hashtag-urile pot conține litere Unicode, inclusiv arabă.
Adresele MAC utilizează șase perechi separate prin două puncte sau cratimă. Instrumentul nu contactează niciodată adresele sau identificatorii extrași.
Verifică numărătoarea, sari la o pagină PDF și filtrează lista de rezultate.
Fiecare rezultat înregistrează poziția fizică a paginii în PDF, care poate diferi de numerele paginilor imprimate. Selectează un cip de pagină pentru a deschide previzualizarea cu o evidențiere aproximativă.
Eliminarea duplicatelor este activată implicit. Numărătoarea combină repetițiile recunoscute ale aceleiași valori; dezactivează opțiunea pentru a vedea aparițiile separate. Sortarea alfabetică schimbă ordinea listei. Filtrarea se aplică atât copierii și descărcărilor, cât și rândurilor vizibile.
Alege CSV pentru numărători și pagini, sau TXT pentru o valoare pe linie.
CSV conține coloanele Tip, Valoare, Număr și Pagini. Codificarea UTF-8 suportă araba și alte scripturi. Valorile care ar putea fi interpretate ca formule de calcul tabelar sunt prefixate cu un apostrof pentru o importare mai sigură.
TXT și Copierea conțin doar valori, una pe linie. Toate rândurile care corespund filtrului sunt incluse, chiar și atunci când tabelul de pe ecran se întinde pe mai multe pagini de rezultate. Nu se creează niciun PDF nou, iar PDF-ul sursă rămâne neschimbat.
Procesează un PDF în browserul tău, cu limite explicite și notificări de rezultate parțiale.
Încarcă un PDF de până la 50 MiB și 500 de pagini. Extragerea verifică până la 250.000 de caractere și 2.000 de potriviri pe pagină, 10 milioane de caractere și 20.000 de potriviri în total, și 2.000 de adnotări pe pagină. Un buget de 90 de secunde pentru extragere limitează rulările lungi. Documentele foarte complexe pot funcționa mai bine dacă sunt împărțite în fișiere mai mici.
Când se atinge o limită sau o pagină nu poate fi citită complet, rezultatele afișează o notificare, iar rulările limitate sau eșuate se exportă cu mențiunea parțial în numele fișierului. Paginile fără text selectabil sunt numărate separat. Utilizează OCR PDF pentru scanări doar cu imagini, apoi revino pentru a extrage textul recunoscut.
Conținutul PDF este procesat local în acest browser. Documentele încărcate nu sunt trimise către un server de extragere. Linkurile, adresele de e-mail și numerele de telefon găsite în interiorul PDF-ului nu sunt niciodată contactate automat.
Deschideți un PDF de până la 50 MB și 750 pagini. Limite suplimentare de ieșire, memorie și procesare se pot aplica documentelor complexe.
Procesarea are loc pe dispozitivul dvs. fără a încărca documentul. Descărcați rezultatul înainte de a închide pagina; păstrați originalul separat.
Știți la ce să vă așteptați înainte de a începe.
Pe dispozitivul tăuAlegeți tipurile de date de care aveți nevoie: e-mailuri, numere de telefon, URL-uri, date numerice, adrese IPv4, domenii, DOI, ISBN, hashtag-uri și adrese MAC. Examinați valorile extrase cu numărătoarea și referințele paginilor. Aceasta extrage valori recunoscute, nu tabele, facturi sau câmpuri semantice. Modelele și sumele de control reduc zgomotul, dar nu garantează completitudinea și nici nu dovedesc că un identificator este autentic.
Sunt citite doar textul selectabil și țintele de link recunoscute. Paginile care conțin doar imagini necesită mai întâi OCR pentru PDF. Rulați OCR, descărcați PDF-ul care poate fi căutat, apoi reveniți la acest extractor.
Eliminarea duplicatelor combină valorile echivalente recunoscute. Coloana Count afișează aparițiile detectate, iar Pages listează pozițiile fizice ale paginilor din PDF. Dezactivați opțiunea pentru a păstra aparițiile separate. O țintă tipărită și un link clicabil corespondent pe aceeași pagină nu sunt numărate dublu.
CSV include tipul, valoarea, numărul de apariții și referințele paginilor. TXT și Copy all oferă doar valorile, una pe linie. Toate rândurile care corespund filtrului curent sunt incluse, nu doar pagina vizibilă a tabelului.
Nu. Analiza, potrivirea și exporturile PDF rulează în acest browser. PDF-ul original rămâne neschimbat. Niciun link, e-mail sau număr de telefon extras nu este contactat automat.
Un PDF de până la 50 MiB și 500 de pagini. Extracția este limitată la 250.000 de caractere text și 2.000 de potriviri pe pagină, 10 milioane de caractere și 20.000 de potriviri în total, și 2.000 de adnotări pe pagină. Rezultatele conțin o notificare dacă limitele sau paginile ilizibile le fac parțiale.
TUTORIAL VIDEO RAPID
Cum să extragi date structurate dintr-un PDF
Colectează contacte și identificatori de cercetare într-o singură listă organizată.
Narațiune în engleză
Urmărește videoclipul