Instrumente150

O sarcină PDF utilă, simplificată

Extrage date dintr-un PDF.

Găsește datele de care ai nevoie. Păstrează pagina sursă pentru fiecare rezultat.

Advertisements
Spațiul dvs. de lucru PDF
Pe dispozitivul tău
sau plasați fișierele aici
PDF-ul tău este procesat în acest browser. PDF
Advertisements

Cum să extragi date dintr-un PDF

  1. 01

    Alege un PDF

    Încarcă un document cu text selectabil sau încearcă exemplul.

  2. 02

    Extrage și verifică

    Selectează Extrage. Verifică valorile, numărătorile și paginile sursă; filtrează sau sortează lista.

  3. 03

    Copiază sau descarcă

    Copiază valorile sau descarcă CSV cu referințe de pagină ori o listă TXT simplă.

BlogCum să extragi date structurate dintr-un PDFCitește ghidul

Extrage valori structurate dintr-un PDF în CSV sau text

Alege tipurile de date de care ai nevoie: e-mailuri, numere de telefon, URL-uri, date numerice, adrese IPv4, domenii, DOI, ISBN, hashtag-uri și adrese MAC. Verifică valorile extrase cu numărători și referințe la pagini.

Valorile recunoscute devin o listă cu referințe la paginile sursă.
TUTORIAL VIDEO RAPID Cum să extragi date structurate dintr-un PDF Colectează contacte și identificatori de cercetare într-o singură listă organizată. Narațiune în engleză Urmărește videoclipul

Cum să extragi date structurate dintr-un PDF

Când este util acest lucru?

Cercetare

Colectează identificatori

Adună valori DOI și ISBN împreună cu paginile în care apar.

Rapoarte

Extrage detalii numerice

Găsește intrări datate și adrese IPv4.

Directoare

Construiește o listă de contacte

Combină e-mailuri, telefoane și linkuri web într-o singură exportare structurată.

Funcționalități și controale

Selectează tipuri de date utile

Începe cu e-mailuri, telefoane și URL-uri, apoi deschide Mai multe tipuri de date pentru valori specializate.

Ce suportă recunoașterea

Datele trebuie să utilizeze un format numeric cu un an din patru cifre; valorile ambigue zi/lună își păstrează ordinea sursă. Octeții IPv4 sunt validați; IPv6 nu este inclus.

Domeniile sunt derivate din e-mailuri și linkuri web recunoscute, nu din nume de fișiere arbitrare. Extragerea DOI acoperă formele moderne comune de DOI, nu toate formele istorice. Valorile ISBN-13 necesită o sumă de control validă; ISBN-10 necesită, de asemenea, o etichetă ISBN. Hashtag-urile pot conține litere Unicode, inclusiv arabă.

Adresele MAC utilizează șase perechi separate prin două puncte sau cratimă. Instrumentul nu contactează niciodată adresele sau identificatorii extrași.

Revizuiește valorile cu paginile lor sursă

Verifică numărătoarea, sari la o pagină PDF și filtrează lista de rezultate.

Revizuiește și organizează

Fiecare rezultat înregistrează poziția fizică a paginii în PDF, care poate diferi de numerele paginilor imprimate. Selectează un cip de pagină pentru a deschide previzualizarea cu o evidențiere aproximativă.

Eliminarea duplicatelor este activată implicit. Numărătoarea combină repetițiile recunoscute ale aceleiași valori; dezactivează opțiunea pentru a vedea aparițiile separate. Sortarea alfabetică schimbă ordinea listei. Filtrarea se aplică atât copierii și descărcărilor, cât și rândurilor vizibile.

Copiază valorile sau descarcă o listă structurată

Alege CSV pentru numărători și pagini, sau TXT pentru o valoare pe linie.

Ce conține fiecare descărcare

CSV conține coloanele Tip, Valoare, Număr și Pagini. Codificarea UTF-8 suportă araba și alte scripturi. Valorile care ar putea fi interpretate ca formule de calcul tabelar sunt prefixate cu un apostrof pentru o importare mai sigură.

TXT și Copierea conțin doar valori, una pe linie. Toate rândurile care corespund filtrului sunt incluse, chiar și atunci când tabelul de pe ecran se întinde pe mai multe pagini de rezultate. Nu se creează niciun PDF nou, iar PDF-ul sursă rămâne neschimbat.

Păstrează extracțiile mari gestionabile

Procesează un PDF în browserul tău, cu limite explicite și notificări de rezultate parțiale.

Fișiere, limite și pagini scanate

Încarcă un PDF de până la 50 MiB și 500 de pagini. Extragerea verifică până la 250.000 de caractere și 2.000 de potriviri pe pagină, 10 milioane de caractere și 20.000 de potriviri în total, și 2.000 de adnotări pe pagină. Un buget de 90 de secunde pentru extragere limitează rulările lungi. Documentele foarte complexe pot funcționa mai bine dacă sunt împărțite în fișiere mai mici.

Când se atinge o limită sau o pagină nu poate fi citită complet, rezultatele afișează o notificare, iar rulările limitate sau eșuate se exportă cu mențiunea parțial în numele fișierului. Paginile fără text selectabil sunt numărate separat. Utilizează OCR PDF pentru scanări doar cu imagini, apoi revino pentru a extrage textul recunoscut.

Conținutul PDF este procesat local în acest browser. Documentele încărcate nu sunt trimise către un server de extragere. Linkurile, adresele de e-mail și numerele de telefon găsite în interiorul PDF-ului nu sunt niciodată contactate automat.

Fișiere și procesare acceptate

Intrare
PDF
Ieșire
CSV / TXT

Deschideți un PDF de până la 50 MB și 750 pagini. Limite suplimentare de ieșire, memorie și procesare se pot aplica documentelor complexe.

Procesarea are loc pe dispozitivul dvs. fără a încărca documentul. Descărcați rezultatul înainte de a închide pagina; păstrați originalul separat.

Advertisements
Întrebări frecvente

Câteva răspunsuri utile

Știți la ce să vă așteptați înainte de a începe.

Pe dispozitivul tău
Ce poate recunoaște acest instrument?

Alegeți tipurile de date de care aveți nevoie: e-mailuri, numere de telefon, URL-uri, date numerice, adrese IPv4, domenii, DOI, ISBN, hashtag-uri și adrese MAC. Examinați valorile extrase cu numărătoarea și referințele paginilor. Aceasta extrage valori recunoscute, nu tabele, facturi sau câmpuri semantice. Modelele și sumele de control reduc zgomotul, dar nu garantează completitudinea și nici nu dovedesc că un identificator este autentic.

Pot extrage date din PDF-uri scanate?

Sunt citite doar textul selectabil și țintele de link recunoscute. Paginile care conțin doar imagini necesită mai întâi OCR pentru PDF. Rulați OCR, descărcați PDF-ul care poate fi căutat, apoi reveniți la acest extractor.

Cum sunt gestionate duplicatele și numărătoarea?

Eliminarea duplicatelor combină valorile echivalente recunoscute. Coloana Count afișează aparițiile detectate, iar Pages listează pozițiile fizice ale paginilor din PDF. Dezactivați opțiunea pentru a păstra aparițiile separate. O țintă tipărită și un link clicabil corespondent pe aceeași pagină nu sunt numărate dublu.

Care este diferența dintre CSV și TXT?

CSV include tipul, valoarea, numărul de apariții și referințele paginilor. TXT și Copy all oferă doar valorile, una pe linie. Toate rândurile care corespund filtrului curent sunt incluse, nu doar pagina vizibilă a tabelului.

PDF-ul este încărcat pentru extragere?

Nu. Analiza, potrivirea și exporturile PDF rulează în acest browser. PDF-ul original rămâne neschimbat. Niciun link, e-mail sau număr de telefon extras nu este contactat automat.

Care sunt limitele?

Un PDF de până la 50 MiB și 500 de pagini. Extracția este limitată la 250.000 de caractere text și 2.000 de potriviri pe pagină, 10 milioane de caractere și 20.000 de potriviri în total, și 2.000 de adnotări pe pagină. Rezultatele conțin o notificare dacă limitele sau paginile ilizibile le fac parțiale.

Continuă

Ce ai dori să faci în continuare?

Alege un instrument. PDF-ul tău finalizat te însoțește.

PDF

Advertisements

Limba38

English العربية Français Italiano Deutsch Español Português Nederlands Русский Türkçe 日本語 中文 हिन्दी Bahasa Indonesia Bahasa Melayu 한국어 Tiếng Việt ไทย Polski Svenska Українська Norsk বাংলা Ελληνικά فارسی اردو Čeština Dansk Magyar Română Suomi Български Filipino ქართული Slovenčina Azərbaycanca עברית Slovenščina