Raccogli identificatori
Raccogli valori DOI e ISBN con le pagine in cui appaiono.
Trova i dati di cui hai bisogno. Mantieni la pagina di origine con ogni risultato.
| Tipo | Valore | Conteggio | Pagine |
|---|
La copia e il download includono tutte le righe corrispondenti in ogni pagina dei risultati. Il CSV include conteggi e numeri di pagina del PDF; il TXT contiene solo i valori.
Seleziona un numero di pagina nei Risultati per verificarne la fonte. Le evidenziazioni mostrano le posizioni approssimative.
Il tuo elenco è pronto. Scaricalo o torna indietro per rivedere e cambiare il formato.
Carica un documento con testo selezionabile o prova il campione.
Seleziona Estrai. Rivedi valori, conteggi e pagine sorgente; filtra o ordina l'elenco.
Copia i valori o scarica il CSV con i riferimenti di pagina o un semplice elenco TXT.
Scegli i tipi di dati di cui hai bisogno: email, numeri di telefono, URL, date numeriche, indirizzi IPv4, domini, DOI, ISBN, hashtag e indirizzi MAC. Controlla i valori estratti con conteggi e riferimenti di pagina.
Raccogli valori DOI e ISBN con le pagine in cui appaiono.
Trova voci datate e indirizzi IPv4.
Combina email, numeri di telefono e link web in un unico export strutturato.
Inizia con email, telefoni e URL, quindi apri Altri tipi di dati per valori specializzati.
Le date devono utilizzare un formato numerico con un anno a quattro cifre; i valori giorno/mese ambigui mantengono l'ordine di origine. Gli ottetti IPv4 sono convalidati; IPv6 non è incluso.
I domini sono derivati da email e link web riconosciuti, non da nomi di file arbitrari. L'estrazione DOI copre le comuni forme DOI moderne, non ogni forma storica. I valori ISBN-13 necessitano di un checksum valido; ISBN-10 necessita anche di un'etichetta ISBN. Gli hashtag possono contenere lettere Unicode, incluso l'arabo.
Gli indirizzi MAC utilizzano sei coppie separate da due punti o trattini. Lo strumento non contatta mai gli indirizzi o gli identificatori estratti.
Controlla i conteggi, salta a una pagina del PDF e filtra l'elenco dei risultati.
Ogni risultato registra la posizione fisica della pagina nel PDF, che può differire dai numeri di pagina stampati. Seleziona una scheda pagina per aprire l'anteprima con un'evidenziazione approssimativa.
La rimozione dei duplicati è attiva per impostazione predefinita. I conteggi combinano le ripetizioni riconosciute dello stesso valore; disattivala per vedere le occorrenze separate. L'ordinamento alfabetico modifica l'ordine dell'elenco. Il filtraggio si applica alla copia e ai download, oltre che alle righe visibili.
Scegli CSV per conteggi e pagine, o TXT per un valore per riga.
Il CSV contiene le colonne Tipo, Valore, Conteggio e Pagine. La codifica UTF-8 supporta l'arabo e altri script. I valori che potrebbero essere interpretati come formule di fogli di calcolo sono preceduti da un apostrofo per un'importazione più sicura.
TXT e Copia contengono solo valori, uno per riga. Tutte le righe che corrispondono al filtro sono incluse, anche quando la tabella sullo schermo si estende su diverse pagine di risultati. Non viene creato alcun nuovo PDF e il PDF di origine rimane invariato.
Elabora un PDF nel tuo browser, con limiti espliciti e avvisi di risultati parziali.
Carica un PDF fino a 50 MiB e 500 pagine. L'estrazione controlla fino a 250.000 caratteri e 2.000 corrispondenze per pagina, 10 milioni di caratteri e 20.000 corrispondenze in totale, e 2.000 annotazioni per pagina. Un budget di estrazione di 90 secondi limita le esecuzioni prolungate. I documenti molto complessi potrebbero funzionare meglio se suddivisi in file più piccoli.
Quando viene raggiunto un limite o una pagina non può essere letta completamente, i risultati mostrano un avviso e le esecuzioni limitate o fallite vengono esportate con partial nel nome del file. Le pagine senza testo selezionabile vengono conteggiate separatamente. Usa l'OCR PDF per scansioni solo immagine, quindi torna per estrarre il testo riconosciuto.
Il contenuto del PDF viene elaborato localmente in questo browser. I documenti caricati non vengono inviati a un server di estrazione. Link, indirizzi email e numeri di telefono trovati all'interno del PDF non vengono mai contattati automaticamente.
Apri un PDF fino a 50 MB e 750 pagine. Limiti aggiuntivi di output, memoria ed elaborazione possono essere applicati a documenti complessi.
L'elaborazione avviene sul tuo dispositivo senza caricare il documento. Scarica il risultato prima di chiudere la pagina; conserva l'originale separatamente.
Sappi cosa aspettarti prima di iniziare.
Sul tuo dispositivoScegli i tipi di dati di cui hai bisogno: email, numeri di telefono, URL, date numeriche, indirizzi IPv4, domini, DOI, ISBN, hashtag e indirizzi MAC. Esamina i valori estratti con conteggi e riferimenti alle pagine. Questo strumento estrae valori riconoscibili, non tabelle, fatture o campi semantici. Modelli e checksum riducono il rumore ma non garantiscono la completezza né provano che un identificatore sia autentico.
Vengono letti solo il testo selezionabile e i target di link riconosciuti. Le pagine composte solo da immagini necessitano prima di un OCR PDF. Esegui l'OCR, scarica il PDF ricercabile, quindi torna a questo estrattore.
La rimozione dei duplicati combina i valori equivalenti riconosciuti. Il conteggio mostra le occorrenze rilevate e Pagine elenca le posizioni fisiche delle pagine PDF. Disabilita l'opzione per mantenere separate le occorrenze. Un target stampato e un link cliccabile corrispondente sulla stessa pagina non vengono conteggiati due volte.
Il CSV include tipo, valore, conteggio delle occorrenze e riferimenti alle pagine. TXT e Copia tutto forniscono solo i valori, uno per riga. Tutte le righe che corrispondono al filtro corrente sono incluse, non solo la pagina della tabella visibile.
No. L'analisi, la corrispondenza e l'esportazione del PDF avvengono in questo browser. Il PDF originale rimane invariato. Nessun link, email o numero di telefono estratto viene contattato automaticamente.
Un PDF fino a 50 MiB e 500 pagine. L'estrazione è limitata a 250.000 caratteri di testo e 2.000 corrispondenze per pagina, 10 milioni di caratteri e 20.000 corrispondenze in totale, e 2.000 annotazioni per pagina. I risultati riportano un avviso se i limiti o le pagine illeggibili li rendono parziali.
VIDEO TUTORIAL RAPIDO
Come estrarre dati strutturati da un PDF
Raccogli contatti e identificatori di ricerca in un unico elenco organizzato.
Narrazione in inglese
Guarda il video