Strumenti150

Un'utile attività PDF, resa semplice

Estrarre link da PDF.

Estrai i link utili dal tuo PDF.

Advertisements
Il tuo spazio di lavoro PDF
Sul tuo dispositivo
o trascina qui i tuoi file
Il tuo PDF viene elaborato in questo browser. PDF
Advertisements

Come estrarre link da PDF

  1. 01

    Scegli un PDF

    Carica un documento con testo selezionabile o prova il campione.

  2. 02

    Estrai e rivedi

    Seleziona Estrai. Rivedi valori, conteggi e pagine sorgente; filtra o ordina l'elenco.

  3. 03

    Copia o scarica

    Copia i valori o scarica il CSV con i riferimenti di pagina o un semplice elenco TXT.

BlogCome estrarre link e URL da un PDFLeggi la guida

Estrarre link PDF senza aprire ogni pagina

Raccogli indirizzi HTTP/HTTPS stampati, indirizzi www e destinazioni di link web cliccabili da un PDF. Mantieni i riferimenti di pagina e scarica un elenco deduplicato come CSV o TXT.

I valori riconosciuti diventano un elenco con riferimenti alla pagina di origine.
VIDEO TUTORIAL RAPIDO Come estrarre link e URL da un PDF Conserva i link web utili senza aprirli uno per uno. Narrazione in inglese Guarda il video

Come estrarre link e URL da un PDF

Quando è utile?

Riferimenti

Raccogli link alle fonti

Crea un elenco di riferimenti da rapporti e documenti di ricerca.

Risorse

Salva destinazioni utili

Estrai le destinazioni dietro le etichette di risorse cliccabili.

Revisione

Mantieni un elenco di controllo

Registra dove è stato trovato ogni link prima di esaminarlo altrove.

Funzionalità e controlli

Trova link visibili e cliccabili

Includi una destinazione del link anche quando l'etichetta dice solo “Leggi tutto”.

Come funziona l'estrazione dei link

I link stampati che iniziano con http://, https:// o www. vengono riconosciuti. Le annotazioni dei link PDF possono anche rivelare destinazioni HTTP/HTTPS dietro testo ordinario. Il PDF non deve necessariamente visualizzare l'URL come etichetta cliccabile.

Destinazioni stampate e annotazioni identiche su una pagina non vengono conteggiate due volte. Per il confronto dei duplicati vengono utilizzate forme URL normalizzate, mentre viene visualizzata la prima grafia riconosciuta. Gli URL lunghi, a capo o danneggiati potrebbero richiedere una correzione manuale. Nessun URL estratto viene recuperato automaticamente.

Revisiona i valori con le loro pagine di origine

Controlla i conteggi, salta a una pagina del PDF e filtra l'elenco dei risultati.

Revisiona e organizza

Ogni risultato registra la posizione fisica della pagina nel PDF, che può differire dai numeri di pagina stampati. Seleziona una scheda pagina per aprire l'anteprima con un'evidenziazione approssimativa.

La rimozione dei duplicati è attiva per impostazione predefinita. I conteggi combinano le ripetizioni riconosciute dello stesso valore; disattivala per vedere le occorrenze separate. L'ordinamento alfabetico modifica l'ordine dell'elenco. Il filtraggio si applica alla copia e ai download, oltre che alle righe visibili.

Copia i valori o scarica un elenco strutturato

Scegli CSV per conteggi e pagine, o TXT per un valore per riga.

Cosa contiene ogni download

Il CSV contiene le colonne Tipo, Valore, Conteggio e Pagine. La codifica UTF-8 supporta l'arabo e altri script. I valori che potrebbero essere interpretati come formule di fogli di calcolo sono preceduti da un apostrofo per un'importazione più sicura.

TXT e Copia contengono solo valori, uno per riga. Tutte le righe che corrispondono al filtro sono incluse, anche quando la tabella sullo schermo si estende su diverse pagine di risultati. Non viene creato alcun nuovo PDF e il PDF di origine rimane invariato.

Mantieni gestibili le grandi estrazioni

Elabora un PDF nel tuo browser, con limiti espliciti e avvisi di risultati parziali.

File, limiti e pagine scansionate

Carica un PDF fino a 50 MiB e 500 pagine. L'estrazione controlla fino a 250.000 caratteri e 2.000 corrispondenze per pagina, 10 milioni di caratteri e 20.000 corrispondenze in totale, e 2.000 annotazioni per pagina. Un budget di estrazione di 90 secondi limita le esecuzioni prolungate. I documenti molto complessi potrebbero funzionare meglio se suddivisi in file più piccoli.

Quando viene raggiunto un limite o una pagina non può essere letta completamente, i risultati mostrano un avviso e le esecuzioni limitate o fallite vengono esportate con partial nel nome del file. Le pagine senza testo selezionabile vengono conteggiate separatamente. Usa l'OCR PDF per scansioni solo immagine, quindi torna per estrarre il testo riconosciuto.

Il contenuto del PDF viene elaborato localmente in questo browser. I documenti caricati non vengono inviati a un server di estrazione. Link, indirizzi email e numeri di telefono trovati all'interno del PDF non vengono mai contattati automaticamente.

File supportati ed elaborazione

Input
PDF
Output
CSV / TXT

Apri un PDF fino a 50 MB e 750 pagine. Limiti aggiuntivi di output, memoria ed elaborazione possono essere applicati a documenti complessi.

L'elaborazione avviene sul tuo dispositivo senza caricare il documento. Scarica il risultato prima di chiudere la pagina; conserva l'originale separatamente.

Advertisements
FAQ

Alcune risposte utili

Sappi cosa aspettarti prima di iniziare.

Sul tuo dispositivo
Cosa può riconoscere questo strumento?

Raccogli indirizzi HTTP/HTTPS stampati, indirizzi www e target di link web cliccabili da un PDF. Mantieni i riferimenti alle pagine e scarica un elenco deduplicato come CSV o TXT. Lo strumento non verifica se i link funzionano ancora. Le destinazioni di pagina interne, le azioni JavaScript, mailto e altri schemi non web non vengono esportati come link web.

Posso estrarre dati da PDF scansionati?

Vengono letti solo il testo selezionabile e i target di link riconosciuti. Le pagine composte solo da immagini necessitano prima di un OCR PDF. Esegui l'OCR, scarica il PDF ricercabile, quindi torna a questo estrattore.

Come vengono gestiti duplicati e conteggi?

La rimozione dei duplicati combina i valori equivalenti riconosciuti. Il conteggio mostra le occorrenze rilevate e Pagine elenca le posizioni fisiche delle pagine PDF. Disabilita l'opzione per mantenere separate le occorrenze. Un target stampato e un link cliccabile corrispondente sulla stessa pagina non vengono conteggiati due volte.

Qual è la differenza tra CSV e TXT?

Il CSV include tipo, valore, conteggio delle occorrenze e riferimenti alle pagine. TXT e Copia tutto forniscono solo i valori, uno per riga. Tutte le righe che corrispondono al filtro corrente sono incluse, non solo la pagina della tabella visibile.

Il PDF viene caricato per l'estrazione?

No. L'analisi, la corrispondenza e l'esportazione del PDF avvengono in questo browser. Il PDF originale rimane invariato. Nessun link, email o numero di telefono estratto viene contattato automaticamente.

Quali sono i limiti?

Un PDF fino a 50 MiB e 500 pagine. L'estrazione è limitata a 250.000 caratteri di testo e 2.000 corrispondenze per pagina, 10 milioni di caratteri e 20.000 corrispondenze in totale, e 2.000 annotazioni per pagina. I risultati riportano un avviso se i limiti o le pagine illeggibili li rendono parziali.

Continua

Cosa vorresti fare dopo?

Scegli uno strumento. Il tuo PDF finito ti seguirà.

PDF

Advertisements

Lingua38

English العربية Français Italiano Deutsch Español Português Nederlands Русский Türkçe 日本語 中文 हिन्दी Bahasa Indonesia Bahasa Melayu 한국어 Tiếng Việt ไทย Polski Svenska Українська Norsk বাংলা Ελληνικά فارسی اردو Čeština Dansk Magyar Română Suomi Български Filipino ქართული Slovenčina Azərbaycanca עברית Slovenščina