Coletar links de fontes
Crie uma lista de referências a partir de relatórios e documentos de pesquisa.
Extraia os links úteis do seu PDF.
| Tipo | Valor | Contagem | Páginas |
|---|
Copiar e baixar inclui todas as linhas correspondentes em todas as páginas de resultados. O CSV inclui contagens e números de página do PDF; o TXT contém apenas valores.
Selecione um número de página nos Resultados para verificar sua origem. Os destaques mostram posições aproximadas.
Sua lista está pronta. Baixe-a ou volte para revisar e alterar o formato.
Carregue um documento com texto selecionável ou experimente o exemplo.
Selecione Extrair. Revise valores, contagens e páginas de origem; filtre ou ordene a lista.
Copie os valores ou baixe o CSV com referências de página ou uma lista TXT simples.
Colete endereços HTTP/HTTPS impressos, endereços www e destinos de links da web clicáveis de um PDF. Mantenha as referências de página e faça o Baixar de uma lista sem duplicatas em CSV ou TXT.
Crie uma lista de referências a partir de relatórios e documentos de pesquisa.
Extraia os destinos por trás de rótulos de recursos clicáveis.
Registre onde cada link foi encontrado antes de revisá-lo em outro lugar.
Inclua um destino de link mesmo quando o rótulo disser apenas “Leia mais”.
Links impressos começando com http://, https:// ou www. são reconhecidos. Anotações de link em PDF também podem revelar destinos HTTP/HTTPS atrás de texto comum. O PDF não precisa exibir a URL como seu rótulo clicável.
Destinos impressos e anotações idênticos em uma página não são contados duas vezes. Formas de URL normalizadas são usadas para comparação de duplicatas, enquanto a primeira grafia reconhecida é exibida. URLs longas, quebradas ou danificadas podem precisar de correção manual. Nenhuma URL extraída é buscada automaticamente.
Verifique contagens, pule para uma página do PDF e filtre a lista de resultados.
Cada resultado registra a posição física da página no PDF, que pode diferir dos números de página impressos. Selecione um chip de página para abrir a visualização com um destaque aproximado.
A remoção de duplicatas começa ativada. As contagens combinam repetições reconhecidas do mesmo valor; desative-a para ver ocorrências separadas. Ordenar alfabeticamente altera a ordem da lista. A filtragem aplica-se à cópia e aos downloads, bem como às linhas visíveis.
Escolha CSV para contagens e páginas, ou TXT para um valor por linha.
O CSV contém colunas de Tipo, Valor, Contagem e Páginas. A codificação UTF-8 suporta árabe e outros scripts. Valores que poderiam ser interpretados como fórmulas de planilha são prefixados com um apóstrofo para uma importação mais segura.
TXT e Copiar tudo contêm apenas valores, um por linha. Todas as linhas que correspondem ao filtro são incluídas, mesmo quando a tabela na tela abrange várias páginas de resultados. Nenhum novo PDF é criado e o PDF de origem permanece inalterado.
Processe um PDF no seu navegador, com limites explícitos e avisos de resultados parciais.
Carregue um PDF de até 50 MiB e 500 páginas. A extração verifica até 250.000 caracteres e 2.000 correspondências por página, 10 milhões de caracteres e 20.000 correspondências no total, e 2.000 anotações por página. Um orçamento de extração de 90 segundos limita execuções longas. Documentos muito complexos podem funcionar melhor quando divididos em arquivos menores.
Quando um limite é atingido ou uma página não pode ser totalmente lida, os resultados mostram um aviso e execuções limitadas ou com falha são exportadas com partial no nome do arquivo. Páginas sem texto selecionável são contadas separadamente. Use OCR de PDF para digitalizações apenas de imagem, depois retorne para extrair o texto reconhecido.
O conteúdo do PDF é processado localmente neste navegador. Documentos carregados não são enviados para um servidor de extração. Links, endereços de e-mail e números de telefone encontrados dentro do PDF nunca são contatados automaticamente.
Abra um PDF de até 50 MB e 750 páginas. Limites adicionais de saída, memória e processamento podem ser aplicados a documentos complexos.
O processamento ocorre no seu dispositivo sem enviar o documento. Baixe o resultado antes de fechar a página; mantenha o original separadamente.
Saiba o que esperar antes de começar.
No seu dispositivoColete endereços HTTP/HTTPS impressos, endereços www e destinos de links da web clicáveis de um PDF. Mantenha as referências de página e baixe uma lista deduplicada como CSV ou TXT. A ferramenta não verifica se os links ainda funcionam. Destinos de página internos, ações JavaScript, mailto e outros esquemas que não sejam da web não são exportados como links da web.
Apenas texto selecionável e destinos de link reconhecidos são lidos. Páginas que contêm apenas imagens precisam de OCR em PDF primeiro. Execute o OCR, baixe o PDF pesquisável e, em seguida, retorne a este extrator.
A opção Remover duplicatas combina valores equivalentes reconhecidos. A contagem mostra as ocorrências detectadas e Páginas lista as posições físicas das páginas do PDF. Desative a opção para manter as ocorrências separadas. Um destino impresso e um link clicável correspondente na mesma página não são contados duas vezes.
O CSV inclui tipo, valor, contagem de ocorrências e referências de página. O TXT e a opção Copiar tudo fornecem apenas os valores, um por linha. Todas as linhas que correspondem ao filtro atual são incluídas, não apenas a página da tabela visível.
Não. A análise, correspondência e exportação de PDF são executadas neste navegador. O PDF original permanece inalterado. Nenhum link, e-mail ou número de telefone extraído é contatado automaticamente.
Um PDF de até 50 MiB e 500 páginas. A extração é limitada a 250.000 caracteres de texto e 2.000 correspondências por página, 10 milhões de caracteres e 20.000 correspondências no total, e 2.000 anotações por página. Os resultados trazem um aviso se os limites ou páginas ilegíveis os tornarem parciais.
TUTORIAL EM VÍDEO RÁPIDO
Como extrair links e URLs de um PDF
Mantenha os links da web úteis sem abri-los um por um.
Narração em inglês
Assistir ao vídeo