Coletar identificadores
Reúna valores de DOI e ISBN com as páginas onde aparecem.
Encontre os dados de que você precisa. Mantenha a página de origem com cada resultado.
| Tipo | Valor | Contagem | Páginas |
|---|
Copiar e baixar inclui todas as linhas correspondentes em todas as páginas de resultados. O CSV inclui contagens e números de página do PDF; o TXT contém apenas valores.
Selecione um número de página nos Resultados para verificar sua origem. Os destaques mostram posições aproximadas.
Sua lista está pronta. Baixe-a ou volte para revisar e alterar o formato.
Carregue um documento com texto selecionável ou experimente o exemplo.
Selecione Extrair. Revise valores, contagens e páginas de origem; filtre ou ordene a lista.
Copie os valores ou baixe o CSV com referências de página ou uma lista TXT simples.
Escolha os tipos de dados de que você precisa: e-mails, números de telefone, URLs, datas numéricas, endereços IPv4, domínios, DOI, ISBN, hashtags e endereços MAC. Revise os valores extraídos com contagens e referências de página.
Reúna valores de DOI e ISBN com as páginas onde aparecem.
Encontre entradas datadas e endereços IPv4.
Combine e-mails, telefones e links da web em uma exportação estruturada.
Comece com e-mails, telefones e URLs, depois abra Mais tipos de dados para valores especializados.
As datas devem usar um formato numérico com um ano de quatro dígitos; valores ambíguos de dia/mês mantêm sua ordem de origem. Octetos IPv4 são validados; IPv6 não está incluído.
Domínios são derivados de e-mails e links da web reconhecidos, não de nomes de arquivo arbitrários. A extração de DOI cobre formas modernas comuns de DOI, não todas as formas históricas. Valores ISBN-13 precisam de um checksum válido; ISBN-10 também precisa de um rótulo ISBN. Hashtags podem conter letras Unicode, incluindo árabe.
Endereços MAC usam seis pares separados por dois-pontos ou hifens. A ferramenta nunca entra em contato com endereços ou identificadores extraídos.
Verifique contagens, pule para uma página do PDF e filtre a lista de resultados.
Cada resultado registra a posição física da página no PDF, que pode diferir dos números de página impressos. Selecione um chip de página para abrir a visualização com um destaque aproximado.
A remoção de duplicatas começa ativada. As contagens combinam repetições reconhecidas do mesmo valor; desative-a para ver ocorrências separadas. Ordenar alfabeticamente altera a ordem da lista. A filtragem aplica-se à cópia e aos downloads, bem como às linhas visíveis.
Escolha CSV para contagens e páginas, ou TXT para um valor por linha.
O CSV contém colunas de Tipo, Valor, Contagem e Páginas. A codificação UTF-8 suporta árabe e outros scripts. Valores que poderiam ser interpretados como fórmulas de planilha são prefixados com um apóstrofo para uma importação mais segura.
TXT e Copiar tudo contêm apenas valores, um por linha. Todas as linhas que correspondem ao filtro são incluídas, mesmo quando a tabela na tela abrange várias páginas de resultados. Nenhum novo PDF é criado e o PDF de origem permanece inalterado.
Processe um PDF no seu navegador, com limites explícitos e avisos de resultados parciais.
Carregue um PDF de até 50 MiB e 500 páginas. A extração verifica até 250.000 caracteres e 2.000 correspondências por página, 10 milhões de caracteres e 20.000 correspondências no total, e 2.000 anotações por página. Um orçamento de extração de 90 segundos limita execuções longas. Documentos muito complexos podem funcionar melhor quando divididos em arquivos menores.
Quando um limite é atingido ou uma página não pode ser totalmente lida, os resultados mostram um aviso e execuções limitadas ou com falha são exportadas com partial no nome do arquivo. Páginas sem texto selecionável são contadas separadamente. Use OCR de PDF para digitalizações apenas de imagem, depois retorne para extrair o texto reconhecido.
O conteúdo do PDF é processado localmente neste navegador. Documentos carregados não são enviados para um servidor de extração. Links, endereços de e-mail e números de telefone encontrados dentro do PDF nunca são contatados automaticamente.
Abra um PDF de até 50 MB e 750 páginas. Limites adicionais de saída, memória e processamento podem ser aplicados a documentos complexos.
O processamento ocorre no seu dispositivo sem enviar o documento. Baixe o resultado antes de fechar a página; mantenha o original separadamente.
Saiba o que esperar antes de começar.
No seu dispositivoEscolha os tipos de dados de que você precisa: e-mails, números de telefone, URLs, datas numéricas, endereços IPv4, domínios, DOI, ISBN, hashtags e endereços MAC. Revise os valores extraídos com contagens e referências de página. Isso extrai valores reconhecíveis, não tabelas, faturas ou campos semânticos. Padrões e somas de verificação reduzem o ruído, mas não garantem a integridade nem provam que um identificador é genuí genuíno.
Apenas texto selecionável e destinos de link reconhecidos são lidos. Páginas que contêm apenas imagens precisam de OCR em PDF primeiro. Execute o OCR, baixe o PDF pesquisável e, em seguida, retorne a este extrator.
A opção Remover duplicatas combina valores equivalentes reconhecidos. A contagem mostra as ocorrências detectadas e Páginas lista as posições físicas das páginas do PDF. Desative a opção para manter as ocorrências separadas. Um destino impresso e um link clicável correspondente na mesma página não são contados duas vezes.
O CSV inclui tipo, valor, contagem de ocorrências e referências de página. O TXT e a opção Copiar tudo fornecem apenas os valores, um por linha. Todas as linhas que correspondem ao filtro atual são incluídas, não apenas a página da tabela visível.
Não. A análise, correspondência e exportação de PDF são executadas neste navegador. O PDF original permanece inalterado. Nenhum link, e-mail ou número de telefone extraído é contatado automaticamente.
Um PDF de até 50 MiB e 500 páginas. A extração é limitada a 250.000 caracteres de texto e 2.000 correspondências por página, 10 milhões de caracteres e 20.000 correspondências no total, e 2.000 anotações por página. Os resultados trazem um aviso se os limites ou páginas ilegíveis os tornarem parciais.
TUTORIAL EM VÍDEO RÁPIDO
Como extrair dados estruturados de um PDF
Colete contatos e identificadores de pesquisa em uma lista organizada.
Narração em inglês
Assistir ao vídeo