Ferramentas150

Uma tarefa de PDF útil, simplificada

Extrair dados de PDF.

Encontre os dados de que você precisa. Mantenha a página de origem com cada resultado.

Advertisements
Seu espaço de trabalho de PDF
No seu dispositivo
ou largue os seus ficheiros aqui
Seu PDF é processado neste navegador. PDF
Advertisements

Como extrair dados de PDF

  1. 01

    Escolha um PDF

    Carregue um documento com texto selecionável ou experimente o exemplo.

  2. 02

    Extrair e revisar

    Selecione Extrair. Revise valores, contagens e páginas de origem; filtre ou ordene a lista.

  3. 03

    Copiar ou baixar

    Copie os valores ou baixe o CSV com referências de página ou uma lista TXT simples.

BlogComo extrair dados estruturados de um PDFLer o guia

Extrair valores estruturados de um PDF para CSV ou texto

Escolha os tipos de dados de que você precisa: e-mails, números de telefone, URLs, datas numéricas, endereços IPv4, domínios, DOI, ISBN, hashtags e endereços MAC. Revise os valores extraídos com contagens e referências de página.

Os valores reconhecidos tornam-se uma lista com referências à página de origem.
TUTORIAL EM VÍDEO RÁPIDO Como extrair dados estruturados de um PDF Colete contatos e identificadores de pesquisa em uma lista organizada. Narração em inglês Assistir ao vídeo

Como extrair dados estruturados de um PDF

Quando isso é útil?

Pesquisa

Coletar identificadores

Reúna valores de DOI e ISBN com as páginas onde aparecem.

Relatórios

Extrair detalhes numéricos

Encontre entradas datadas e endereços IPv4.

Diretórios

Crie uma lista de contatos

Combine e-mails, telefones e links da web em uma exportação estruturada.

Recursos e controles

Selecione tipos de dados úteis

Comece com e-mails, telefones e URLs, depois abra Mais tipos de dados para valores especializados.

O que os reconhecedores suportam

As datas devem usar um formato numérico com um ano de quatro dígitos; valores ambíguos de dia/mês mantêm sua ordem de origem. Octetos IPv4 são validados; IPv6 não está incluído.

Domínios são derivados de e-mails e links da web reconhecidos, não de nomes de arquivo arbitrários. A extração de DOI cobre formas modernas comuns de DOI, não todas as formas históricas. Valores ISBN-13 precisam de um checksum válido; ISBN-10 também precisa de um rótulo ISBN. Hashtags podem conter letras Unicode, incluindo árabe.

Endereços MAC usam seis pares separados por dois-pontos ou hifens. A ferramenta nunca entra em contato com endereços ou identificadores extraídos.

Revise os valores com suas páginas de origem

Verifique contagens, pule para uma página do PDF e filtre a lista de resultados.

Revise e organize

Cada resultado registra a posição física da página no PDF, que pode diferir dos números de página impressos. Selecione um chip de página para abrir a visualização com um destaque aproximado.

A remoção de duplicatas começa ativada. As contagens combinam repetições reconhecidas do mesmo valor; desative-a para ver ocorrências separadas. Ordenar alfabeticamente altera a ordem da lista. A filtragem aplica-se à cópia e aos downloads, bem como às linhas visíveis.

Copie valores ou baixe uma lista estruturada

Escolha CSV para contagens e páginas, ou TXT para um valor por linha.

O que cada download contém

O CSV contém colunas de Tipo, Valor, Contagem e Páginas. A codificação UTF-8 suporta árabe e outros scripts. Valores que poderiam ser interpretados como fórmulas de planilha são prefixados com um apóstrofo para uma importação mais segura.

TXT e Copiar tudo contêm apenas valores, um por linha. Todas as linhas que correspondem ao filtro são incluídas, mesmo quando a tabela na tela abrange várias páginas de resultados. Nenhum novo PDF é criado e o PDF de origem permanece inalterado.

Mantenha grandes extrações gerenciáveis

Processe um PDF no seu navegador, com limites explícitos e avisos de resultados parciais.

Arquivos, limites e páginas digitalizadas

Carregue um PDF de até 50 MiB e 500 páginas. A extração verifica até 250.000 caracteres e 2.000 correspondências por página, 10 milhões de caracteres e 20.000 correspondências no total, e 2.000 anotações por página. Um orçamento de extração de 90 segundos limita execuções longas. Documentos muito complexos podem funcionar melhor quando divididos em arquivos menores.

Quando um limite é atingido ou uma página não pode ser totalmente lida, os resultados mostram um aviso e execuções limitadas ou com falha são exportadas com partial no nome do arquivo. Páginas sem texto selecionável são contadas separadamente. Use OCR de PDF para digitalizações apenas de imagem, depois retorne para extrair o texto reconhecido.

O conteúdo do PDF é processado localmente neste navegador. Documentos carregados não são enviados para um servidor de extração. Links, endereços de e-mail e números de telefone encontrados dentro do PDF nunca são contatados automaticamente.

Arquivos suportados e processamento

Entrada
PDF
Saída
CSV / TXT

Abra um PDF de até 50 MB e 750 páginas. Limites adicionais de saída, memória e processamento podem ser aplicados a documentos complexos.

O processamento ocorre no seu dispositivo sem enviar o documento. Baixe o resultado antes de fechar a página; mantenha o original separadamente.

Advertisements
Perguntas frequentes

Algumas respostas úteis

Saiba o que esperar antes de começar.

No seu dispositivo
O que esta ferramenta pode reconhecer?

Escolha os tipos de dados de que você precisa: e-mails, números de telefone, URLs, datas numéricas, endereços IPv4, domínios, DOI, ISBN, hashtags e endereços MAC. Revise os valores extraídos com contagens e referências de página. Isso extrai valores reconhecíveis, não tabelas, faturas ou campos semânticos. Padrões e somas de verificação reduzem o ruído, mas não garantem a integridade nem provam que um identificador é genuí genuíno.

Posso extrair dados de PDFs digitalizados?

Apenas texto selecionável e destinos de link reconhecidos são lidos. Páginas que contêm apenas imagens precisam de OCR em PDF primeiro. Execute o OCR, baixe o PDF pesquisável e, em seguida, retorne a este extrator.

Como as duplicatas e contagens são tratadas?

A opção Remover duplicatas combina valores equivalentes reconhecidos. A contagem mostra as ocorrências detectadas e Páginas lista as posições físicas das páginas do PDF. Desative a opção para manter as ocorrências separadas. Um destino impresso e um link clicável correspondente na mesma página não são contados duas vezes.

Qual é a diferença entre CSV e TXT?

O CSV inclui tipo, valor, contagem de ocorrências e referências de página. O TXT e a opção Copiar tudo fornecem apenas os valores, um por linha. Todas as linhas que correspondem ao filtro atual são incluídas, não apenas a página da tabela visível.

O PDF é carregado para extração?

Não. A análise, correspondência e exportação de PDF são executadas neste navegador. O PDF original permanece inalterado. Nenhum link, e-mail ou número de telefone extraído é contatado automaticamente.

Quais são os limites?

Um PDF de até 50 MiB e 500 páginas. A extração é limitada a 250.000 caracteres de texto e 2.000 correspondências por página, 10 milhões de caracteres e 20.000 correspondências no total, e 2.000 anotações por página. Os resultados trazem um aviso se os limites ou páginas ilegíveis os tornarem parciais.

Continuar

O que você gostaria de fazer a seguir?

Escolha uma ferramenta. Seu PDF finalizado vai com você.

PDF

Advertisements

Linguagem38

English العربية Français Italiano Deutsch Español Português Nederlands Русский Türkçe 日本語 中文 हिन्दी Bahasa Indonesia Bahasa Melayu 한국어 Tiếng Việt ไทย Polski Svenska Українська Norsk বাংলা Ελληνικά فارسی اردو Čeština Dansk Magyar Română Suomi Български Filipino ქართული Slovenčina Azərbaycanca עברית Slovenščina