Ferramentas150

UM GUIA PRÁTICO DE PDF

Como extrair dadosestruturados de um PDF

Colete contatos e identificadores de pesquisa em uma lista organizada.

Com e-mails, telefones, URLs, DOI, ISBN e IPv4 selecionados, a amostra de três páginas produz 11 linhas únicas a partir de 15 ocorrências.

Siga o guia
UM EXEMPLO REAL DA FERRAMENTA
Página do PDFUma página da amostra real do PDF
Valores extraídosValores e referências de página do download real do CSV
Seis tipos de dados selecionados produzem 11 linhas únicas no CSV real, incluindo entradas de DOI, ISBN e IPv4 na página 2.
Advertisements
TUTORIAL EM VÍDEO RÁPIDO Como extrair dados estruturados de um PDF Colete contatos e identificadores de pesquisa em uma lista organizada. Narração em inglês Assistir ao vídeo

Como extrair dados estruturados de um PDF

Advertisements

Abra Extrair dados de PDF para coletar valores de um PDF sem copiá-los linha por linha. A comparação usa o documento de amostra real e um CSV baixado da ferramenta. Com e-mails, telefones, URLs, DOI, ISBN e IPv4 selecionados, a amostra de três páginas produz 11 linhas únicas de 15 ocorrências.

01

Abra seu PDF

Envie um PDF ou selecione Experimentar amostra para seguir este exemplo. A visualização do PDF e as miniaturas das páginas aparecerão. Seu arquivo original permanece inalterado e a extração é executada no seu navegador.

Um diretório, relatório, artigo de pesquisa ou brochura baseado em texto é um ponto de partida útil. Digitalizações apenas de imagem precisam de OCR antes que seu texto impresso possa ser reconhecido.

02

Escolha as opções úteis

Em um telefone, abra Configurações. No desktop, use o painel de configurações ao lado da visualização.

Em O que extrair, e-mails, números de telefone e URLs começam selecionados. Abra Mais tipos de dados e selecione também DOI, ISBN e Endereços IPv4. Deixe a remoção de duplicatas ativada e escolha CSV.

03

Extraia e verifique as correspondências

Selecione Extrair. Quando o processamento terminar, a aba Resultados mostrará os valores, contagens de ocorrências e páginas de origem. Selecione um número de página circular para inspecionar sua localização na visualização do PDF, depois retorne aos Resultados.

A saída combina a lista de contatos com DOI 10.1000/182, ISBN 978-0-306-40615-7 e endereço IPv4 192.0.2.10 da página 2. A coluna Tipo identifica cada valor. Filtre por uma palavra ou identificador relevante antes de copiar ou baixar um subconjunto menor.

Use Filtrar resultados para restringir a lista. Copiar e baixar inclui todas as linhas correspondentes, mesmo quando a tabela de resultados abrange várias telas de linhas.

04

Baixe CSV ou TXT

Selecione Baixar CSV, depois use o botão principal Baixar na tela de pronto. O CSV contém colunas de Tipo, Valor, Contagem e Páginas. TXT e Copiar tudo contêm um valor por linha.

Valores CSV que poderiam ser interpretados como fórmulas de planilha são protegidos com um apóstrofo inicial. Por exemplo, um número de telefone internacional começa com um sinal de mais. Use TXT se precisar de uma lista simples sem proteção de planilha.

ALGUNS DETALHES ÚTEIS

Perguntas comuns

Isso extrai qualquer número ou todo identificador?

Não. Cada categoria selecionada tem suas próprias regras de reconhecimento. IPv6, porcentagens, preços e números de cartões de pagamento não são extraídos. Revise as correspondências em relação à fonte; a formatação válida não pode confirmar que um contato ou identificador existe.

O que devo fazer com um PDF digitalizado?

Execute PDF OCR primeiro, depois carregue a cópia reconhecida nesta ferramenta. Verifique a saída do OCR cuidadosamente: um caractere incorreto pode alterar um endereço ou identificador.

Quais são os limites de extração?

Use um PDF de até 50 MiB e 750 páginas. A extração é limitada a 20,000 correspondências no total e 2,000 por página, com um orçamento de processamento de 90 segundos. Limites de texto e anotação também se aplicam. Se um limite ou página ilegível interromper a digitalização, a ferramenta mostra um aviso de resultados parciais e marca o nome do arquivo de exportação como parcial.

Meus links de PDF são abertos automaticamente?

Não. A extração lê o arquivo no navegador e não visita os destinos extraídos. Os botões de página navegam dentro da visualização do PDF.

SUA VEZ

Mantenha os valores e seu contexto

Extraia uma lista focada, verifique as páginas de origem e baixe o formato que melhor se adapta ao seu próximo passo.

Abrir Extrair dados de PDF

Detalhe da imagem

Advertisements

Linguagem38

English العربية Français Italiano Deutsch Español Português Nederlands Русский Türkçe 日本語 中文 हिन्दी Bahasa Indonesia Bahasa Melayu 한국어 Tiếng Việt ไทย Polski Svenska Українська Norsk বাংলা Ελληνικά فارسی اردو Čeština Dansk Magyar Română Suomi Български Filipino ქართული Slovenčina Azərbaycanca עברית Slovenščina