Herramientas150

UNA GUÍA PRÁCTICA DE PDF

Cómo extraer datosestructurados de un PDF

Recopila contactos e identificadores de investigación en una lista organizada.

Con correos electrónicos, teléfonos, URLs, DOI, ISBN e IPv4 seleccionados, la muestra de tres páginas produce 11 filas únicas a partir de 15 apariciones.

Seguir la guía
UN EJEMPLO REAL DE LA HERRAMIENTA
Página PDFUna página del PDF de muestra real
Valores extraídosValores y referencias de página de la descarga CSV real
Seis tipos de datos seleccionados producen 11 filas únicas en el CSV real, incluyendo entradas de DOI, ISBN e IPv4 en la página 2.
Advertisements
VIDEO TUTORIAL RÁPIDO Cómo extraer datos estructurados de un PDF Recopila contactos e identificadores de investigación en una lista organizada. Narración en inglés Ver el video

Cómo extraer datos estructurados de un PDF

Advertisements

Abre Extraer datos de un PDF para recopilar valores de un PDF sin tener que copiarlos línea por línea. La comparación utiliza el documento de muestra real y un CSV descargado de la herramienta. Con correos electrónicos, teléfonos, URLs, DOI, ISBN e IPv4 seleccionados, la muestra de tres páginas produce 11 filas únicas de 15 ocurrencias.

01

Abre tu PDF

Sube un PDF o selecciona Probar muestra para seguir este ejemplo. Aparecerán la vista previa del PDF y las miniaturas de las páginas. Tu archivo original permanece sin cambios y la extracción se ejecuta en tu navegador.

Un directorio, informe, documento de investigación o folleto basado en texto es un punto de partida útil. Los escaneos que solo contienen imágenes necesitan OCR antes de que su texto impreso pueda ser reconocido.

02

Elige las opciones útiles

En un teléfono, abre Configuración. En el escritorio, utiliza el panel de configuración junto a la vista previa.

En Qué extraer, los correos electrónicos, números de teléfono y URLs vienen seleccionados por defecto. Abre Más tipos de datos y selecciona también DOI, ISBN y direcciones IPv4. Deja activada la eliminación de duplicados y elige CSV.

03

Extrae y comprueba las coincidencias

Selecciona Extraer. Cuando finalice el procesamiento, la pestaña Resultados mostrará los valores, los recuentos de ocurrencias y las páginas de origen. Selecciona un número de página circular para inspeccionar su ubicación en la vista previa del PDF, luego vuelve a Resultados.

El resultado combina la lista de contactos con DOI 10.1000/182, ISBN 978-0-306-40615-7 y la dirección IPv4 192.0.2.10 de la página 2. La columna Tipo identifica cada valor. Filtra por una palabra o identificador relevante antes de copiar o descargar un subconjunto más pequeño.

Usa Filtrar resultados para acotar la lista. Copiar y descargar incluye todas las filas coincidentes, incluso cuando la tabla de resultados abarca varias pantallas de filas.

04

Descarga CSV o TXT

Selecciona Descargar CSV, luego usa el botón principal Descargar en la pantalla de resultados. El CSV contiene las columnas Tipo, Valor, Recuento y Páginas. TXT y Copiar todo contienen un valor por línea.

Los valores CSV que podrían interpretarse como fórmulas de hoja de cálculo están protegidos con un apóstrofe inicial. Por ejemplo, un número de teléfono internacional comienza con un signo más. Usa TXT si necesitas una lista simple sin protección de hoja de cálculo.

ALGUNOS DETALLES ÚTILES

Preguntas comunes

¿Esto extrae cualquier número o cada identificador?

No. Cada categoría seleccionada tiene sus propias reglas de reconocimiento. Las direcciones IPv6, porcentajes, precios y números de tarjetas de pago no se extraen. Revisa las coincidencias con el origen; el formato válido no puede confirmar que un contacto o identificador exista.

¿Qué debo hacer con un PDF escaneado?

Ejecuta PDF OCR primero, luego carga la copia reconocida en esta herramienta. Revisa cuidadosamente la salida del OCR: un carácter erróneo puede cambiar una dirección o un identificador.

¿Cuáles son los límites de extracción?

Usa un PDF de hasta 50 MiB y 750 páginas. La extracción está limitada a 20,000 coincidencias en total y 2,000 por página, con un presupuesto de procesamiento de 90 segundos. También se aplican límites de texto y anotaciones. Si un límite o una página ilegible interrumpe el escaneo, la herramienta muestra un aviso de resultados parciales y marca el nombre del archivo de exportación como parcial.

¿Se abren mis enlaces PDF automáticamente?

No. La extracción lee el archivo en el navegador y no visita los destinos extraídos. Los botones de página navegan dentro de la vista previa del PDF.

TU TURNO

Mantén los valores y su contexto

Extrae una lista enfocada, comprueba las páginas de origen y descarga el formato que mejor se adapte a tu siguiente paso.

Abrir Extraer datos de un PDF

Detalle de la imagen

Advertisements

Idioma38

English العربية Français Italiano Deutsch Español Português Nederlands Русский Türkçe 日本語 中文 हिन्दी Bahasa Indonesia Bahasa Melayu 한국어 Tiếng Việt ไทย Polski Svenska Українська Norsk বাংলা Ελληνικά فارسی اردو Čeština Dansk Magyar Română Suomi Български Filipino ქართული Slovenčina Azərbaycanca עברית Slovenščina