Herramientas150

Una tarea de PDF útil, simplificada

Extraer datos de un PDF.

Encuentre los datos que necesita. Conserve la página de origen con cada resultado.

Advertisements
Tu espacio de trabajo PDF
En tu dispositivo
o suelta tus archivos aquí
Tu PDF se procesa en este navegador. PDF
Advertisements

Cómo extraer datos de un PDF

  1. 01

    Elige un PDF

    Carga un documento con texto seleccionable o prueba el ejemplo.

  2. 02

    Extraer y revisar

    Selecciona Extraer. Revisa valores, recuentos y páginas de origen; filtra o ordena la lista.

  3. 03

    Copiar o descargar

    Copia los valores o descarga un CSV con referencias de página o una lista TXT simple.

BlogCómo extraer datos estructurados de un PDFLeer la guía

Extraer valores estructurados de un PDF a CSV o texto

Elija los tipos de datos que necesita: correos electrónicos, números de teléfono, URL, fechas numéricas, direcciones IPv4, dominios, DOI, ISBN, hashtags y direcciones MAC. Revise los valores extraídos con recuentos y referencias de página.

Los valores reconocidos se convierten en una lista con referencias a la página de origen.
VIDEO TUTORIAL RÁPIDO Cómo extraer datos estructurados de un PDF Recopila contactos e identificadores de investigación en una lista organizada. Narración en inglés Ver el video

Cómo extraer datos estructurados de un PDF

¿Cuándo es útil esto?

Investigación

Recopilar identificadores

Recopile valores DOI e ISBN junto con las páginas donde aparecen.

Informes

Extraer detalles numéricos

Encuentre entradas con fecha y direcciones IPv4.

Directorios

Cree una lista de contactos

Combine correos electrónicos, teléfonos y enlaces web en una exportación estructurada.

Características y controles

Seleccione tipos de datos útiles

Comience con correos electrónicos, teléfonos y URL, luego abra Más tipos de datos para valores especializados.

Qué admiten los reconocedores

Las fechas deben usar un formato numérico con un año de cuatro dígitos; los valores ambiguos de día/mes conservan su orden de origen. Los octetos IPv4 se validan; IPv6 no está incluido.

Los dominios se derivan de correos electrónicos y enlaces web reconocidos, no de nombres de archivo arbitrarios. La extracción de DOI cubre las formas modernas comunes de DOI, no todas las formas históricas. Los valores ISBN-13 necesitan una suma de comprobación válida; ISBN-10 también necesita una etiqueta ISBN. Los hashtags pueden contener letras Unicode, incluido el árabe.

Las direcciones MAC utilizan seis pares separados por dos puntos o guiones. La herramienta nunca contacta las direcciones o identificadores extraídos.

Revise los valores con sus páginas de origen

Verifique los recuentos, salte a una página del PDF y filtre la lista de resultados.

Revise y organice

Cada resultado registra la posición física de la página en el PDF, que puede diferir de los números de página impresos. Seleccione una etiqueta de página para abrir la vista previa con un resaltado aproximado.

La eliminación de duplicados comienza activada. Los recuentos combinan las repeticiones reconocidas del mismo valor; desactívela para ver las apariciones por separado. Ordenar alfabéticamente cambia el orden de la lista. El filtrado se aplica tanto a la copia y descarga como a las filas visibles.

Copie valores o descargue una lista estructurada

Elija CSV para recuentos y páginas, o TXT para un valor por línea.

Qué contiene cada descarga

CSV contiene columnas de Tipo, Valor, Recuento y Páginas. La codificación UTF-8 admite árabe y otros scripts. Los valores que podrían interpretarse como fórmulas de hoja de cálculo tienen un apóstrofo como prefijo para una importación más segura.

TXT y Copiar todo contienen solo valores, uno por línea. Se incluyen todas las filas que coinciden con el filtro, incluso cuando la tabla en pantalla abarca varias páginas de resultados. No se crea ningún PDF nuevo y el PDF de origen no cambia.

Mantenga las extracciones grandes manejables

Procese un PDF en su navegador, con límites explícitos y avisos de resultados parciales.

Archivos, límites y páginas escaneadas

Cargue un PDF de hasta 50 MiB y 500 páginas. La extracción verifica hasta 250,000 caracteres y 2,000 coincidencias por página, 10 millones de caracteres y 20,000 coincidencias en total, y 2,000 anotaciones por página. Un presupuesto de extracción de 90 segundos limita las ejecuciones largas. Los documentos muy complejos pueden funcionar mejor cuando se dividen en archivos más pequeños.

Cuando se alcanza un límite o no se puede leer una página por completo, los resultados muestran un aviso y las ejecuciones limitadas o fallidas se exportan con parcial en el nombre del archivo. Las páginas sin texto seleccionable se cuentan por separado. Use OCR de PDF para escaneos de solo imagen, luego regrese para extraer el texto reconocido.

El contenido del PDF se procesa localmente en este navegador. Los documentos cargados no se envían a un servidor de extracción. Los enlaces, direcciones de correo electrónico y números de teléfono encontrados dentro del PDF nunca se contactan automáticamente.

Archivos admitidos y procesamiento

Entrada
PDF
Salida
CSV / TXT

Abra un PDF de hasta 50 MB y 750 páginas. Pueden aplicarse límites adicionales de salida, memoria y procesamiento a documentos complejos.

El procesamiento se realiza en su dispositivo sin subir el documento. Descargue el resultado antes de cerrar la página; guarde el original por separado.

Advertisements
Preguntas más frecuentes

Algunas respuestas útiles

Sabe qué esperar antes de empezar.

En tu dispositivo
¿Qué puede reconocer esta herramienta?

Elija los tipos de datos que necesita: correos electrónicos, números de teléfono, URL, fechas numéricas, direcciones IPv4, dominios, DOI, ISBN, hashtags y direcciones MAC. Revise los valores extraídos con recuentos y referencias de página. Esto extrae valores reconocibles, no tablas, facturas o campos semánticos. Los patrones y las sumas de comprobación reducen el ruido, pero no garantizan la integridad ni prueban que un identificador sea auténtico.

¿Puedo extraer datos de PDF escaneados?

Solo se lee el texto seleccionable y los destinos de enlaces reconocidos. Las páginas que solo contienen imágenes necesitan primero OCR para PDF. Ejecute OCR, descargue el PDF con capacidad de búsqueda y luego regrese a este extractor.

¿Cómo se manejan los duplicados y los recuentos?

Eliminar duplicados combina valores equivalentes reconocidos. El recuento muestra las apariciones detectadas y Páginas enumera las posiciones físicas de las páginas del PDF. Desactive la opción para mantener las apariciones por separado. Un destino impreso y un enlace clicable coincidente en la misma página no se cuentan dos veces.

¿Cuál es la diferencia entre CSV y TXT?

CSV incluye tipo, valor, recuento de apariciones y referencias de página. TXT y Copiar todo proporcionan solo valores, uno por línea. Se incluyen todas las filas que coinciden con el filtro actual, no solo la página de la tabla visible.

¿Se carga el PDF para la extracción?

No. El análisis, la coincidencia y las exportaciones de PDF se ejecutan en este navegador. El PDF original no cambia. Ningún enlace, correo electrónico o número de teléfono extraído se contacta automáticamente.

¿Cuáles son los límites?

Un PDF de hasta 50 MiB y 500 páginas. La extracción está limitada a 250,000 caracteres de texto y 2,000 coincidencias por página, 10 millones de caracteres y 20,000 coincidencias en total, y 2,000 anotaciones por página. Los resultados incluyen un aviso si los límites o las páginas ilegibles los hacen parciales.

Continuar

¿Qué te gustaría hacer a continuación?

Elige una herramienta. Tu PDF terminado te acompaña.

PDF

Advertisements

Idioma38

English العربية Français Italiano Deutsch Español Português Nederlands Русский Türkçe 日本語 中文 हिन्दी Bahasa Indonesia Bahasa Melayu 한국어 Tiếng Việt ไทย Polski Svenska Українська Norsk বাংলা Ελληνικά فارسی اردو Čeština Dansk Magyar Română Suomi Български Filipino ქართული Slovenčina Azərbaycanca עברית Slovenščina