Recopilar identificadores
Recopile valores DOI e ISBN junto con las páginas donde aparecen.
Encuentre los datos que necesita. Conserve la página de origen con cada resultado.
| Tipo | Valor | Recuento | Páginas |
|---|
Copiar y descargar incluye todas las filas coincidentes en todas las páginas de resultados. CSV incluye recuentos y números de página del PDF; TXT contiene solo los valores.
Selecciona un número de página en Resultados para verificar su origen. Los resaltados muestran posiciones aproximadas.
Tu lista está lista. Descárgala o vuelve atrás para revisar y cambiar el formato.
Carga un documento con texto seleccionable o prueba el ejemplo.
Selecciona Extraer. Revisa valores, recuentos y páginas de origen; filtra o ordena la lista.
Copia los valores o descarga un CSV con referencias de página o una lista TXT simple.
Elija los tipos de datos que necesita: correos electrónicos, números de teléfono, URL, fechas numéricas, direcciones IPv4, dominios, DOI, ISBN, hashtags y direcciones MAC. Revise los valores extraídos con recuentos y referencias de página.
Recopile valores DOI e ISBN junto con las páginas donde aparecen.
Encuentre entradas con fecha y direcciones IPv4.
Combine correos electrónicos, teléfonos y enlaces web en una exportación estructurada.
Comience con correos electrónicos, teléfonos y URL, luego abra Más tipos de datos para valores especializados.
Las fechas deben usar un formato numérico con un año de cuatro dígitos; los valores ambiguos de día/mes conservan su orden de origen. Los octetos IPv4 se validan; IPv6 no está incluido.
Los dominios se derivan de correos electrónicos y enlaces web reconocidos, no de nombres de archivo arbitrarios. La extracción de DOI cubre las formas modernas comunes de DOI, no todas las formas históricas. Los valores ISBN-13 necesitan una suma de comprobación válida; ISBN-10 también necesita una etiqueta ISBN. Los hashtags pueden contener letras Unicode, incluido el árabe.
Las direcciones MAC utilizan seis pares separados por dos puntos o guiones. La herramienta nunca contacta las direcciones o identificadores extraídos.
Verifique los recuentos, salte a una página del PDF y filtre la lista de resultados.
Cada resultado registra la posición física de la página en el PDF, que puede diferir de los números de página impresos. Seleccione una etiqueta de página para abrir la vista previa con un resaltado aproximado.
La eliminación de duplicados comienza activada. Los recuentos combinan las repeticiones reconocidas del mismo valor; desactívela para ver las apariciones por separado. Ordenar alfabéticamente cambia el orden de la lista. El filtrado se aplica tanto a la copia y descarga como a las filas visibles.
Elija CSV para recuentos y páginas, o TXT para un valor por línea.
CSV contiene columnas de Tipo, Valor, Recuento y Páginas. La codificación UTF-8 admite árabe y otros scripts. Los valores que podrían interpretarse como fórmulas de hoja de cálculo tienen un apóstrofo como prefijo para una importación más segura.
TXT y Copiar todo contienen solo valores, uno por línea. Se incluyen todas las filas que coinciden con el filtro, incluso cuando la tabla en pantalla abarca varias páginas de resultados. No se crea ningún PDF nuevo y el PDF de origen no cambia.
Procese un PDF en su navegador, con límites explícitos y avisos de resultados parciales.
Cargue un PDF de hasta 50 MiB y 500 páginas. La extracción verifica hasta 250,000 caracteres y 2,000 coincidencias por página, 10 millones de caracteres y 20,000 coincidencias en total, y 2,000 anotaciones por página. Un presupuesto de extracción de 90 segundos limita las ejecuciones largas. Los documentos muy complejos pueden funcionar mejor cuando se dividen en archivos más pequeños.
Cuando se alcanza un límite o no se puede leer una página por completo, los resultados muestran un aviso y las ejecuciones limitadas o fallidas se exportan con parcial en el nombre del archivo. Las páginas sin texto seleccionable se cuentan por separado. Use OCR de PDF para escaneos de solo imagen, luego regrese para extraer el texto reconocido.
El contenido del PDF se procesa localmente en este navegador. Los documentos cargados no se envían a un servidor de extracción. Los enlaces, direcciones de correo electrónico y números de teléfono encontrados dentro del PDF nunca se contactan automáticamente.
Abra un PDF de hasta 50 MB y 750 páginas. Pueden aplicarse límites adicionales de salida, memoria y procesamiento a documentos complejos.
El procesamiento se realiza en su dispositivo sin subir el documento. Descargue el resultado antes de cerrar la página; guarde el original por separado.
Sabe qué esperar antes de empezar.
En tu dispositivoElija los tipos de datos que necesita: correos electrónicos, números de teléfono, URL, fechas numéricas, direcciones IPv4, dominios, DOI, ISBN, hashtags y direcciones MAC. Revise los valores extraídos con recuentos y referencias de página. Esto extrae valores reconocibles, no tablas, facturas o campos semánticos. Los patrones y las sumas de comprobación reducen el ruido, pero no garantizan la integridad ni prueban que un identificador sea auténtico.
Solo se lee el texto seleccionable y los destinos de enlaces reconocidos. Las páginas que solo contienen imágenes necesitan primero OCR para PDF. Ejecute OCR, descargue el PDF con capacidad de búsqueda y luego regrese a este extractor.
Eliminar duplicados combina valores equivalentes reconocidos. El recuento muestra las apariciones detectadas y Páginas enumera las posiciones físicas de las páginas del PDF. Desactive la opción para mantener las apariciones por separado. Un destino impreso y un enlace clicable coincidente en la misma página no se cuentan dos veces.
CSV incluye tipo, valor, recuento de apariciones y referencias de página. TXT y Copiar todo proporcionan solo valores, uno por línea. Se incluyen todas las filas que coinciden con el filtro actual, no solo la página de la tabla visible.
No. El análisis, la coincidencia y las exportaciones de PDF se ejecutan en este navegador. El PDF original no cambia. Ningún enlace, correo electrónico o número de teléfono extraído se contacta automáticamente.
Un PDF de hasta 50 MiB y 500 páginas. La extracción está limitada a 250,000 caracteres de texto y 2,000 coincidencias por página, 10 millones de caracteres y 20,000 coincidencias en total, y 2,000 anotaciones por página. Los resultados incluyen un aviso si los límites o las páginas ilegibles los hacen parciales.
VIDEO TUTORIAL RÁPIDO
Cómo extraer datos estructurados de un PDF
Recopila contactos e identificadores de investigación en una lista organizada.
Narración en inglés
Ver el video