Herramientas150

Una tarea de PDF útil, simplificada

Extraer enlaces de un PDF.

Extraiga los enlaces útiles de su PDF.

Advertisements
Tu espacio de trabajo PDF
En tu dispositivo
o suelta tus archivos aquí
Tu PDF se procesa en este navegador. PDF
Advertisements

Cómo extraer enlaces de un PDF

  1. 01

    Elige un PDF

    Carga un documento con texto seleccionable o prueba el ejemplo.

  2. 02

    Extraer y revisar

    Selecciona Extraer. Revisa valores, recuentos y páginas de origen; filtra o ordena la lista.

  3. 03

    Copiar o descargar

    Copia los valores o descarga un CSV con referencias de página o una lista TXT simple.

BlogCómo extraer enlaces y URLs de un PDFLeer la guía

Extraer enlaces de PDF sin abrir cada página

Recopile direcciones HTTP/HTTPS impresas, direcciones www y destinos de enlaces web clicables de un PDF. Conserve las referencias de página y descargue una lista deduplicada como CSV o TXT.

Los valores reconocidos se convierten en una lista con referencias a la página de origen.
VIDEO TUTORIAL RÁPIDO Cómo extraer enlaces y URLs de un PDF Conserva los enlaces web útiles sin abrirlos uno por uno. Narración en inglés Ver el video

Cómo extraer enlaces y URLs de un PDF

¿Cuándo es útil esto?

Referencias

Recopilar enlaces de origen

Cree una lista de referencias a partir de informes y documentos de investigación.

Recursos

Guardar destinos útiles

Extraiga los destinos detrás de etiquetas de recursos clicables.

Revisión

Mantener una lista de auditoría

Registre dónde se encontró cada enlace antes de revisarlo en otro lugar.

Características y controles

Encuentre enlaces visibles y en los que se puede hacer clic

Incluya un destino de enlace incluso cuando su etiqueta solo diga “Leer más”.

Cómo funciona la extracción de enlaces

Se reconocen los enlaces impresos que comienzan con http://, https:// o www. Las anotaciones de enlace en PDF también pueden revelar destinos HTTP/HTTPS detrás de texto ordinario. El PDF no necesita mostrar la URL como su etiqueta en la que se puede hacer clic.

Los destinos impresos y las anotaciones idénticas en una página no se cuentan dos veces. Se utilizan formas de URL normalizadas para la comparación de duplicados, mientras que se muestra la primera ortografía reconocida. Las URL largas, ajustadas o dañadas pueden requerir corrección manual. Ninguna URL extraída se obtiene automáticamente.

Revise los valores con sus páginas de origen

Verifique los recuentos, salte a una página del PDF y filtre la lista de resultados.

Revise y organice

Cada resultado registra la posición física de la página en el PDF, que puede diferir de los números de página impresos. Seleccione una etiqueta de página para abrir la vista previa con un resaltado aproximado.

La eliminación de duplicados comienza activada. Los recuentos combinan las repeticiones reconocidas del mismo valor; desactívela para ver las apariciones por separado. Ordenar alfabéticamente cambia el orden de la lista. El filtrado se aplica tanto a la copia y descarga como a las filas visibles.

Copie valores o descargue una lista estructurada

Elija CSV para recuentos y páginas, o TXT para un valor por línea.

Qué contiene cada descarga

CSV contiene columnas de Tipo, Valor, Recuento y Páginas. La codificación UTF-8 admite árabe y otros scripts. Los valores que podrían interpretarse como fórmulas de hoja de cálculo tienen un apóstrofo como prefijo para una importación más segura.

TXT y Copiar todo contienen solo valores, uno por línea. Se incluyen todas las filas que coinciden con el filtro, incluso cuando la tabla en pantalla abarca varias páginas de resultados. No se crea ningún PDF nuevo y el PDF de origen no cambia.

Mantenga las extracciones grandes manejables

Procese un PDF en su navegador, con límites explícitos y avisos de resultados parciales.

Archivos, límites y páginas escaneadas

Cargue un PDF de hasta 50 MiB y 500 páginas. La extracción verifica hasta 250,000 caracteres y 2,000 coincidencias por página, 10 millones de caracteres y 20,000 coincidencias en total, y 2,000 anotaciones por página. Un presupuesto de extracción de 90 segundos limita las ejecuciones largas. Los documentos muy complejos pueden funcionar mejor cuando se dividen en archivos más pequeños.

Cuando se alcanza un límite o no se puede leer una página por completo, los resultados muestran un aviso y las ejecuciones limitadas o fallidas se exportan con parcial en el nombre del archivo. Las páginas sin texto seleccionable se cuentan por separado. Use OCR de PDF para escaneos de solo imagen, luego regrese para extraer el texto reconocido.

El contenido del PDF se procesa localmente en este navegador. Los documentos cargados no se envían a un servidor de extracción. Los enlaces, direcciones de correo electrónico y números de teléfono encontrados dentro del PDF nunca se contactan automáticamente.

Archivos admitidos y procesamiento

Entrada
PDF
Salida
CSV / TXT

Abra un PDF de hasta 50 MB y 750 páginas. Pueden aplicarse límites adicionales de salida, memoria y procesamiento a documentos complejos.

El procesamiento se realiza en su dispositivo sin subir el documento. Descargue el resultado antes de cerrar la página; guarde el original por separado.

Advertisements
Preguntas más frecuentes

Algunas respuestas útiles

Sabe qué esperar antes de empezar.

En tu dispositivo
¿Qué puede reconocer esta herramienta?

Recopile direcciones HTTP/HTTPS impresas, direcciones www y destinos de enlaces web clicables de un PDF. Mantenga las referencias de página y descargue una lista deduplicada como CSV o TXT. La herramienta no comprueba si los enlaces siguen funcionando. Los destinos de página internos, las acciones de JavaScript, mailto y otros esquemas que no son web no se exportan como enlaces web.

¿Puedo extraer datos de PDF escaneados?

Solo se lee el texto seleccionable y los destinos de enlaces reconocidos. Las páginas que solo contienen imágenes necesitan primero OCR para PDF. Ejecute OCR, descargue el PDF con capacidad de búsqueda y luego regrese a este extractor.

¿Cómo se manejan los duplicados y los recuentos?

Eliminar duplicados combina valores equivalentes reconocidos. El recuento muestra las apariciones detectadas y Páginas enumera las posiciones físicas de las páginas del PDF. Desactive la opción para mantener las apariciones por separado. Un destino impreso y un enlace clicable coincidente en la misma página no se cuentan dos veces.

¿Cuál es la diferencia entre CSV y TXT?

CSV incluye tipo, valor, recuento de apariciones y referencias de página. TXT y Copiar todo proporcionan solo valores, uno por línea. Se incluyen todas las filas que coinciden con el filtro actual, no solo la página de la tabla visible.

¿Se carga el PDF para la extracción?

No. El análisis, la coincidencia y las exportaciones de PDF se ejecutan en este navegador. El PDF original no cambia. Ningún enlace, correo electrónico o número de teléfono extraído se contacta automáticamente.

¿Cuáles son los límites?

Un PDF de hasta 50 MiB y 500 páginas. La extracción está limitada a 250,000 caracteres de texto y 2,000 coincidencias por página, 10 millones de caracteres y 20,000 coincidencias en total, y 2,000 anotaciones por página. Los resultados incluyen un aviso si los límites o las páginas ilegibles los hacen parciales.

Continuar

¿Qué te gustaría hacer a continuación?

Elige una herramienta. Tu PDF terminado te acompaña.

PDF

Advertisements

Idioma38

English العربية Français Italiano Deutsch Español Português Nederlands Русский Türkçe 日本語 中文 हिन्दी Bahasa Indonesia Bahasa Melayu 한국어 Tiếng Việt ไทย Polski Svenska Українська Norsk বাংলা Ελληνικά فارسی اردو Čeština Dansk Magyar Română Suomi Български Filipino ქართული Slovenčina Azərbaycanca עברית Slovenščina