Recopilar enlaces de origen
Cree una lista de referencias a partir de informes y documentos de investigación.
Extraiga los enlaces útiles de su PDF.
| Tipo | Valor | Recuento | Páginas |
|---|
Copiar y descargar incluye todas las filas coincidentes en todas las páginas de resultados. CSV incluye recuentos y números de página del PDF; TXT contiene solo los valores.
Selecciona un número de página en Resultados para verificar su origen. Los resaltados muestran posiciones aproximadas.
Tu lista está lista. Descárgala o vuelve atrás para revisar y cambiar el formato.
Carga un documento con texto seleccionable o prueba el ejemplo.
Selecciona Extraer. Revisa valores, recuentos y páginas de origen; filtra o ordena la lista.
Copia los valores o descarga un CSV con referencias de página o una lista TXT simple.
Recopile direcciones HTTP/HTTPS impresas, direcciones www y destinos de enlaces web clicables de un PDF. Conserve las referencias de página y descargue una lista deduplicada como CSV o TXT.
Cree una lista de referencias a partir de informes y documentos de investigación.
Extraiga los destinos detrás de etiquetas de recursos clicables.
Registre dónde se encontró cada enlace antes de revisarlo en otro lugar.
Incluya un destino de enlace incluso cuando su etiqueta solo diga “Leer más”.
Se reconocen los enlaces impresos que comienzan con http://, https:// o www. Las anotaciones de enlace en PDF también pueden revelar destinos HTTP/HTTPS detrás de texto ordinario. El PDF no necesita mostrar la URL como su etiqueta en la que se puede hacer clic.
Los destinos impresos y las anotaciones idénticas en una página no se cuentan dos veces. Se utilizan formas de URL normalizadas para la comparación de duplicados, mientras que se muestra la primera ortografía reconocida. Las URL largas, ajustadas o dañadas pueden requerir corrección manual. Ninguna URL extraída se obtiene automáticamente.
Verifique los recuentos, salte a una página del PDF y filtre la lista de resultados.
Cada resultado registra la posición física de la página en el PDF, que puede diferir de los números de página impresos. Seleccione una etiqueta de página para abrir la vista previa con un resaltado aproximado.
La eliminación de duplicados comienza activada. Los recuentos combinan las repeticiones reconocidas del mismo valor; desactívela para ver las apariciones por separado. Ordenar alfabéticamente cambia el orden de la lista. El filtrado se aplica tanto a la copia y descarga como a las filas visibles.
Elija CSV para recuentos y páginas, o TXT para un valor por línea.
CSV contiene columnas de Tipo, Valor, Recuento y Páginas. La codificación UTF-8 admite árabe y otros scripts. Los valores que podrían interpretarse como fórmulas de hoja de cálculo tienen un apóstrofo como prefijo para una importación más segura.
TXT y Copiar todo contienen solo valores, uno por línea. Se incluyen todas las filas que coinciden con el filtro, incluso cuando la tabla en pantalla abarca varias páginas de resultados. No se crea ningún PDF nuevo y el PDF de origen no cambia.
Procese un PDF en su navegador, con límites explícitos y avisos de resultados parciales.
Cargue un PDF de hasta 50 MiB y 500 páginas. La extracción verifica hasta 250,000 caracteres y 2,000 coincidencias por página, 10 millones de caracteres y 20,000 coincidencias en total, y 2,000 anotaciones por página. Un presupuesto de extracción de 90 segundos limita las ejecuciones largas. Los documentos muy complejos pueden funcionar mejor cuando se dividen en archivos más pequeños.
Cuando se alcanza un límite o no se puede leer una página por completo, los resultados muestran un aviso y las ejecuciones limitadas o fallidas se exportan con parcial en el nombre del archivo. Las páginas sin texto seleccionable se cuentan por separado. Use OCR de PDF para escaneos de solo imagen, luego regrese para extraer el texto reconocido.
El contenido del PDF se procesa localmente en este navegador. Los documentos cargados no se envían a un servidor de extracción. Los enlaces, direcciones de correo electrónico y números de teléfono encontrados dentro del PDF nunca se contactan automáticamente.
Abra un PDF de hasta 50 MB y 750 páginas. Pueden aplicarse límites adicionales de salida, memoria y procesamiento a documentos complejos.
El procesamiento se realiza en su dispositivo sin subir el documento. Descargue el resultado antes de cerrar la página; guarde el original por separado.
Sabe qué esperar antes de empezar.
En tu dispositivoRecopile direcciones HTTP/HTTPS impresas, direcciones www y destinos de enlaces web clicables de un PDF. Mantenga las referencias de página y descargue una lista deduplicada como CSV o TXT. La herramienta no comprueba si los enlaces siguen funcionando. Los destinos de página internos, las acciones de JavaScript, mailto y otros esquemas que no son web no se exportan como enlaces web.
Solo se lee el texto seleccionable y los destinos de enlaces reconocidos. Las páginas que solo contienen imágenes necesitan primero OCR para PDF. Ejecute OCR, descargue el PDF con capacidad de búsqueda y luego regrese a este extractor.
Eliminar duplicados combina valores equivalentes reconocidos. El recuento muestra las apariciones detectadas y Páginas enumera las posiciones físicas de las páginas del PDF. Desactive la opción para mantener las apariciones por separado. Un destino impreso y un enlace clicable coincidente en la misma página no se cuentan dos veces.
CSV incluye tipo, valor, recuento de apariciones y referencias de página. TXT y Copiar todo proporcionan solo valores, uno por línea. Se incluyen todas las filas que coinciden con el filtro actual, no solo la página de la tabla visible.
No. El análisis, la coincidencia y las exportaciones de PDF se ejecutan en este navegador. El PDF original no cambia. Ningún enlace, correo electrónico o número de teléfono extraído se contacta automáticamente.
Un PDF de hasta 50 MiB y 500 páginas. La extracción está limitada a 250,000 caracteres de texto y 2,000 coincidencias por página, 10 millones de caracteres y 20,000 coincidencias en total, y 2,000 anotaciones por página. Los resultados incluyen un aviso si los límites o las páginas ilegibles los hacen parciales.
VIDEO TUTORIAL RÁPIDO
Cómo extraer enlaces y URLs de un PDF
Conserva los enlaces web útiles sin abrirlos uno por uno.
Narración en inglés
Ver el video