Outils150

Une tâche PDF utile, simplifiée

Extraire des liens d'un PDF.

Extrayez les liens utiles de votre PDF.

Advertisements
Votre espace de travail PDF
Sur votre appareil
ou déposez vos fichiers ici
Votre PDF est traité dans ce navigateur. PDF
Advertisements

Comment extraire des liens d'un PDF

  1. 01

    Choisir un PDF

    Chargez un document avec du texte sélectionnable, ou essayez l'exemple.

  2. 02

    Extraire et vérifier

    Sélectionnez Extraire. Vérifiez les valeurs, les occurrences et les pages sources ; filtrez ou triez la liste.

  3. 03

    Copier ou télécharger

    Copiez les valeurs, ou téléchargez un CSV avec les références de page ou une liste TXT simple.

BlogComment extraire des liens et des URLs d'un PDFLire le guide

Extraire des liens PDF sans ouvrir chaque page

Collectez les adresses HTTP/HTTPS imprimées, les adresses www et les cibles de liens Web cliquables d'un PDF. Conservez les références de page et téléchargez une liste dédoublonnée au format CSV ou TXT.

Les valeurs reconnues deviennent une liste avec des références de page source.
TUTORIEL VIDÉO RAPIDE Comment extraire des liens et des URLs d'un PDF Gardez les liens web utiles sans les ouvrir un par un. Narration en anglais Regarder la vidéo

Comment extraire des liens et des URLs d'un PDF

Quand est-ce utile ?

Références

Collecter des liens sources

Créez une liste de références à partir de rapports et de documents de recherche.

Ressources

Enregistrer des destinations utiles

Extrayez les destinations derrière les étiquettes de ressources cliquables.

Examen

Tenir une liste d'audit

Enregistrez l'endroit où chaque lien a été trouvé avant de l'examiner ailleurs.

Fonctionnalités et contrôles

Trouver des liens visibles et cliquables

Incluez une cible de lien même lorsque son libellé indique seulement « Lire la suite ».

Comment fonctionne l'extraction de liens

Les liens imprimés commençant par http://, https:// ou www. sont reconnus. Les annotations de lien PDF peuvent également révéler des cibles HTTP/HTTPS derrière du texte ordinaire. Le PDF n'a pas besoin d'afficher l'URL comme libellé cliquable.

Les cibles imprimées et les annotations identiques sur une même page ne sont pas comptées deux fois. Les formes d'URL normalisées sont utilisées pour la comparaison des doublons, tandis que la première orthographe reconnue est affichée. Les URL longues, renvoyées à la ligne ou endommagées peuvent nécessiter une correction manuelle. Aucune URL extraite n'est récupérée automatiquement.

Vérifier les valeurs avec leurs pages sources

Vérifiez les totaux, accédez à une page PDF et filtrez la liste des résultats.

Examiner et organiser

Chaque résultat enregistre la position physique de la page dans le PDF, ce qui peut différer des numéros de page imprimés. Sélectionnez une puce de page pour ouvrir l'aperçu avec une mise en surbrillance approximative.

La suppression des doublons est activée par défaut. Les totaux combinent les répétitions reconnues de la même valeur ; désactivez cette option pour voir les occurrences séparées. Le tri alphabétique modifie l'ordre de la liste. Le filtrage s'applique également à la copie et aux téléchargements ainsi qu'aux lignes visibles.

Copier les valeurs ou télécharger une liste structurée

Choisissez CSV pour les totaux et les pages, ou TXT pour une valeur par ligne.

Ce que contient chaque téléchargement

Le CSV contient les colonnes Type, Valeur, Total et Pages. L'encodage UTF-8 prend en charge l'arabe et d'autres scripts. Les valeurs pouvant être interprétées comme des formules de tableur sont précédées d'une apostrophe pour un import plus sûr.

TXT et Copier tout contiennent uniquement les valeurs, une par ligne. Toutes les lignes correspondant au filtre sont incluses, même lorsque le tableau à l'écran s'étend sur plusieurs pages de résultats. Aucun nouveau PDF n'est créé et le PDF source reste inchangé.

Gérer les extractions volumineuses

Traitez un PDF dans votre navigateur, avec des limites explicites et des avis de résultats partiels.

Fichiers, limites et pages numérisées

Chargez un PDF jusqu'à 50 MiB et 500 pages. L'extraction vérifie jusqu'à 250 000 caractères et 2 000 correspondances par page, 10 millions de caractères et 20 000 correspondances au total, et 2 000 annotations par page. Un budget d'extraction de 90 secondes limite les exécutions trop longues. Les documents très complexes peuvent mieux fonctionner s'ils sont divisés en fichiers plus petits.

Lorsqu'une limite est atteinte ou qu'une page ne peut pas être entièrement lue, les résultats affichent un avis et les exécutions limitées ou échouées exportent avec la mention partial dans le nom de fichier. Les pages sans texte sélectionnable sont comptées séparément. Utilisez l'OCR PDF pour les scans d'images uniquement, puis revenez pour extraire le texte reconnu.

Le contenu PDF est traité localement dans ce navigateur. Les documents téléchargés ne sont pas envoyés vers un serveur d'extraction. Les liens, adresses e-mail et numéros de téléphone trouvés dans le PDF ne sont jamais contactés automatiquement.

Fichiers pris en charge et traitement

Entrée
PDF
Sortie
CSV / TXT

Ouvrez un PDF jusqu'à 50 Mo et 750 pages. Des limites supplémentaires de sortie, de mémoire et de traitement peuvent s'appliquer aux documents complexes.

Le traitement s'effectue sur votre appareil sans téléchargement du document. Téléchargez votre résultat avant de fermer la page ; conservez l'original séparément.

Advertisements
FAQ

Quelques réponses utiles

Sachez à quoi vous attendre avant de commencer.

Sur votre appareil
Que peut reconnaître cet outil ?

Collectez les adresses HTTP/HTTPS imprimées, les adresses www et les cibles de liens web cliquables à partir d'un PDF. Conservez les références de page et téléchargez une liste dédoublonnée au format CSV ou TXT. L'outil ne vérifie pas si les liens fonctionnent toujours. Les destinations de page internes, les actions JavaScript, mailto et autres protocoles non web ne sont pas exportés en tant que liens web.

Puis-je extraire des données de PDF numérisés ?

Seuls le texte sélectionnable et les cibles de lien reconnues sont lus. Les pages contenant uniquement des images nécessitent d'abord une OCR PDF. Exécutez l'OCR, téléchargez le PDF interrogeable, puis revenez à cet extracteur.

Comment les doublons et les totaux sont-ils gérés ?

La suppression des doublons combine les valeurs équivalentes reconnues. Le compteur indique les occurrences détectées et Pages liste les positions physiques des pages du PDF. Désactivez l'option pour conserver les occurrences séparées. Une cible imprimée et un lien cliquable correspondant sur la même page ne sont pas comptés deux fois.

Quelle est la différence entre CSV et TXT ?

Le format CSV inclut le type, la valeur, le nombre d'occurrences et les références de page. TXT et Copier tout fournissent uniquement les valeurs, une par ligne. Toutes les lignes correspondant au filtre actuel sont incluses, pas seulement la page de tableau visible.

Le PDF est-il téléchargé pour l'extraction ?

Non. L'analyse, la correspondance et les exportations PDF s'exécutent dans ce navigateur. Le PDF original reste inchangé. Aucun lien, e-mail ou numéro de téléphone extrait n'est contacté automatiquement.

Quelles sont les limites ?

Un PDF jusqu'à 50 MiB et 500 pages. L'extraction est limitée à 250 000 caractères de texte et 2 000 correspondances par page, 10 millions de caractères et 20 000 correspondances au total, et 2 000 annotations par page. Les résultats comportent un avis si les limites ou des pages illisibles les rendent partiels.

Continuer

Que souhaitez-vous faire ensuite ?

Choisissez un outil. Votre PDF final vous accompagne.

PDF

Advertisements

Langue38

English العربية Français Italiano Deutsch Español Português Nederlands Русский Türkçe 日本語 中文 हिन्दी Bahasa Indonesia Bahasa Melayu 한국어 Tiếng Việt ไทย Polski Svenska Українська Norsk বাংলা Ελληνικά فارسی اردو Čeština Dansk Magyar Română Suomi Български Filipino ქართული Slovenčina Azərbaycanca עברית Slovenščina