Collecter des liens sources
Créez une liste de références à partir de rapports et de documents de recherche.
Extrayez les liens utiles de votre PDF.
| Type | Valeur | Occurrences | Pages |
|---|
La copie et le téléchargement incluent toutes les lignes correspondantes sur toutes les pages de résultats. Le CSV inclut les occurrences et les numéros de page PDF ; le TXT contient uniquement les valeurs.
Sélectionnez un numéro de page dans les résultats pour vérifier sa source. Les surbrillances indiquent les positions approximatives.
Votre liste est prête. Téléchargez-la ou revenez en arrière pour vérifier et modifier le format.
Chargez un document avec du texte sélectionnable, ou essayez l'exemple.
Sélectionnez Extraire. Vérifiez les valeurs, les occurrences et les pages sources ; filtrez ou triez la liste.
Copiez les valeurs, ou téléchargez un CSV avec les références de page ou une liste TXT simple.
Collectez les adresses HTTP/HTTPS imprimées, les adresses www et les cibles de liens Web cliquables d'un PDF. Conservez les références de page et téléchargez une liste dédoublonnée au format CSV ou TXT.
Créez une liste de références à partir de rapports et de documents de recherche.
Extrayez les destinations derrière les étiquettes de ressources cliquables.
Enregistrez l'endroit où chaque lien a été trouvé avant de l'examiner ailleurs.
Incluez une cible de lien même lorsque son libellé indique seulement « Lire la suite ».
Les liens imprimés commençant par http://, https:// ou www. sont reconnus. Les annotations de lien PDF peuvent également révéler des cibles HTTP/HTTPS derrière du texte ordinaire. Le PDF n'a pas besoin d'afficher l'URL comme libellé cliquable.
Les cibles imprimées et les annotations identiques sur une même page ne sont pas comptées deux fois. Les formes d'URL normalisées sont utilisées pour la comparaison des doublons, tandis que la première orthographe reconnue est affichée. Les URL longues, renvoyées à la ligne ou endommagées peuvent nécessiter une correction manuelle. Aucune URL extraite n'est récupérée automatiquement.
Vérifiez les totaux, accédez à une page PDF et filtrez la liste des résultats.
Chaque résultat enregistre la position physique de la page dans le PDF, ce qui peut différer des numéros de page imprimés. Sélectionnez une puce de page pour ouvrir l'aperçu avec une mise en surbrillance approximative.
La suppression des doublons est activée par défaut. Les totaux combinent les répétitions reconnues de la même valeur ; désactivez cette option pour voir les occurrences séparées. Le tri alphabétique modifie l'ordre de la liste. Le filtrage s'applique également à la copie et aux téléchargements ainsi qu'aux lignes visibles.
Choisissez CSV pour les totaux et les pages, ou TXT pour une valeur par ligne.
Le CSV contient les colonnes Type, Valeur, Total et Pages. L'encodage UTF-8 prend en charge l'arabe et d'autres scripts. Les valeurs pouvant être interprétées comme des formules de tableur sont précédées d'une apostrophe pour un import plus sûr.
TXT et Copier tout contiennent uniquement les valeurs, une par ligne. Toutes les lignes correspondant au filtre sont incluses, même lorsque le tableau à l'écran s'étend sur plusieurs pages de résultats. Aucun nouveau PDF n'est créé et le PDF source reste inchangé.
Traitez un PDF dans votre navigateur, avec des limites explicites et des avis de résultats partiels.
Chargez un PDF jusqu'à 50 MiB et 500 pages. L'extraction vérifie jusqu'à 250 000 caractères et 2 000 correspondances par page, 10 millions de caractères et 20 000 correspondances au total, et 2 000 annotations par page. Un budget d'extraction de 90 secondes limite les exécutions trop longues. Les documents très complexes peuvent mieux fonctionner s'ils sont divisés en fichiers plus petits.
Lorsqu'une limite est atteinte ou qu'une page ne peut pas être entièrement lue, les résultats affichent un avis et les exécutions limitées ou échouées exportent avec la mention partial dans le nom de fichier. Les pages sans texte sélectionnable sont comptées séparément. Utilisez l'OCR PDF pour les scans d'images uniquement, puis revenez pour extraire le texte reconnu.
Le contenu PDF est traité localement dans ce navigateur. Les documents téléchargés ne sont pas envoyés vers un serveur d'extraction. Les liens, adresses e-mail et numéros de téléphone trouvés dans le PDF ne sont jamais contactés automatiquement.
Ouvrez un PDF jusqu'à 50 Mo et 750 pages. Des limites supplémentaires de sortie, de mémoire et de traitement peuvent s'appliquer aux documents complexes.
Le traitement s'effectue sur votre appareil sans téléchargement du document. Téléchargez votre résultat avant de fermer la page ; conservez l'original séparément.
Sachez à quoi vous attendre avant de commencer.
Sur votre appareilCollectez les adresses HTTP/HTTPS imprimées, les adresses www et les cibles de liens web cliquables à partir d'un PDF. Conservez les références de page et téléchargez une liste dédoublonnée au format CSV ou TXT. L'outil ne vérifie pas si les liens fonctionnent toujours. Les destinations de page internes, les actions JavaScript, mailto et autres protocoles non web ne sont pas exportés en tant que liens web.
Seuls le texte sélectionnable et les cibles de lien reconnues sont lus. Les pages contenant uniquement des images nécessitent d'abord une OCR PDF. Exécutez l'OCR, téléchargez le PDF interrogeable, puis revenez à cet extracteur.
La suppression des doublons combine les valeurs équivalentes reconnues. Le compteur indique les occurrences détectées et Pages liste les positions physiques des pages du PDF. Désactivez l'option pour conserver les occurrences séparées. Une cible imprimée et un lien cliquable correspondant sur la même page ne sont pas comptés deux fois.
Le format CSV inclut le type, la valeur, le nombre d'occurrences et les références de page. TXT et Copier tout fournissent uniquement les valeurs, une par ligne. Toutes les lignes correspondant au filtre actuel sont incluses, pas seulement la page de tableau visible.
Non. L'analyse, la correspondance et les exportations PDF s'exécutent dans ce navigateur. Le PDF original reste inchangé. Aucun lien, e-mail ou numéro de téléphone extrait n'est contacté automatiquement.
Un PDF jusqu'à 50 MiB et 500 pages. L'extraction est limitée à 250 000 caractères de texte et 2 000 correspondances par page, 10 millions de caractères et 20 000 correspondances au total, et 2 000 annotations par page. Les résultats comportent un avis si les limites ou des pages illisibles les rendent partiels.
TUTORIEL VIDÉO RAPIDE
Comment extraire des liens et des URLs d'un PDF
Gardez les liens web utiles sans les ouvrir un par un.
Narration en anglais
Regarder la vidéo