Outils150

Une tâche PDF utile, simplifiée

Extraire des données d'un PDF.

Trouvez les données dont vous avez besoin. Conservez la page source avec chaque résultat.

Advertisements
Votre espace de travail PDF
Sur votre appareil
ou déposez vos fichiers ici
Votre PDF est traité dans ce navigateur. PDF
Advertisements

Comment extraire des données d'un PDF

  1. 01

    Choisir un PDF

    Chargez un document avec du texte sélectionnable, ou essayez l'exemple.

  2. 02

    Extraire et vérifier

    Sélectionnez Extraire. Vérifiez les valeurs, les occurrences et les pages sources ; filtrez ou triez la liste.

  3. 03

    Copier ou télécharger

    Copiez les valeurs, ou téléchargez un CSV avec les références de page ou une liste TXT simple.

BlogComment extraire des données structurées d'un PDFLire le guide

Extraire des valeurs structurées d'un PDF vers CSV ou texte

Choisissez les types de données dont vous avez besoin : e-mails, numéros de téléphone, URL, dates numériques, adresses IPv4, domaines, DOI, ISBN, hashtags et adresses MAC. Examinez les valeurs extraites avec les comptes et les références de page.

Les valeurs reconnues deviennent une liste avec des références de page source.
TUTORIEL VIDÉO RAPIDE Comment extraire des données structurées d'un PDF Collectez des contacts et des identifiants de recherche dans une liste organisée. Narration en anglais Regarder la vidéo

Comment extraire des données structurées d'un PDF

Quand est-ce utile ?

Recherche

Collecter des identifiants

Rassemblez les valeurs DOI et ISBN avec les pages où elles apparaissent.

Rapports

Extraire des détails numériques

Trouvez des entrées datées et des adresses IPv4.

Répertoires

Constituer une liste de contacts

Combinez e-mails, téléphones et liens web dans une exportation structurée.

Fonctionnalités et contrôles

Sélectionner des types de données utiles

Commencez par les e-mails, téléphones et URL, puis ouvrez Plus de types de données pour des valeurs spécialisées.

Ce que prennent en charge les outils de reconnaissance

Les dates doivent utiliser un format numérique avec une année à quatre chiffres ; les valeurs jour/mois ambiguës conservent leur ordre source. Les octets IPv4 sont validés ; IPv6 n'est pas inclus.

Les domaines sont dérivés des e-mails et liens web reconnus, et non de noms de fichiers arbitraires. L'extraction de DOI couvre les formes modernes courantes, pas toutes les formes historiques. Les valeurs ISBN-13 nécessitent une somme de contrôle valide ; l'ISBN-10 nécessite également une étiquette ISBN. Les hashtags peuvent contenir des lettres Unicode, y compris l'arabe.

Les adresses MAC utilisent six paires séparées par des deux-points ou des traits d'union. L'outil ne contacte jamais les adresses ou identifiants extraits.

Vérifier les valeurs avec leurs pages sources

Vérifiez les totaux, accédez à une page PDF et filtrez la liste des résultats.

Examiner et organiser

Chaque résultat enregistre la position physique de la page dans le PDF, ce qui peut différer des numéros de page imprimés. Sélectionnez une puce de page pour ouvrir l'aperçu avec une mise en surbrillance approximative.

La suppression des doublons est activée par défaut. Les totaux combinent les répétitions reconnues de la même valeur ; désactivez cette option pour voir les occurrences séparées. Le tri alphabétique modifie l'ordre de la liste. Le filtrage s'applique également à la copie et aux téléchargements ainsi qu'aux lignes visibles.

Copier les valeurs ou télécharger une liste structurée

Choisissez CSV pour les totaux et les pages, ou TXT pour une valeur par ligne.

Ce que contient chaque téléchargement

Le CSV contient les colonnes Type, Valeur, Total et Pages. L'encodage UTF-8 prend en charge l'arabe et d'autres scripts. Les valeurs pouvant être interprétées comme des formules de tableur sont précédées d'une apostrophe pour un import plus sûr.

TXT et Copier tout contiennent uniquement les valeurs, une par ligne. Toutes les lignes correspondant au filtre sont incluses, même lorsque le tableau à l'écran s'étend sur plusieurs pages de résultats. Aucun nouveau PDF n'est créé et le PDF source reste inchangé.

Gérer les extractions volumineuses

Traitez un PDF dans votre navigateur, avec des limites explicites et des avis de résultats partiels.

Fichiers, limites et pages numérisées

Chargez un PDF jusqu'à 50 MiB et 500 pages. L'extraction vérifie jusqu'à 250 000 caractères et 2 000 correspondances par page, 10 millions de caractères et 20 000 correspondances au total, et 2 000 annotations par page. Un budget d'extraction de 90 secondes limite les exécutions trop longues. Les documents très complexes peuvent mieux fonctionner s'ils sont divisés en fichiers plus petits.

Lorsqu'une limite est atteinte ou qu'une page ne peut pas être entièrement lue, les résultats affichent un avis et les exécutions limitées ou échouées exportent avec la mention partial dans le nom de fichier. Les pages sans texte sélectionnable sont comptées séparément. Utilisez l'OCR PDF pour les scans d'images uniquement, puis revenez pour extraire le texte reconnu.

Le contenu PDF est traité localement dans ce navigateur. Les documents téléchargés ne sont pas envoyés vers un serveur d'extraction. Les liens, adresses e-mail et numéros de téléphone trouvés dans le PDF ne sont jamais contactés automatiquement.

Fichiers pris en charge et traitement

Entrée
PDF
Sortie
CSV / TXT

Ouvrez un PDF jusqu'à 50 Mo et 750 pages. Des limites supplémentaires de sortie, de mémoire et de traitement peuvent s'appliquer aux documents complexes.

Le traitement s'effectue sur votre appareil sans téléchargement du document. Téléchargez votre résultat avant de fermer la page ; conservez l'original séparément.

Advertisements
FAQ

Quelques réponses utiles

Sachez à quoi vous attendre avant de commencer.

Sur votre appareil
Que peut reconnaître cet outil ?

Choisissez les types de données dont vous avez besoin : e-mails, numéros de téléphone, URL, dates numériques, adresses IPv4, domaines, DOI, ISBN, hashtags et adresses MAC. Examinez les valeurs extraites avec les comptes et les références de page. Cet outil extrait des valeurs reconnaissables, pas des tableaux, des factures ou des champs sémantiques. Les modèles et les sommes de contrôle réduisent le bruit mais ne garantissent pas l'exhaustivité et ne prouvent pas qu'un identifiant est authentique.

Puis-je extraire des données de PDF numérisés ?

Seuls le texte sélectionnable et les cibles de lien reconnues sont lus. Les pages contenant uniquement des images nécessitent d'abord une OCR PDF. Exécutez l'OCR, téléchargez le PDF interrogeable, puis revenez à cet extracteur.

Comment les doublons et les totaux sont-ils gérés ?

La suppression des doublons combine les valeurs équivalentes reconnues. Le compteur indique les occurrences détectées et Pages liste les positions physiques des pages du PDF. Désactivez l'option pour conserver les occurrences séparées. Une cible imprimée et un lien cliquable correspondant sur la même page ne sont pas comptés deux fois.

Quelle est la différence entre CSV et TXT ?

Le format CSV inclut le type, la valeur, le nombre d'occurrences et les références de page. TXT et Copier tout fournissent uniquement les valeurs, une par ligne. Toutes les lignes correspondant au filtre actuel sont incluses, pas seulement la page de tableau visible.

Le PDF est-il téléchargé pour l'extraction ?

Non. L'analyse, la correspondance et les exportations PDF s'exécutent dans ce navigateur. Le PDF original reste inchangé. Aucun lien, e-mail ou numéro de téléphone extrait n'est contacté automatiquement.

Quelles sont les limites ?

Un PDF jusqu'à 50 MiB et 500 pages. L'extraction est limitée à 250 000 caractères de texte et 2 000 correspondances par page, 10 millions de caractères et 20 000 correspondances au total, et 2 000 annotations par page. Les résultats comportent un avis si les limites ou des pages illisibles les rendent partiels.

Continuer

Que souhaitez-vous faire ensuite ?

Choisissez un outil. Votre PDF final vous accompagne.

PDF

Advertisements

Langue38

English العربية Français Italiano Deutsch Español Português Nederlands Русский Türkçe 日本語 中文 हिन्दी Bahasa Indonesia Bahasa Melayu 한국어 Tiếng Việt ไทย Polski Svenska Українська Norsk বাংলা Ελληνικά فارسی اردو Čeština Dansk Magyar Română Suomi Български Filipino ქართული Slovenčina Azərbaycanca עברית Slovenščina