Ouvrez Extraire des données d'un PDF pour collecter des valeurs à partir d'un PDF sans avoir à les copier ligne par ligne. La comparaison utilise le document échantillon réel et un CSV téléchargé depuis l'outil. Avec les e-mails, téléphones, URLs, DOI, ISBN et IPv4 sélectionnés, l'échantillon de trois pages produit 11 lignes uniques à partir de 15 occurrences.
Ouvrez votre PDF
Téléversez un PDF, ou sélectionnez Essayer l'exemple pour suivre cet exemple. L'aperçu du PDF et les vignettes des pages s'affichent. Votre fichier original reste inchangé et l'extraction s'exécute dans votre navigateur.
Un répertoire, un rapport, un document de recherche ou une brochure basé sur du texte constitue un point de départ utile. Les scans composés uniquement d'images nécessitent un OCR avant que leur texte imprimé puisse être reconnu.
Choisissez les options utiles
Sur un téléphone, ouvrez Paramètres. Sur ordinateur, utilisez le panneau des paramètres à côté de l'aperçu.
Sous Éléments à extraire, les e-mails, numéros de téléphone et URLs sont sélectionnés par défaut. Ouvrez Plus de types de données et sélectionnez également DOI, ISBN et Adresses IPv4. Laissez la suppression des doublons activée et choisissez CSV.
Extrayez et vérifiez les correspondances
Sélectionnez Extraire. Une fois le traitement terminé, l'onglet Résultats affiche les valeurs, le nombre d'occurrences et les pages sources. Sélectionnez un numéro de page circulaire pour inspecter son emplacement dans l'aperçu du PDF, puis revenez aux Résultats.
La sortie combine la liste de contacts avec le DOI 10.1000/182, l'ISBN 978-0-306-40615-7 et l'adresse IPv4 192.0.2.10 de la page 2. La colonne Type identifie chaque valeur. Filtrez par un mot ou un identifiant pertinent avant de copier ou de télécharger un sous-ensemble plus restreint.
Utilisez Filtrer les résultats… pour restreindre la liste. La copie et le téléchargement incluent toutes les lignes correspondantes, même lorsque le tableau des résultats s'étend sur plusieurs écrans.
Téléchargez le CSV ou le TXT
Sélectionnez Télécharger le CSV, puis utilisez le bouton principal Télécharger sur l'écran prêt. Le CSV contient les colonnes Type, Valeur, Occurrences et Pages. Le TXT et Copier tout contiennent une valeur par ligne.
Les valeurs CSV qui pourraient être interprétées comme des formules de tableur sont protégées par une apostrophe initiale. Par exemple, un numéro de téléphone international commence par un signe plus. Utilisez le TXT si vous avez besoin d'une liste simple sans protection pour tableur.
Questions fréquentes
Est-ce que cela extrait n'importe quel nombre ou chaque identifiant ?
Non. Chaque catégorie sélectionnée possède ses propres règles de reconnaissance. Les IPv6, pourcentages, prix et numéros de carte de paiement ne sont pas extraits. Vérifiez les correspondances par rapport à la source ; un formatage valide ne peut pas confirmer qu'un contact ou un identifiant existe réellement.
Que dois-je faire avec un PDF scanné ?
Exécutez OCR du PDF d'abord, puis chargez la copie reconnue dans cet outil. Vérifiez attentivement la sortie OCR : un caractère erroné peut modifier une adresse ou un identifiant.
Quelles sont les limites d'extraction ?
Utilisez un PDF jusqu'à 50 MiB et 750 pages. L'extraction est limitée à 20,000 correspondances au total et 2,000 par page, avec un budget de traitement de 90 secondes. Des limites de texte et d'annotation s'appliquent également. Si une limite ou une page illisible interrompt l'analyse, l'outil affiche un avis de résultats partiels et marque le nom du fichier d'exportation comme partiel.
Mes liens PDF sont-ils ouverts automatiquement ?
Non. L'extraction lit le fichier dans le navigateur et ne visite pas les destinations extraites. Les boutons de page permettent de naviguer dans l'aperçu du PDF.
Conservez les valeurs et leur contexte
Extrayez une liste ciblée, vérifiez les pages sources et téléchargez le format qui convient à votre prochaine étape.

