Outils150

UN GUIDE PRATIQUE PDF

Comment extraire des donnéesstructurées d'un PDF

Collectez des contacts et des identifiants de recherche dans une liste organisée.

Avec les e-mails, téléphones, URLs, DOI, ISBN et IPv4 sélectionnés, l'exemple de trois pages produit 11 lignes uniques à partir de 15 occurrences.

Suivre le guide
UN EXEMPLE D'OUTIL RÉEL
Page PDFUne page de l'échantillon PDF réel
Valeurs extraitesValeurs et références de page issues du téléchargement CSV réel
Six types de données sélectionnés produisent 11 lignes uniques dans le CSV réel, incluant des entrées DOI, ISBN et IPv4 sur la page 2.
Advertisements
TUTORIEL VIDÉO RAPIDE Comment extraire des données structurées d'un PDF Collectez des contacts et des identifiants de recherche dans une liste organisée. Narration en anglais Regarder la vidéo

Comment extraire des données structurées d'un PDF

Advertisements

Ouvrez Extraire des données d'un PDF pour collecter des valeurs à partir d'un PDF sans avoir à les copier ligne par ligne. La comparaison utilise le document échantillon réel et un CSV téléchargé depuis l'outil. Avec les e-mails, téléphones, URLs, DOI, ISBN et IPv4 sélectionnés, l'échantillon de trois pages produit 11 lignes uniques à partir de 15 occurrences.

01

Ouvrez votre PDF

Téléversez un PDF, ou sélectionnez Essayer l'exemple pour suivre cet exemple. L'aperçu du PDF et les vignettes des pages s'affichent. Votre fichier original reste inchangé et l'extraction s'exécute dans votre navigateur.

Un répertoire, un rapport, un document de recherche ou une brochure basé sur du texte constitue un point de départ utile. Les scans composés uniquement d'images nécessitent un OCR avant que leur texte imprimé puisse être reconnu.

02

Choisissez les options utiles

Sur un téléphone, ouvrez Paramètres. Sur ordinateur, utilisez le panneau des paramètres à côté de l'aperçu.

Sous Éléments à extraire, les e-mails, numéros de téléphone et URLs sont sélectionnés par défaut. Ouvrez Plus de types de données et sélectionnez également DOI, ISBN et Adresses IPv4. Laissez la suppression des doublons activée et choisissez CSV.

03

Extrayez et vérifiez les correspondances

Sélectionnez Extraire. Une fois le traitement terminé, l'onglet Résultats affiche les valeurs, le nombre d'occurrences et les pages sources. Sélectionnez un numéro de page circulaire pour inspecter son emplacement dans l'aperçu du PDF, puis revenez aux Résultats.

La sortie combine la liste de contacts avec le DOI 10.1000/182, l'ISBN 978-0-306-40615-7 et l'adresse IPv4 192.0.2.10 de la page 2. La colonne Type identifie chaque valeur. Filtrez par un mot ou un identifiant pertinent avant de copier ou de télécharger un sous-ensemble plus restreint.

Utilisez Filtrer les résultats… pour restreindre la liste. La copie et le téléchargement incluent toutes les lignes correspondantes, même lorsque le tableau des résultats s'étend sur plusieurs écrans.

04

Téléchargez le CSV ou le TXT

Sélectionnez Télécharger le CSV, puis utilisez le bouton principal Télécharger sur l'écran prêt. Le CSV contient les colonnes Type, Valeur, Occurrences et Pages. Le TXT et Copier tout contiennent une valeur par ligne.

Les valeurs CSV qui pourraient être interprétées comme des formules de tableur sont protégées par une apostrophe initiale. Par exemple, un numéro de téléphone international commence par un signe plus. Utilisez le TXT si vous avez besoin d'une liste simple sans protection pour tableur.

QUELQUES DÉTAILS UTILES

Questions fréquentes

Est-ce que cela extrait n'importe quel nombre ou chaque identifiant ?

Non. Chaque catégorie sélectionnée possède ses propres règles de reconnaissance. Les IPv6, pourcentages, prix et numéros de carte de paiement ne sont pas extraits. Vérifiez les correspondances par rapport à la source ; un formatage valide ne peut pas confirmer qu'un contact ou un identifiant existe réellement.

Que dois-je faire avec un PDF scanné ?

Exécutez OCR du PDF d'abord, puis chargez la copie reconnue dans cet outil. Vérifiez attentivement la sortie OCR : un caractère erroné peut modifier une adresse ou un identifiant.

Quelles sont les limites d'extraction ?

Utilisez un PDF jusqu'à 50 MiB et 750 pages. L'extraction est limitée à 20,000 correspondances au total et 2,000 par page, avec un budget de traitement de 90 secondes. Des limites de texte et d'annotation s'appliquent également. Si une limite ou une page illisible interrompt l'analyse, l'outil affiche un avis de résultats partiels et marque le nom du fichier d'exportation comme partiel.

Mes liens PDF sont-ils ouverts automatiquement ?

Non. L'extraction lit le fichier dans le navigateur et ne visite pas les destinations extraites. Les boutons de page permettent de naviguer dans l'aperçu du PDF.

À VOUS DE JOUER

Conservez les valeurs et leur contexte

Extrayez une liste ciblée, vérifiez les pages sources et téléchargez le format qui convient à votre prochaine étape.

Ouvrir Extraire des données d'un PDF

Détail de l'image

Advertisements

Langue38

English العربية Français Italiano Deutsch Español Português Nederlands Русский Türkçe 日本語 中文 हिन्दी Bahasa Indonesia Bahasa Melayu 한국어 Tiếng Việt ไทย Polski Svenska Українська Norsk বাংলা Ελληνικά فارسی اردو Čeština Dansk Magyar Română Suomi Български Filipino ქართული Slovenčina Azərbaycanca עברית Slovenščina