Инструменти150

Полезна PDF задача, направена лесно

Извличане на данни от PDF.

Намерете данните, от които се нуждаете. Запазете изходната страница с всеки резултат.

Advertisements
Вашето PDF работно пространство
На вашето устройство
или пуснете файловете си тук
Вашият PDF се обработва в този браузър. PDF
Advertisements

Как да извлечем данни от PDF

  1. 01

    Изберете един PDF

    Заредете документ с избираем текст или опитайте примерния файл.

  2. 02

    Извличане и преглед

    Изберете Извличане. Прегледайте стойностите, броя срещания и изходните страници; филтрирайте или сортирайте списъка.

  3. 03

    Копиране или изтегляне

    Копирайте стойностите или изтеглете CSV с препратки към страници или обикновен TXT списък.

БлогКак да извлечем структурирани данни от PDFПрочетете ръководството

Извличане на структурирани стойности от PDF в CSV или текст

Изберете типовете данни, от които се нуждаете: имейли, телефонни номера, URL адреси, числови дати, IPv4 адреси, домейни, DOI, ISBN, хаштагове и MAC адреси. Прегледайте извлечените стойности с брой и препратки към страници.

Разпознатите стойности се превръщат в списък с препратки към изходни страници.
КРАТЪК ВИДЕО УРОК Как да извлечем структурирани данни от PDF Събирайте контакти и изследователски идентификатори в един организиран списък. Английски разказ Гледайте видеото

Как да извлечем структурирани данни от PDF

Кога е полезно това?

Проучвания

Събиране на идентификатори

Събирайте DOI и ISBN стойности заедно със страниците, на които се появяват.

Отчети

Извличане на числови детайли

Намиране на датирани записи и IPv4 адреси.

Директории

Създаване на списък с контакти

Комбинирайте имейли, телефони и уеб връзки в един структуриран експорт.

Функции и контроли

Избор на полезни типове данни

Започнете с имейли, телефони и URL адреси, след което отворете „Още типове данни“ за специализирани стойности.

Какво поддържат разпознавачите

Датите трябва да използват цифров формат с четирицифрена година; двусмислените стойности за ден/месец запазват изходния си ред. IPv4 октетите се валидират; IPv6 не е включен.

Домейните се извличат от разпознати имейли и уеб връзки, а не от произволни имена на файлове. Извличането на DOI обхваща често срещани съвременни форми на DOI, а не всяка историческа форма. Стойностите ISBN-13 се нуждаят от валидна контролна сума; ISBN-10 също се нуждае от етикет ISBN. Хаштаговете могат да съдържат Unicode букви, включително арабски.

MAC адресите използват шест двойки, разделени с двоеточие или тире. Инструментът никога не се свързва с извлечени адреси или идентификатори.

Преглед на стойностите с техните изходни страници

Проверявайте броя, прескачайте към страница от PDF и филтрирайте списъка с резултати.

Преглед и организиране

Всеки резултат записва физическата позиция на страницата в PDF файла, която може да се различава от отпечатаните номера на страници. Изберете чип на страница, за да отворите визуализацията с приблизително маркиране.

Премахването на дубликати е включено по подразбиране. Броячите комбинират разпознати повторения на една и съща стойност; изключете го, за да видите отделните срещания. Сортирането по азбучен ред променя подредбата на списъка. Филтрирането се прилага както за копиране и изтегляне, така и за видимите редове.

Копиране на стойности или изтегляне на структуриран списък

Изберете CSV за брой и страници или TXT за една стойност на ред.

Какво съдържа всяко изтегляне

CSV съдържа колони Тип, Стойност, Брой и Страници. UTF-8 кодирането поддържа арабски и други скриптове. Стойностите, които могат да бъдат интерпретирани като формули за електронни таблици, са с префикс апостроф за по-безопасно импортиране.

TXT и „Копирай всичко“ съдържат само стойности, по една на ред. Всички редове, съответстващи на филтъра, са включени, дори когато таблицата на екрана обхваща няколко страници с резултати. Не се създава нов PDF файл и изходният PDF остава непроменен.

Поддържане на големи извличания в управляем вид

Обработвайте един PDF файл във вашия браузър с изрични ограничения и известия за частични резултати.

Файлове, ограничения и сканирани страници

Заредете един PDF файл до 50 MiB и 500 страници. Извличането проверява до 250 000 знака и 2 000 съвпадения на страница, 10 милиона знака и 20 000 съвпадения общо, и 2 000 анотации на страница. Бюджет от 90 секунди за извличане ограничава дългите процеси. Много сложни документи може да работят по-добре, ако бъдат разделени на по-малки файлове.

Когато се достигне ограничение или страница не може да бъде прочетена напълно, резултатите показват известие, а ограничените или неуспешните изпълнения се експортират с „partial“ в името на файла. Страниците без избираем текст се броят отделно. Използвайте PDF OCR за сканирания само с изображения, след което се върнете, за да извлечете разпознатия текст.

PDF съдържанието се обработва локално в този браузър. Качените документи не се изпращат до сървър за извличане. Връзките, имейл адресите и телефонните номера, намерени в PDF файла, никога не се свързват автоматично.

Поддържани файлове и обработка

Вход
PDF
Изход
CSV / TXT

Отворете един PDF файл до 50 MB и 750 страници. За сложни документи могат да се прилагат допълнителни ограничения за изход, памет и обработка.

Обработката се извършва на вашето устройство, без да се качва документът. Изтеглете резултата, преди да затворите страницата; съхранявайте оригинала отделно.

Advertisements
ЧЗВ

Няколко полезни отговора

Знайте какво да очаквате, преди да започнете.

На вашето устройство
Какво може да разпознае този инструмент?

Изберете типовете данни, от които се нуждаете: имейли, телефонни номера, URL адреси, числови дати, IPv4 адреси, домейни, DOI, ISBN, хаштагове и MAC адреси. Прегледайте извлечените стойности с броячи и препратки към страници. Това извлича разпознаваеми стойности, а не таблици, фактури или семантични полета. Моделите и контролните суми намаляват шума, но не гарантират пълнота и не доказват, че идентификаторът е автентичен.

Мога ли да извличам данни от сканирани PDF файлове?

Чете се само избираем текст и разпознати цели на връзки. Страниците, съдържащи само изображения, се нуждаят първо от PDF OCR. Изпълнете OCR, изтеглете PDF файла с възможност за търсене и след това се върнете към този екстрактор.

Как се обработват дубликатите и броячите?

Премахването на дубликати комбинира разпознати еквивалентни стойности. Броячът показва засечените срещания, а „Страници“ изброява физическите позиции на страниците в PDF файла. Деактивирайте опцията, за да запазите срещанията отделно. Отпечатана цел и съответстваща кликаема връзка на една и съща страница не се броят два пъти.

Каква е разликата между CSV и TXT?

CSV включва тип, стойност, брой срещания и препратки към страници. TXT и „Копирай всичко“ предоставят само стойностите, по една на ред. Включени са всички редове, съответстващи на текущия филтър, а не само видимата страница на таблицата.

Качва ли се PDF файлът за извличане?

Не. Анализирането, съпоставянето и експортирането на PDF се извършват в този браузър. Оригиналният PDF файл остава непроменен. Нито една извлечена връзка, имейл или телефонен номер не се свързва автоматично.

Какви са ограниченията?

Един PDF файл до 50 MiB и 500 страници. Извличането е ограничено до 250 000 текстови знака и 2 000 съвпадения на страница, 10 милиона знака и 20 000 съвпадения общо, и 2 000 анотации на страница. Резултатите съдържат известие, ако ограниченията или нечетимите страници ги правят частични.

Продължете

Какво бихте искали да направите след това?

Изберете инструмент. Вашият готов PDF ще бъде с вас.

PDF

Advertisements

език38

English العربية Français Italiano Deutsch Español Português Nederlands Русский Türkçe 日本語 中文 हिन्दी Bahasa Indonesia Bahasa Melayu 한국어 Tiếng Việt ไทย Polski Svenska Українська Norsk বাংলা Ελληνικά فارسی اردو Čeština Dansk Magyar Română Suomi Български Filipino ქართული Slovenčina Azərbaycanca עברית Slovenščina