Отворете Извличане на данни от PDF, за да съберете стойности от един PDF, без да ги копирате ред по ред. Сравнението използва реалния примерен документ и CSV, изтеглен от инструмента. С избрани имейли, телефони, URL адреси, DOI, ISBN и IPv4, тристраничният примерен файл генерира 11 уникални реда от 15 срещания.
Отворете вашия PDF
Качете един PDF или изберете Опитайте примерен файл, за да проследите този пример. Появяват се визуализация на PDF и миниатюри на страниците. Вашият оригинален файл остава непроменен, а извличането се извършва във вашия браузър.
Текстово базирана директория, отчет, изследователска работа или брошура са полезна отправна точка. Сканираните документи, съдържащи само изображения, се нуждаят от OCR, преди отпечатаният текст да може да бъде разпознат.
Изберете полезните опции
На телефон отворете Настройки. На компютър използвайте панела с настройки до визуализацията.
В секция Какво да се извлече имейлите, телефонните номера и URL адресите са избрани по подразбиране. Отворете Още типове данни и изберете също DOI, ISBN и IPv4 адреси. Оставете премахването на дубликати включено и изберете CSV.
Извлечете и проверете съвпаденията
Изберете Извличане. Когато обработката приключи, разделът Резултати показва стойностите, броя на срещанията и изходните страници. Изберете кръгъл номер на страница, за да проверите местоположението ѝ в PDF визуализацията, след което се върнете към Резултати.
Изходните данни комбинират списъка с контакти с DOI 10.1000/182, ISBN 978-0-306-40615-7 и IPv4 адрес 192.0.2.10 от страница 2. Колоната Тип идентифицира всяка стойност. Филтрирайте по подходяща дума или идентификатор, преди да копирате или изтеглите по-малък подмножество.
Използвайте Филтриране на резултатите, за да стесните списъка. Копирането и изтеглянето включват всички съвпадащи редове, дори когато таблицата с резултати обхваща няколко екрана с редове.
Изтеглете CSV или TXT
Изберете Изтегли CSV, след което използвайте основния бутон Изтегли на екрана за готовност. CSV съдържа колони Тип, Стойност, Брой и Страници. TXT и Копирай всичко съдържат по една стойност на ред.
CSV стойностите, които биха могли да бъдат интерпретирани като електронни таблични формули, са защитени с водещ апостроф. Например, международен телефонен номер започва с плюс. Използвайте TXT, ако ви е необходим чист списък без защита за електронни таблици.
Често задавани въпроси
Извлича ли това всяко число или всеки идентификатор?
Не. Всяка избрана категория има свои собствени правила за разпознаване. IPv6, проценти, цени и номера на платежни карти не се извличат. Проверете съвпаденията спрямо източника; валидното форматиране не може да потвърди, че даден контакт или идентификатор съществува.
Какво да направя със сканиран PDF?
Първо изпълнете PDF OCR, след което заредете разпознатото копие в този инструмент. Проверете внимателно изхода от OCR: грешен символ може да промени адрес или идентификатор.
Какви са ограниченията за извличане?
Използвайте един PDF до 50 MiB и 750 страници. Извличането е ограничено до 20 000 съвпадения общо и 2 000 на страница, с бюджет за обработка от 90 секунди. Прилагат се и ограничения за текст и анотации. Ако ограничение или нечетлива страница прекъсне сканирането, инструментът показва известие за частични резултати и маркира името на файла за експортиране като частично.
Автоматично ли се отварят моите PDF връзки?
Не. Извличането чете файла в браузъра и не посещава извлечените дестинации. Бутоните за страници навигират в рамките на PDF визуализацията.
Запазете стойностите и техния контекст
Извлечете фокусиран списък, проверете изходните страници и изтеглете формата, който отговаря на следващата ви стъпка.

