Инструменти150

Полезна PDF задача, направена лесно

Извличане на връзки от PDF.

Извлечете полезните връзки от вашия PDF.

Advertisements
Вашето PDF работно пространство
На вашето устройство
или пуснете файловете си тук
Вашият PDF се обработва в този браузър. PDF
Advertisements

Как да извлечем връзки от PDF

  1. 01

    Изберете един PDF

    Заредете документ с избираем текст или опитайте примерния файл.

  2. 02

    Извличане и преглед

    Изберете Извличане. Прегледайте стойностите, броя срещания и изходните страници; филтрирайте или сортирайте списъка.

  3. 03

    Копиране или изтегляне

    Копирайте стойностите или изтеглете CSV с препратки към страници или обикновен TXT списък.

БлогКак да извлечем връзки и URL адреси от PDFПрочетете ръководството

Извличане на PDF връзки без отваряне на всяка страница

Събирайте отпечатани HTTP/HTTPS адреси, www адреси и кликаеми цели на уеб връзки от един PDF. Запазете препратките към страници и изтеглете дедупликиран списък като CSV или TXT.

Разпознатите стойности се превръщат в списък с препратки към изходни страници.
КРАТЪК ВИДЕО УРОК Как да извлечем връзки и URL адреси от PDF Запазете полезните уеб връзки, без да ги отваряте една по една. Английски разказ Гледайте видеото

Как да извлечем връзки и URL адреси от PDF

Кога е полезно това?

Референции

Събиране на изходни връзки

Създайте списък с референции от отчети и изследователски документи.

Ресурси

Запазване на полезни дестинации

Извлечете дестинациите зад кликаеми етикети на ресурси.

Преглед

Поддържане на списък за одит

Запишете къде е намерена всяка връзка, преди да я прегледате другаде.

Функции и контроли

Намиране на видими и кликаеми връзки

Включете целта на връзката, дори когато етикетът ѝ гласи само „Прочети повече“.

Как работи извличането на връзки

Разпознават се отпечатани връзки, започващи с http://, https:// или www. PDF анотациите на връзки също могат да разкрият HTTP/HTTPS цели зад обикновен текст. PDF файлът не е задължително да показва URL адреса като свой кликаем етикет.

Идентичните отпечатани цели и анотации на една страница не се броят два пъти. За сравнение на дубликати се използват нормализирани URL форми, докато се показва първото разпознато изписване. Дълги, пренесени или повредени URL адреси може да изискват ръчна корекция. Нито един извлечен URL адрес не се извлича автоматично.

Преглед на стойностите с техните изходни страници

Проверявайте броя, прескачайте към страница от PDF и филтрирайте списъка с резултати.

Преглед и организиране

Всеки резултат записва физическата позиция на страницата в PDF файла, която може да се различава от отпечатаните номера на страници. Изберете чип на страница, за да отворите визуализацията с приблизително маркиране.

Премахването на дубликати е включено по подразбиране. Броячите комбинират разпознати повторения на една и съща стойност; изключете го, за да видите отделните срещания. Сортирането по азбучен ред променя подредбата на списъка. Филтрирането се прилага както за копиране и изтегляне, така и за видимите редове.

Копиране на стойности или изтегляне на структуриран списък

Изберете CSV за брой и страници или TXT за една стойност на ред.

Какво съдържа всяко изтегляне

CSV съдържа колони Тип, Стойност, Брой и Страници. UTF-8 кодирането поддържа арабски и други скриптове. Стойностите, които могат да бъдат интерпретирани като формули за електронни таблици, са с префикс апостроф за по-безопасно импортиране.

TXT и „Копирай всичко“ съдържат само стойности, по една на ред. Всички редове, съответстващи на филтъра, са включени, дори когато таблицата на екрана обхваща няколко страници с резултати. Не се създава нов PDF файл и изходният PDF остава непроменен.

Поддържане на големи извличания в управляем вид

Обработвайте един PDF файл във вашия браузър с изрични ограничения и известия за частични резултати.

Файлове, ограничения и сканирани страници

Заредете един PDF файл до 50 MiB и 500 страници. Извличането проверява до 250 000 знака и 2 000 съвпадения на страница, 10 милиона знака и 20 000 съвпадения общо, и 2 000 анотации на страница. Бюджет от 90 секунди за извличане ограничава дългите процеси. Много сложни документи може да работят по-добре, ако бъдат разделени на по-малки файлове.

Когато се достигне ограничение или страница не може да бъде прочетена напълно, резултатите показват известие, а ограничените или неуспешните изпълнения се експортират с „partial“ в името на файла. Страниците без избираем текст се броят отделно. Използвайте PDF OCR за сканирания само с изображения, след което се върнете, за да извлечете разпознатия текст.

PDF съдържанието се обработва локално в този браузър. Качените документи не се изпращат до сървър за извличане. Връзките, имейл адресите и телефонните номера, намерени в PDF файла, никога не се свързват автоматично.

Поддържани файлове и обработка

Вход
PDF
Изход
CSV / TXT

Отворете един PDF файл до 50 MB и 750 страници. За сложни документи могат да се прилагат допълнителни ограничения за изход, памет и обработка.

Обработката се извършва на вашето устройство, без да се качва документът. Изтеглете резултата, преди да затворите страницата; съхранявайте оригинала отделно.

Advertisements
ЧЗВ

Няколко полезни отговора

Знайте какво да очаквате, преди да започнете.

На вашето устройство
Какво може да разпознае този инструмент?

Събирайте отпечатани HTTP/HTTPS адреси, www адреси и цели на кликаеми уеб връзки от един PDF файл. Запазете препратките към страници и изтеглете списък без дубликати във формат CSV или TXT. Инструментът не проверява дали връзките все още работят. Вътрешни дестинации в страници, JavaScript действия, mailto и други не-уеб схеми не се експортират като уеб връзки.

Мога ли да извличам данни от сканирани PDF файлове?

Чете се само избираем текст и разпознати цели на връзки. Страниците, съдържащи само изображения, се нуждаят първо от PDF OCR. Изпълнете OCR, изтеглете PDF файла с възможност за търсене и след това се върнете към този екстрактор.

Как се обработват дубликатите и броячите?

Премахването на дубликати комбинира разпознати еквивалентни стойности. Броячът показва засечените срещания, а „Страници“ изброява физическите позиции на страниците в PDF файла. Деактивирайте опцията, за да запазите срещанията отделно. Отпечатана цел и съответстваща кликаема връзка на една и съща страница не се броят два пъти.

Каква е разликата между CSV и TXT?

CSV включва тип, стойност, брой срещания и препратки към страници. TXT и „Копирай всичко“ предоставят само стойностите, по една на ред. Включени са всички редове, съответстващи на текущия филтър, а не само видимата страница на таблицата.

Качва ли се PDF файлът за извличане?

Не. Анализирането, съпоставянето и експортирането на PDF се извършват в този браузър. Оригиналният PDF файл остава непроменен. Нито една извлечена връзка, имейл или телефонен номер не се свързва автоматично.

Какви са ограниченията?

Един PDF файл до 50 MiB и 500 страници. Извличането е ограничено до 250 000 текстови знака и 2 000 съвпадения на страница, 10 милиона знака и 20 000 съвпадения общо, и 2 000 анотации на страница. Резултатите съдържат известие, ако ограниченията или нечетимите страници ги правят частични.

Продължете

Какво бихте искали да направите след това?

Изберете инструмент. Вашият готов PDF ще бъде с вас.

PDF

Advertisements

език38

English العربية Français Italiano Deutsch Español Português Nederlands Русский Türkçe 日本語 中文 हिन्दी Bahasa Indonesia Bahasa Melayu 한국어 Tiếng Việt ไทย Polski Svenska Українська Norsk বাংলা Ελληνικά فارسی اردو Čeština Dansk Magyar Română Suomi Български Filipino ქართული Slovenčina Azərbaycanca עברית Slovenščina