Інструменти150

Корисне завдання з PDF, зроблене просто

Витяг посилань з PDF.

Витягніть корисні посилання з вашого PDF.

Advertisements
Ваш робочий простір PDF
На вашому пристрої
або перетягніть файли сюди
Ваш PDF обробляється у цьому браузері. PDF
Advertisements

Як витягти посилання з PDF

  1. 01

    Виберіть один PDF

    Завантажте документ із виділеним текстом або спробуйте зразок.

  2. 02

    Витягти та перевірити

    Виберіть «Витягти». Перегляньте значення, кількість та вихідні сторінки; відфільтруйте або відсортуйте список.

  3. 03

    Копіювати або завантажити

    Скопіюйте значення або завантажте CSV з посиланнями на сторінки чи простий список TXT.

БлогЯк витягти посилання та URL-адреси з PDFЧитати посібник

Витяг посилань з PDF без відкриття кожної сторінки

Збирайте надруковані HTTP/HTTPS-адреси, www-адреси та клікабельні цілі веб-посилань з одного PDF. Зберігайте посилання на сторінки та завантажуйте список без дублікатів у форматі CSV або TXT.

Розпізнані значення стають списком із посиланнями на вихідні сторінки.
ШВИДКИЙ ВІДЕОУРОК Як витягти посилання та URL-адреси з PDF Зберігайте корисні веб-посилання, не відкриваючи їх по одному. Англійська озвучка Дивитися відео

Як витягти посилання та URL-адреси з PDF

Коли це корисно?

Посилання

Збір посилань на джерела

Створіть список літератури зі звітів та дослідницьких документів.

Ресурси

Збереження корисних цілей

Витягніть цілі, що стоять за клікабельними мітками ресурсів.

Огляд

Ведення списку перевірки

Записуйте, де було знайдено кожне посилання, перш ніж переглядати його в іншому місці.

Функції та елементи керування

Пошук видимих і клікабельних посилань

Включайте ціль посилання, навіть якщо його підпис містить лише «Читати далі».

Як працює вилучення посилань

Розпізнаються надруковані посилання, що починаються з http://, https:// або www. Анотації посилань у PDF також можуть виявляти цілі HTTP/HTTPS за звичайним текстом. PDF не обов'язково повинен відображати URL-адресу як клікабельний підпис.

Ідентичні надруковані цілі та анотації на сторінці не враховуються двічі. Для порівняння дублікатів використовуються нормалізовані форми URL, тоді як відображається перше розпізнане написання. Довгі, перенесені або пошкоджені URL-адреси можуть потребувати ручного виправлення. Жодна вилучена URL-адреса не завантажується автоматично.

Перегляд значень разом із вихідними сторінками

Перевіряйте кількість, переходьте до сторінки PDF та фільтруйте список результатів.

Перегляд та впорядкування

Кожен результат фіксує фізичне розташування на сторінці PDF, яке може відрізнятися від надрукованих номерів сторінок. Виберіть мітку сторінки, щоб відкрити попередній перегляд із приблизним виділенням.

Функція видалення дублікатів увімкнена за замовчуванням. Лічильники об'єднують розпізнані повтори одного й того самого значення; вимкніть її, щоб побачити окремі входження. Сортування за алфавітом змінює порядок списку. Фільтрація застосовується як до копіювання та завантаження, так і до видимих рядків.

Копіювання значень або завантаження структурованого списку

Виберіть CSV для підрахунку та сторінок або TXT для одного значення в рядку.

Що містить кожне завантаження

CSV містить стовпці «Тип», «Значення», «Кількість» та «Сторінки». Кодування UTF-8 підтримує арабську та інші мови. Значення, які можуть бути інтерпретовані як формули електронних таблиць, мають префікс апострофа для безпечнішого імпорту.

TXT та «Копіювати все» містять лише значення, по одному в рядку. Всі рядки, що відповідають фільтру, включаються, навіть якщо таблиця на екрані охоплює кілька сторінок результатів. Новий PDF не створюється, а вихідний PDF залишається незмінним.

Керування великими обсягами вилучених даних

Обробляйте один PDF у вашому браузері з чіткими обмеженнями та повідомленнями про часткові результати.

Файли, обмеження та скановані сторінки

Завантажуйте один PDF розміром до 50 МБ і до 500 сторінок. Вилучення перевіряє до 250 000 символів і 2 000 збігів на сторінку, 10 мільйонів символів і 20 000 збігів загалом, а також 2 000 анотацій на сторінку. Бюджет часу на вилучення у 90 секунд обмежує тривалі операції. Дуже складні документи можуть краще оброблятися, якщо їх розділити на менші файли.

Коли досягається ліміт або сторінку неможливо повністю прочитати, результати показують повідомлення, а експорт обмежених або невдалих запусків містить слово partial у назві файлу. Сторінки без виділеного тексту рахуються окремо. Використовуйте PDF OCR для сканів, що містять лише зображення, а потім поверніться, щоб вилучити розпізнаний текст.

Вміст PDF обробляється локально в цьому браузері. Завантажені документи не надсилаються на сервер вилучення. Посилання, адреси електронної пошти та номери телефонів, знайдені всередині PDF, ніколи не відкриваються автоматично.

Підтримувані файли та обробка

Вхідні дані
PDF
Вихідні дані
CSV / TXT

Відкрийте один PDF розміром до 50 МБ та 750 сторінок. Для складних документів можуть застосовуватися додаткові обмеження щодо виводу, пам'яті та обробки.

Обробка відбувається на вашому пристрої без завантаження документа. Завантажте результат перед закриттям сторінки; зберігайте оригінал окремо.

Advertisements
Найбільш поширені запитання

Кілька корисних відповідей

Знайте, чого очікувати, перш ніж почати.

На вашому пристрої
Що може розпізнати цей інструмент?

Збирайте друковані HTTP/HTTPS-адреси, www-адреси та цілі клікабельних веб-посилань з одного PDF. Зберігайте посилання на сторінки та завантажуйте список без дублікатів у форматі CSV або TXT. Інструмент не перевіряє, чи працюють посилання. Внутрішні призначення сторінок, JavaScript-дії, mailto та інші не-веб схеми не експортуються як веб-посилання.

Чи можу я витягти дані зі сканованих PDF?

Зчитується лише виділений текст і розпізнані цілі посилань. Сторінки, що складаються лише з зображень, спочатку потребують PDF OCR. Виконайте OCR, завантажте PDF з можливістю пошуку, а потім поверніться до цього екстрактора.

Як обробляються дублікати та підрахунки?

Видалення дублікатів об'єднує розпізнані еквівалентні значення. «Кількість» показує виявлені входження, а «Сторінки» перераховують фізичні позиції сторінок PDF. Вимкніть цю опцію, щоб зберегти входження окремо. Друкована ціль і відповідне клікабельне посилання на одній сторінці не враховуються двічі.

У чому різниця між CSV та TXT?

CSV містить тип, значення, кількість входжень і посилання на сторінки. TXT та «Копіювати все» надають лише значення, по одному в рядку. Включаються всі рядки, що відповідають поточному фільтру, а не лише видима сторінка таблиці.

Чи завантажується PDF для вилучення?

Ні. Аналіз PDF, зіставлення та експорт виконуються в цьому браузері. Оригінальний PDF залишається незмінним. Жодне вилучене посилання, електронна адреса чи номер телефону не відкриваються автоматично.

Які існують обмеження?

Один PDF до 50 MiB і 500 сторінок. Витягнення обмежене 250 000 текстових символів і 2 000 збігів на сторінку, 10 мільйонами символів і 20 000 збігів загалом, а також 2 000 анотацій на сторінку. Результати містять повідомлення, якщо обмеження або нечитабельні сторінки роблять їх частковими.

Продовжити

Що ви хочете зробити далі?

Виберіть інструмент. Ваш готовий PDF залишиться з вами.

PDF

Advertisements

Мову38

English العربية Français Italiano Deutsch Español Português Nederlands Русский Türkçe 日本語 中文 हिन्दी Bahasa Indonesia Bahasa Melayu 한국어 Tiếng Việt ไทย Polski Svenska Українська Norsk বাংলা Ελληνικά فارسی اردو Čeština Dansk Magyar Română Suomi Български Filipino ქართული Slovenčina Azərbaycanca עברית Slovenščina