Збір посилань на джерела
Створіть список літератури зі звітів та дослідницьких документів.
Витягніть корисні посилання з вашого PDF.
| Тип | Значення | Кількість | Сторінки |
|---|
Копіювання та завантаження включають усі відповідні рядки з усіх сторінок результатів. CSV включає кількість та номери сторінок PDF; TXT містить лише значення.
Виберіть номер сторінки в результатах, щоб перевірити джерело. Підсвічування показує приблизні позиції.
Ваш список готовий. Завантажте його або поверніться назад, щоб переглянути та змінити формат.
Завантажте документ із виділеним текстом або спробуйте зразок.
Виберіть «Витягти». Перегляньте значення, кількість та вихідні сторінки; відфільтруйте або відсортуйте список.
Скопіюйте значення або завантажте CSV з посиланнями на сторінки чи простий список TXT.
Збирайте надруковані HTTP/HTTPS-адреси, www-адреси та клікабельні цілі веб-посилань з одного PDF. Зберігайте посилання на сторінки та завантажуйте список без дублікатів у форматі CSV або TXT.
Створіть список літератури зі звітів та дослідницьких документів.
Витягніть цілі, що стоять за клікабельними мітками ресурсів.
Записуйте, де було знайдено кожне посилання, перш ніж переглядати його в іншому місці.
Включайте ціль посилання, навіть якщо його підпис містить лише «Читати далі».
Розпізнаються надруковані посилання, що починаються з http://, https:// або www. Анотації посилань у PDF також можуть виявляти цілі HTTP/HTTPS за звичайним текстом. PDF не обов'язково повинен відображати URL-адресу як клікабельний підпис.
Ідентичні надруковані цілі та анотації на сторінці не враховуються двічі. Для порівняння дублікатів використовуються нормалізовані форми URL, тоді як відображається перше розпізнане написання. Довгі, перенесені або пошкоджені URL-адреси можуть потребувати ручного виправлення. Жодна вилучена URL-адреса не завантажується автоматично.
Перевіряйте кількість, переходьте до сторінки PDF та фільтруйте список результатів.
Кожен результат фіксує фізичне розташування на сторінці PDF, яке може відрізнятися від надрукованих номерів сторінок. Виберіть мітку сторінки, щоб відкрити попередній перегляд із приблизним виділенням.
Функція видалення дублікатів увімкнена за замовчуванням. Лічильники об'єднують розпізнані повтори одного й того самого значення; вимкніть її, щоб побачити окремі входження. Сортування за алфавітом змінює порядок списку. Фільтрація застосовується як до копіювання та завантаження, так і до видимих рядків.
Виберіть CSV для підрахунку та сторінок або TXT для одного значення в рядку.
CSV містить стовпці «Тип», «Значення», «Кількість» та «Сторінки». Кодування UTF-8 підтримує арабську та інші мови. Значення, які можуть бути інтерпретовані як формули електронних таблиць, мають префікс апострофа для безпечнішого імпорту.
TXT та «Копіювати все» містять лише значення, по одному в рядку. Всі рядки, що відповідають фільтру, включаються, навіть якщо таблиця на екрані охоплює кілька сторінок результатів. Новий PDF не створюється, а вихідний PDF залишається незмінним.
Обробляйте один PDF у вашому браузері з чіткими обмеженнями та повідомленнями про часткові результати.
Завантажуйте один PDF розміром до 50 МБ і до 500 сторінок. Вилучення перевіряє до 250 000 символів і 2 000 збігів на сторінку, 10 мільйонів символів і 20 000 збігів загалом, а також 2 000 анотацій на сторінку. Бюджет часу на вилучення у 90 секунд обмежує тривалі операції. Дуже складні документи можуть краще оброблятися, якщо їх розділити на менші файли.
Коли досягається ліміт або сторінку неможливо повністю прочитати, результати показують повідомлення, а експорт обмежених або невдалих запусків містить слово partial у назві файлу. Сторінки без виділеного тексту рахуються окремо. Використовуйте PDF OCR для сканів, що містять лише зображення, а потім поверніться, щоб вилучити розпізнаний текст.
Вміст PDF обробляється локально в цьому браузері. Завантажені документи не надсилаються на сервер вилучення. Посилання, адреси електронної пошти та номери телефонів, знайдені всередині PDF, ніколи не відкриваються автоматично.
Відкрийте один PDF розміром до 50 МБ та 750 сторінок. Для складних документів можуть застосовуватися додаткові обмеження щодо виводу, пам'яті та обробки.
Обробка відбувається на вашому пристрої без завантаження документа. Завантажте результат перед закриттям сторінки; зберігайте оригінал окремо.
Знайте, чого очікувати, перш ніж почати.
На вашому пристроїЗбирайте друковані HTTP/HTTPS-адреси, www-адреси та цілі клікабельних веб-посилань з одного PDF. Зберігайте посилання на сторінки та завантажуйте список без дублікатів у форматі CSV або TXT. Інструмент не перевіряє, чи працюють посилання. Внутрішні призначення сторінок, JavaScript-дії, mailto та інші не-веб схеми не експортуються як веб-посилання.
Зчитується лише виділений текст і розпізнані цілі посилань. Сторінки, що складаються лише з зображень, спочатку потребують PDF OCR. Виконайте OCR, завантажте PDF з можливістю пошуку, а потім поверніться до цього екстрактора.
Видалення дублікатів об'єднує розпізнані еквівалентні значення. «Кількість» показує виявлені входження, а «Сторінки» перераховують фізичні позиції сторінок PDF. Вимкніть цю опцію, щоб зберегти входження окремо. Друкована ціль і відповідне клікабельне посилання на одній сторінці не враховуються двічі.
CSV містить тип, значення, кількість входжень і посилання на сторінки. TXT та «Копіювати все» надають лише значення, по одному в рядку. Включаються всі рядки, що відповідають поточному фільтру, а не лише видима сторінка таблиці.
Ні. Аналіз PDF, зіставлення та експорт виконуються в цьому браузері. Оригінальний PDF залишається незмінним. Жодне вилучене посилання, електронна адреса чи номер телефону не відкриваються автоматично.
Один PDF до 50 MiB і 500 сторінок. Витягнення обмежене 250 000 текстових символів і 2 000 збігів на сторінку, 10 мільйонами символів і 20 000 збігів загалом, а також 2 000 анотацій на сторінку. Результати містять повідомлення, якщо обмеження або нечитабельні сторінки роблять їх частковими.
ШВИДКИЙ ВІДЕОУРОК
Як витягти посилання та URL-адреси з PDF
Зберігайте корисні веб-посилання, не відкриваючи їх по одному.
Англійська озвучка
Дивитися відео