Інструменти150

Корисне завдання з PDF, зроблене просто

Витяг даних з PDF.

Знайдіть потрібні дані. Зберігайте посилання на вихідну сторінку для кожного результату.

Advertisements
Ваш робочий простір PDF
На вашому пристрої
або перетягніть файли сюди
Ваш PDF обробляється у цьому браузері. PDF
Advertisements

Як витягти дані з PDF

  1. 01

    Виберіть один PDF

    Завантажте документ із виділеним текстом або спробуйте зразок.

  2. 02

    Витягти та перевірити

    Виберіть «Витягти». Перегляньте значення, кількість та вихідні сторінки; відфільтруйте або відсортуйте список.

  3. 03

    Копіювати або завантажити

    Скопіюйте значення або завантажте CSV з посиланнями на сторінки чи простий список TXT.

БлогЯк витягти структуровані дані з PDFЧитати посібник

Витяг структурованих значень з PDF у CSV або текст

Оберіть потрібні типи даних: електронні адреси, номери телефонів, URL-адреси, числові дати, IPv4-адреси, домени, DOI, ISBN, хештеги та MAC-адреси. Переглядайте витягнуті значення з кількістю та посиланнями на сторінки.

Розпізнані значення стають списком із посиланнями на вихідні сторінки.
ШВИДКИЙ ВІДЕОУРОК Як витягти структуровані дані з PDF Збирайте контакти та дослідницькі ідентифікатори в один організований список. Англійська озвучка Дивитися відео

Як витягти структуровані дані з PDF

Коли це корисно?

Дослідження

Збір ідентифікаторів

Збирайте значення DOI та ISBN разом зі сторінками, на яких вони з'являються.

Звіти

Витяг числових даних

Знаходьте датовані записи та IPv4-адреси.

Каталоги

Створення списку контактів

Об'єднуйте електронні адреси, телефони та вебпосилання в один структурований експорт.

Функції та елементи керування

Вибір корисних типів даних

Почніть з електронних адрес, телефонів та URL-адрес, а потім відкрийте «Більше типів даних» для спеціалізованих значень.

Що підтримують розпізнавачі

Дати повинні використовувати числовий формат із чотиризначним роком; неоднозначні значення дня/місяця зберігають свій вихідний порядок. Октети IPv4 перевіряються; IPv6 не включається.

Домени походять від розпізнаних електронних адрес і вебпосилань, а не від довільних імен файлів. Вилучення DOI охоплює поширені сучасні форми DOI, а не всі історичні форми. Значення ISBN-13 потребують дійсної контрольної суми; ISBN-10 також потребує мітки ISBN. Хештеги можуть містити символи Unicode, включаючи арабські.

MAC-адреси використовують шість пар, розділених двокрапками або дефісами. Інструмент ніколи не звертається до вилучених адрес або ідентифікаторів.

Перегляд значень разом із вихідними сторінками

Перевіряйте кількість, переходьте до сторінки PDF та фільтруйте список результатів.

Перегляд та впорядкування

Кожен результат фіксує фізичне розташування на сторінці PDF, яке може відрізнятися від надрукованих номерів сторінок. Виберіть мітку сторінки, щоб відкрити попередній перегляд із приблизним виділенням.

Функція видалення дублікатів увімкнена за замовчуванням. Лічильники об'єднують розпізнані повтори одного й того самого значення; вимкніть її, щоб побачити окремі входження. Сортування за алфавітом змінює порядок списку. Фільтрація застосовується як до копіювання та завантаження, так і до видимих рядків.

Копіювання значень або завантаження структурованого списку

Виберіть CSV для підрахунку та сторінок або TXT для одного значення в рядку.

Що містить кожне завантаження

CSV містить стовпці «Тип», «Значення», «Кількість» та «Сторінки». Кодування UTF-8 підтримує арабську та інші мови. Значення, які можуть бути інтерпретовані як формули електронних таблиць, мають префікс апострофа для безпечнішого імпорту.

TXT та «Копіювати все» містять лише значення, по одному в рядку. Всі рядки, що відповідають фільтру, включаються, навіть якщо таблиця на екрані охоплює кілька сторінок результатів. Новий PDF не створюється, а вихідний PDF залишається незмінним.

Керування великими обсягами вилучених даних

Обробляйте один PDF у вашому браузері з чіткими обмеженнями та повідомленнями про часткові результати.

Файли, обмеження та скановані сторінки

Завантажуйте один PDF розміром до 50 МБ і до 500 сторінок. Вилучення перевіряє до 250 000 символів і 2 000 збігів на сторінку, 10 мільйонів символів і 20 000 збігів загалом, а також 2 000 анотацій на сторінку. Бюджет часу на вилучення у 90 секунд обмежує тривалі операції. Дуже складні документи можуть краще оброблятися, якщо їх розділити на менші файли.

Коли досягається ліміт або сторінку неможливо повністю прочитати, результати показують повідомлення, а експорт обмежених або невдалих запусків містить слово partial у назві файлу. Сторінки без виділеного тексту рахуються окремо. Використовуйте PDF OCR для сканів, що містять лише зображення, а потім поверніться, щоб вилучити розпізнаний текст.

Вміст PDF обробляється локально в цьому браузері. Завантажені документи не надсилаються на сервер вилучення. Посилання, адреси електронної пошти та номери телефонів, знайдені всередині PDF, ніколи не відкриваються автоматично.

Підтримувані файли та обробка

Вхідні дані
PDF
Вихідні дані
CSV / TXT

Відкрийте один PDF розміром до 50 МБ та 750 сторінок. Для складних документів можуть застосовуватися додаткові обмеження щодо виводу, пам'яті та обробки.

Обробка відбувається на вашому пристрої без завантаження документа. Завантажте результат перед закриттям сторінки; зберігайте оригінал окремо.

Advertisements
Найбільш поширені запитання

Кілька корисних відповідей

Знайте, чого очікувати, перш ніж почати.

На вашому пристрої
Що може розпізнати цей інструмент?

Виберіть потрібні типи даних: електронні адреси, номери телефонів, URL-адреси, числові дати, IPv4-адреси, домени, DOI, ISBN, хештеги та MAC-адреси. Переглядайте витягнуті значення з кількістю та посиланнями на сторінки. Це витягує розпізнавані значення, а не таблиці, рахунки чи семантичні поля. Шаблони та контрольні суми зменшують шум, але не гарантують повноту і не доводять, що ідентифікатор є справжнім.

Чи можу я витягти дані зі сканованих PDF?

Зчитується лише виділений текст і розпізнані цілі посилань. Сторінки, що складаються лише з зображень, спочатку потребують PDF OCR. Виконайте OCR, завантажте PDF з можливістю пошуку, а потім поверніться до цього екстрактора.

Як обробляються дублікати та підрахунки?

Видалення дублікатів об'єднує розпізнані еквівалентні значення. «Кількість» показує виявлені входження, а «Сторінки» перераховують фізичні позиції сторінок PDF. Вимкніть цю опцію, щоб зберегти входження окремо. Друкована ціль і відповідне клікабельне посилання на одній сторінці не враховуються двічі.

У чому різниця між CSV та TXT?

CSV містить тип, значення, кількість входжень і посилання на сторінки. TXT та «Копіювати все» надають лише значення, по одному в рядку. Включаються всі рядки, що відповідають поточному фільтру, а не лише видима сторінка таблиці.

Чи завантажується PDF для вилучення?

Ні. Аналіз PDF, зіставлення та експорт виконуються в цьому браузері. Оригінальний PDF залишається незмінним. Жодне вилучене посилання, електронна адреса чи номер телефону не відкриваються автоматично.

Які існують обмеження?

Один PDF до 50 MiB і 500 сторінок. Витягнення обмежене 250 000 текстових символів і 2 000 збігів на сторінку, 10 мільйонами символів і 20 000 збігів загалом, а також 2 000 анотацій на сторінку. Результати містять повідомлення, якщо обмеження або нечитабельні сторінки роблять їх частковими.

Продовжити

Що ви хочете зробити далі?

Виберіть інструмент. Ваш готовий PDF залишиться з вами.

PDF

Advertisements

Мову38

English العربية Français Italiano Deutsch Español Português Nederlands Русский Türkçe 日本語 中文 हिन्दी Bahasa Indonesia Bahasa Melayu 한국어 Tiếng Việt ไทย Polski Svenska Українська Norsk বাংলা Ελληνικά فارسی اردو Čeština Dansk Magyar Română Suomi Български Filipino ქართული Slovenčina Azərbaycanca עברית Slovenščina