Narzędzia150

Przydatne zadanie PDF, wykonane prosto

Wyodrębnianie danych z pliku PDF.

Znajdź potrzebne dane. Zachowaj informację o stronie źródłowej dla każdego wyniku.

Advertisements
Twój obszar roboczy PDF
Na Twoim urządzeniu
lub upuść pliki tutaj
Twój plik PDF jest przetwarzany w tej przeglądarce. PDF
Advertisements

Jak wyodrębnić dane z pliku PDF

  1. 01

    Wybierz jeden plik PDF

    Załaduj dokument z tekstem z możliwością zaznaczania lub wypróbuj przykład.

  2. 02

    Wyodrębnij i przejrzyj

    Wybierz Wyodrębnij. Przejrzyj wartości, liczby wystąpień i strony źródłowe; przefiltruj lub posortuj listę.

  3. 03

    Kopiuj lub pobierz

    Skopiuj wartości lub pobierz plik CSV z odnośnikami do stron albo prostą listę TXT.

BlogJak wyodrębnić ustrukturyzowane dane z pliku PDFPrzeczytaj przewodnik

Wyodrębnianie ustrukturyzowanych wartości z pliku PDF do CSV lub tekstu

Wybierz potrzebne typy danych: adresy e-mail, numery telefonów, adresy URL, daty numeryczne, adresy IPv4, domeny, DOI, ISBN, hashtagi i adresy MAC. Przejrzyj wyodrębnione wartości wraz z liczbą wystąpień i odniesieniami do stron.

Rozpoznane wartości stają się listą z odniesieniami do stron źródłowych.
SZYBKI SAMOUCZEK WIDEO Jak wyodrębnić ustrukturyzowane dane z pliku PDF Zbieraj kontakty i identyfikatory badawcze na jednej zorganizowanej liście. Narracja w języku angielskim Obejrzyj wideo

Jak wyodrębnić ustrukturyzowane dane z pliku PDF

Kiedy jest to przydatne?

Badania

Zbieranie identyfikatorów

Zbieraj wartości DOI i ISBN wraz ze stronami, na których występują.

Raporty

Wyciąganie szczegółów numerycznych

Znajduj wpisy z datami i adresy IPv4.

Katalogi

Buduj listę kontaktów

Połącz e-maile, telefony i linki internetowe w jeden ustrukturyzowany eksport.

Funkcje i sterowanie

Wybierz przydatne typy danych

Zacznij od e-maili, telefonów i adresów URL, a następnie otwórz Więcej typów danych dla specjalistycznych wartości.

Co obsługują rozpoznawacze

Daty muszą używać formatu numerycznego z czterocyfrowym rokiem; niejednoznaczne wartości dnia/miesiąca zachowują kolejność źródłową. Oktety IPv4 są weryfikowane; IPv6 nie jest uwzględniany.

Domeny są wywodzone z rozpoznanych e-maili i linków internetowych, a nie z dowolnych nazw plików. Ekstrakcja DOI obejmuje typowe nowoczesne formy DOI, a nie wszystkie formy historyczne. Wartości ISBN-13 wymagają poprawnej sumy kontrolnej; ISBN-10 wymaga również etykiety ISBN. Hashtagi mogą zawierać litery Unicode, w tym arabskie.

Adresy MAC używają sześciu par oddzielonych dwukropkami lub myślnikami. Narzędzie nigdy nie kontaktuje się z wyodrębnionymi adresami lub identyfikatorami.

Przeglądaj wartości wraz ze stronami źródłowymi

Sprawdzaj liczby, przechodź do strony PDF i filtruj listę wyników.

Przeglądaj i organizuj

Każdy wynik rejestruje fizyczną pozycję strony w pliku PDF, która może różnić się od numeracji stron w druku. Wybierz znacznik strony, aby otworzyć podgląd z przybliżonym podświetleniem.

Usuwanie duplikatów jest domyślnie włączone. Liczniki łączą rozpoznane powtórzenia tej samej wartości; wyłącz tę opcję, aby zobaczyć oddzielne wystąpienia. Sortowanie alfabetyczne zmienia kolejność listy. Filtrowanie dotyczy zarówno kopiowania i pobierania, jak i widocznych wierszy.

Kopiuj wartości lub pobierz ustrukturyzowaną listę

Wybierz CSV dla liczników i stron lub TXT dla jednej wartości w wierszu.

Co zawiera każde pobranie

CSV zawiera kolumny Typ, Wartość, Liczba i Strony. Kodowanie UTF-8 obsługuje język arabski i inne skrypty. Wartości, które mogłyby zostać zinterpretowane jako formuły arkusza kalkulacyjnego, są poprzedzone apostrofem dla bezpieczniejszego importu.

TXT i Kopiuj wszystko zawierają tylko wartości, po jednej w wierszu. Wszystkie wiersze pasujące do filtra są uwzględniane, nawet jeśli tabela na ekranie obejmuje kilka stron wyników. Żaden nowy plik PDF nie jest tworzony, a źródłowy plik PDF pozostaje niezmieniony.

Utrzymuj duże ekstrakcje w ryzach

Przetwarzaj jeden plik PDF w przeglądarce, z wyraźnymi limitami i powiadomieniami o częściowych wynikach.

Pliki, limity i skanowane strony

Załaduj jeden plik PDF do 50 MiB i 500 stron. Ekstrakcja sprawdza do 250 000 znaków i 2000 dopasowań na stronę, 10 milionów znaków i 20 000 dopasowań łącznie oraz 2000 adnotacji na stronę. Budżet 90 sekund na ekstrakcję ogranicza długie operacje. Bardzo złożone dokumenty mogą działać lepiej po podzieleniu na mniejsze pliki.

Gdy limit zostanie osiągnięty lub strona nie może zostać w pełni odczytana, wyniki pokazują powiadomienie, a ograniczone lub nieudane operacje eksportują pliki z dopiskiem partial w nazwie. Strony bez zaznaczalnego tekstu są liczone oddzielnie. Użyj OCR PDF dla skanów zawierających tylko obrazy, a następnie wróć, aby wyodrębnić rozpoznany tekst.

Zawartość PDF jest przetwarzana lokalnie w tej przeglądarce. Przesłane dokumenty nie są wysyłane na serwer ekstrakcji. Linki, adresy e-mail i numery telefonów znalezione wewnątrz pliku PDF nigdy nie są kontaktowane automatycznie.

Obsługiwane pliki i przetwarzanie

Wejście
PDF
Wyjście
CSV / TXT

Otwórz jeden plik PDF o rozmiarze do 50 MB i maksymalnie 750 stronach. W przypadku złożonych dokumentów mogą obowiązywać dodatkowe limity wyjściowe, pamięci i przetwarzania.

Przetwarzanie odbywa się na Twoim urządzeniu bez przesyłania dokumentu. Pobierz wynik przed zamknięciem strony; zachowaj oryginał osobno.

Advertisements
FAQ

Kilka przydatnych odpowiedzi

Dowiedz się, czego się spodziewać, zanim zaczniesz.

Na Twoim urządzeniu
Co potrafi rozpoznać to narzędzie?

Wybierz potrzebne typy danych: e-maile, numery telefonów, adresy URL, daty numeryczne, adresy IPv4, domeny, DOI, ISBN, hashtagi i adresy MAC. Przejrzyj wyodrębnione wartości wraz z licznikami i odniesieniami do stron. Narzędzie wyodrębnia rozpoznawalne wartości, a nie tabele, faktury czy pola semantyczne. Wzorce i sumy kontrolne redukują szum, ale nie gwarantują kompletności ani nie dowodzą, że identyfikator jest autentyczny.

Czy mogę wyodrębnić dane ze skanowanych plików PDF?

Odczytywany jest tylko zaznaczalny tekst i rozpoznane cele linków. Strony zawierające tylko obrazy wymagają najpierw OCR PDF. Uruchom OCR, pobierz przeszukiwalny plik PDF, a następnie wróć do tego ekstraktora.

Jak obsługiwane są duplikaty i liczniki?

Usuwanie duplikatów łączy rozpoznane równoważne wartości. Licznik pokazuje wykryte wystąpienia, a Strony wymieniają fizyczne pozycje na stronach PDF. Wyłącz tę opcję, aby zachować oddzielne wystąpienia. Wydrukowany cel i pasujący klikalny link na tej samej stronie nie są liczone podwójnie.

Jaka jest różnica między CSV a TXT?

CSV zawiera typ, wartość, liczbę wystąpień i odniesienia do stron. TXT oraz Kopiuj wszystko dostarczają tylko wartości, po jednej w wierszu. Uwzględnione są wszystkie wiersze pasujące do bieżącego filtra, a nie tylko widoczna strona tabeli.

Czy plik PDF jest przesyłany w celu ekstrakcji?

Nie. Analiza PDF, dopasowywanie i eksport działają w tej przeglądarce. Oryginalny plik PDF pozostaje niezmieniony. Żaden wyodrębniony link, adres e-mail ani numer telefonu nie jest kontaktowany automatycznie.

Jakie są limity?

Jeden plik PDF do 50 MiB i 500 stron. Ekstrakcja jest ograniczona do 250 000 znaków tekstu i 2 000 dopasowań na stronę, 10 milionów znaków i 20 000 dopasowań łącznie oraz 2 000 adnotacji na stronę. Wyniki zawierają powiadomienie, jeśli limity lub nieczytelne strony sprawiają, że są one częściowe.

Kontynuuj

Co chcesz zrobić dalej?

Wybierz narzędzie. Twój gotowy plik PDF będzie na Ciebie czekał.

PDF

Advertisements

Język38

English العربية Français Italiano Deutsch Español Português Nederlands Русский Türkçe 日本語 中文 हिन्दी Bahasa Indonesia Bahasa Melayu 한국어 Tiếng Việt ไทย Polski Svenska Українська Norsk বাংলা Ελληνικά فارسی اردو Čeština Dansk Magyar Română Suomi Български Filipino ქართული Slovenčina Azərbaycanca עברית Slovenščina