Zbieranie identyfikatorów
Zbieraj wartości DOI i ISBN wraz ze stronami, na których występują.
Znajdź potrzebne dane. Zachowaj informację o stronie źródłowej dla każdego wyniku.
| Typ | Wartość | Liczba | Strony |
|---|
Kopiowanie i pobieranie obejmuje wszystkie pasujące wiersze ze wszystkich stron wyników. CSV zawiera liczby wystąpień i numery stron PDF; TXT zawiera tylko wartości.
Wybierz numer strony w wynikach, aby sprawdzić jej źródło. Wyróżnienia pokazują przybliżone pozycje.
Twoja lista jest gotowa. Pobierz ją lub wróć, aby przejrzeć i zmienić format.
Załaduj dokument z tekstem z możliwością zaznaczania lub wypróbuj przykład.
Wybierz Wyodrębnij. Przejrzyj wartości, liczby wystąpień i strony źródłowe; przefiltruj lub posortuj listę.
Skopiuj wartości lub pobierz plik CSV z odnośnikami do stron albo prostą listę TXT.
Wybierz potrzebne typy danych: adresy e-mail, numery telefonów, adresy URL, daty numeryczne, adresy IPv4, domeny, DOI, ISBN, hashtagi i adresy MAC. Przejrzyj wyodrębnione wartości wraz z liczbą wystąpień i odniesieniami do stron.
Zbieraj wartości DOI i ISBN wraz ze stronami, na których występują.
Znajduj wpisy z datami i adresy IPv4.
Połącz e-maile, telefony i linki internetowe w jeden ustrukturyzowany eksport.
Zacznij od e-maili, telefonów i adresów URL, a następnie otwórz Więcej typów danych dla specjalistycznych wartości.
Daty muszą używać formatu numerycznego z czterocyfrowym rokiem; niejednoznaczne wartości dnia/miesiąca zachowują kolejność źródłową. Oktety IPv4 są weryfikowane; IPv6 nie jest uwzględniany.
Domeny są wywodzone z rozpoznanych e-maili i linków internetowych, a nie z dowolnych nazw plików. Ekstrakcja DOI obejmuje typowe nowoczesne formy DOI, a nie wszystkie formy historyczne. Wartości ISBN-13 wymagają poprawnej sumy kontrolnej; ISBN-10 wymaga również etykiety ISBN. Hashtagi mogą zawierać litery Unicode, w tym arabskie.
Adresy MAC używają sześciu par oddzielonych dwukropkami lub myślnikami. Narzędzie nigdy nie kontaktuje się z wyodrębnionymi adresami lub identyfikatorami.
Sprawdzaj liczby, przechodź do strony PDF i filtruj listę wyników.
Każdy wynik rejestruje fizyczną pozycję strony w pliku PDF, która może różnić się od numeracji stron w druku. Wybierz znacznik strony, aby otworzyć podgląd z przybliżonym podświetleniem.
Usuwanie duplikatów jest domyślnie włączone. Liczniki łączą rozpoznane powtórzenia tej samej wartości; wyłącz tę opcję, aby zobaczyć oddzielne wystąpienia. Sortowanie alfabetyczne zmienia kolejność listy. Filtrowanie dotyczy zarówno kopiowania i pobierania, jak i widocznych wierszy.
Wybierz CSV dla liczników i stron lub TXT dla jednej wartości w wierszu.
CSV zawiera kolumny Typ, Wartość, Liczba i Strony. Kodowanie UTF-8 obsługuje język arabski i inne skrypty. Wartości, które mogłyby zostać zinterpretowane jako formuły arkusza kalkulacyjnego, są poprzedzone apostrofem dla bezpieczniejszego importu.
TXT i Kopiuj wszystko zawierają tylko wartości, po jednej w wierszu. Wszystkie wiersze pasujące do filtra są uwzględniane, nawet jeśli tabela na ekranie obejmuje kilka stron wyników. Żaden nowy plik PDF nie jest tworzony, a źródłowy plik PDF pozostaje niezmieniony.
Przetwarzaj jeden plik PDF w przeglądarce, z wyraźnymi limitami i powiadomieniami o częściowych wynikach.
Załaduj jeden plik PDF do 50 MiB i 500 stron. Ekstrakcja sprawdza do 250 000 znaków i 2000 dopasowań na stronę, 10 milionów znaków i 20 000 dopasowań łącznie oraz 2000 adnotacji na stronę. Budżet 90 sekund na ekstrakcję ogranicza długie operacje. Bardzo złożone dokumenty mogą działać lepiej po podzieleniu na mniejsze pliki.
Gdy limit zostanie osiągnięty lub strona nie może zostać w pełni odczytana, wyniki pokazują powiadomienie, a ograniczone lub nieudane operacje eksportują pliki z dopiskiem partial w nazwie. Strony bez zaznaczalnego tekstu są liczone oddzielnie. Użyj OCR PDF dla skanów zawierających tylko obrazy, a następnie wróć, aby wyodrębnić rozpoznany tekst.
Zawartość PDF jest przetwarzana lokalnie w tej przeglądarce. Przesłane dokumenty nie są wysyłane na serwer ekstrakcji. Linki, adresy e-mail i numery telefonów znalezione wewnątrz pliku PDF nigdy nie są kontaktowane automatycznie.
Otwórz jeden plik PDF o rozmiarze do 50 MB i maksymalnie 750 stronach. W przypadku złożonych dokumentów mogą obowiązywać dodatkowe limity wyjściowe, pamięci i przetwarzania.
Przetwarzanie odbywa się na Twoim urządzeniu bez przesyłania dokumentu. Pobierz wynik przed zamknięciem strony; zachowaj oryginał osobno.
Dowiedz się, czego się spodziewać, zanim zaczniesz.
Na Twoim urządzeniuWybierz potrzebne typy danych: e-maile, numery telefonów, adresy URL, daty numeryczne, adresy IPv4, domeny, DOI, ISBN, hashtagi i adresy MAC. Przejrzyj wyodrębnione wartości wraz z licznikami i odniesieniami do stron. Narzędzie wyodrębnia rozpoznawalne wartości, a nie tabele, faktury czy pola semantyczne. Wzorce i sumy kontrolne redukują szum, ale nie gwarantują kompletności ani nie dowodzą, że identyfikator jest autentyczny.
Odczytywany jest tylko zaznaczalny tekst i rozpoznane cele linków. Strony zawierające tylko obrazy wymagają najpierw OCR PDF. Uruchom OCR, pobierz przeszukiwalny plik PDF, a następnie wróć do tego ekstraktora.
Usuwanie duplikatów łączy rozpoznane równoważne wartości. Licznik pokazuje wykryte wystąpienia, a Strony wymieniają fizyczne pozycje na stronach PDF. Wyłącz tę opcję, aby zachować oddzielne wystąpienia. Wydrukowany cel i pasujący klikalny link na tej samej stronie nie są liczone podwójnie.
CSV zawiera typ, wartość, liczbę wystąpień i odniesienia do stron. TXT oraz Kopiuj wszystko dostarczają tylko wartości, po jednej w wierszu. Uwzględnione są wszystkie wiersze pasujące do bieżącego filtra, a nie tylko widoczna strona tabeli.
Nie. Analiza PDF, dopasowywanie i eksport działają w tej przeglądarce. Oryginalny plik PDF pozostaje niezmieniony. Żaden wyodrębniony link, adres e-mail ani numer telefonu nie jest kontaktowany automatycznie.
Jeden plik PDF do 50 MiB i 500 stron. Ekstrakcja jest ograniczona do 250 000 znaków tekstu i 2 000 dopasowań na stronę, 10 milionów znaków i 20 000 dopasowań łącznie oraz 2 000 adnotacji na stronę. Wyniki zawierają powiadomienie, jeśli limity lub nieczytelne strony sprawiają, że są one częściowe.
SZYBKI SAMOUCZEK WIDEO
Jak wyodrębnić ustrukturyzowane dane z pliku PDF
Zbieraj kontakty i identyfikatory badawcze na jednej zorganizowanej liście.
Narracja w języku angielskim
Obejrzyj wideo