Narzędzia150

Przydatne zadanie PDF, wykonane prosto

Wyodrębnianie linków z pliku PDF.

Wydobądź przydatne linki ze swojego pliku PDF.

Advertisements
Twój obszar roboczy PDF
Na Twoim urządzeniu
lub upuść pliki tutaj
Twój plik PDF jest przetwarzany w tej przeglądarce. PDF
Advertisements

Jak wyodrębnić linki z pliku PDF

  1. 01

    Wybierz jeden plik PDF

    Załaduj dokument z tekstem z możliwością zaznaczania lub wypróbuj przykład.

  2. 02

    Wyodrębnij i przejrzyj

    Wybierz Wyodrębnij. Przejrzyj wartości, liczby wystąpień i strony źródłowe; przefiltruj lub posortuj listę.

  3. 03

    Kopiuj lub pobierz

    Skopiuj wartości lub pobierz plik CSV z odnośnikami do stron albo prostą listę TXT.

BlogJak wyodrębnić linki i adresy URL z pliku PDFPrzeczytaj przewodnik

Wyodrębnianie linków z PDF bez otwierania każdej strony

Zbieraj wydrukowane adresy HTTP/HTTPS, adresy www oraz klikalne cele linków internetowych z jednego pliku PDF. Zachowaj odniesienia do stron i Pobierać zdeduplikowaną listę jako CSV lub TXT.

Rozpoznane wartości stają się listą z odniesieniami do stron źródłowych.
SZYBKI SAMOUCZEK WIDEO Jak wyodrębnić linki i adresy URL z pliku PDF Zachowaj przydatne linki internetowe bez otwierania ich jeden po drugim. Narracja w języku angielskim Obejrzyj wideo

Jak wyodrębnić linki i adresy URL z pliku PDF

Kiedy jest to przydatne?

Odniesienia

Zbieranie linków źródłowych

Stwórz listę referencyjną z raportów i dokumentów badawczych.

Zasoby

Zapisywanie przydatnych miejsc docelowych

Wyodrębnij cele kryjące się za klikalnymi etykietami zasobów.

Przegląd

Prowadzenie listy kontrolnej

Zapisz, gdzie znaleziono każdy link, zanim przejrzysz go w innym miejscu.

Funkcje i sterowanie

Znajdź widoczne i klikalne linki

Uwzględnij cel linku, nawet jeśli jego etykieta zawiera tylko tekst „Czytaj więcej”.

Jak działa ekstrakcja linków

Rozpoznawane są drukowane linki zaczynające się od http://, https:// lub www. Adnotacje linków w plikach PDF mogą również ujawnić cele HTTP/HTTPS ukryte pod zwykłym tekstem. Plik PDF nie musi wyświetlać adresu URL jako klikalnej etykiety.

Identyczne drukowane cele i adnotacje na stronie nie są liczone podwójnie. Znormalizowane formy URL są używane do porównywania duplikatów, podczas gdy wyświetlana jest pierwsza rozpoznana pisownia. Długie, zawinięte lub uszkodzone adresy URL mogą wymagać ręcznej korekty. Żaden wyodrębniony adres URL nie jest pobierany automatycznie.

Przeglądaj wartości wraz ze stronami źródłowymi

Sprawdzaj liczby, przechodź do strony PDF i filtruj listę wyników.

Przeglądaj i organizuj

Każdy wynik rejestruje fizyczną pozycję strony w pliku PDF, która może różnić się od numeracji stron w druku. Wybierz znacznik strony, aby otworzyć podgląd z przybliżonym podświetleniem.

Usuwanie duplikatów jest domyślnie włączone. Liczniki łączą rozpoznane powtórzenia tej samej wartości; wyłącz tę opcję, aby zobaczyć oddzielne wystąpienia. Sortowanie alfabetyczne zmienia kolejność listy. Filtrowanie dotyczy zarówno kopiowania i pobierania, jak i widocznych wierszy.

Kopiuj wartości lub pobierz ustrukturyzowaną listę

Wybierz CSV dla liczników i stron lub TXT dla jednej wartości w wierszu.

Co zawiera każde pobranie

CSV zawiera kolumny Typ, Wartość, Liczba i Strony. Kodowanie UTF-8 obsługuje język arabski i inne skrypty. Wartości, które mogłyby zostać zinterpretowane jako formuły arkusza kalkulacyjnego, są poprzedzone apostrofem dla bezpieczniejszego importu.

TXT i Kopiuj wszystko zawierają tylko wartości, po jednej w wierszu. Wszystkie wiersze pasujące do filtra są uwzględniane, nawet jeśli tabela na ekranie obejmuje kilka stron wyników. Żaden nowy plik PDF nie jest tworzony, a źródłowy plik PDF pozostaje niezmieniony.

Utrzymuj duże ekstrakcje w ryzach

Przetwarzaj jeden plik PDF w przeglądarce, z wyraźnymi limitami i powiadomieniami o częściowych wynikach.

Pliki, limity i skanowane strony

Załaduj jeden plik PDF do 50 MiB i 500 stron. Ekstrakcja sprawdza do 250 000 znaków i 2000 dopasowań na stronę, 10 milionów znaków i 20 000 dopasowań łącznie oraz 2000 adnotacji na stronę. Budżet 90 sekund na ekstrakcję ogranicza długie operacje. Bardzo złożone dokumenty mogą działać lepiej po podzieleniu na mniejsze pliki.

Gdy limit zostanie osiągnięty lub strona nie może zostać w pełni odczytana, wyniki pokazują powiadomienie, a ograniczone lub nieudane operacje eksportują pliki z dopiskiem partial w nazwie. Strony bez zaznaczalnego tekstu są liczone oddzielnie. Użyj OCR PDF dla skanów zawierających tylko obrazy, a następnie wróć, aby wyodrębnić rozpoznany tekst.

Zawartość PDF jest przetwarzana lokalnie w tej przeglądarce. Przesłane dokumenty nie są wysyłane na serwer ekstrakcji. Linki, adresy e-mail i numery telefonów znalezione wewnątrz pliku PDF nigdy nie są kontaktowane automatycznie.

Obsługiwane pliki i przetwarzanie

Wejście
PDF
Wyjście
CSV / TXT

Otwórz jeden plik PDF o rozmiarze do 50 MB i maksymalnie 750 stronach. W przypadku złożonych dokumentów mogą obowiązywać dodatkowe limity wyjściowe, pamięci i przetwarzania.

Przetwarzanie odbywa się na Twoim urządzeniu bez przesyłania dokumentu. Pobierz wynik przed zamknięciem strony; zachowaj oryginał osobno.

Advertisements
FAQ

Kilka przydatnych odpowiedzi

Dowiedz się, czego się spodziewać, zanim zaczniesz.

Na Twoim urządzeniu
Co potrafi rozpoznać to narzędzie?

Zbieraj wydrukowane adresy HTTP/HTTPS, adresy www oraz klikalne cele linków internetowych z jednego pliku PDF. Zachowaj odniesienia do stron i pobierz zdeduplikowaną listę jako CSV lub TXT. Narzędzie nie sprawdza, czy linki nadal działają. Wewnętrzne miejsca docelowe stron, akcje JavaScript, mailto i inne schematy niebędące stronami internetowymi nie są eksportowane jako linki internetowe.

Czy mogę wyodrębnić dane ze skanowanych plików PDF?

Odczytywany jest tylko zaznaczalny tekst i rozpoznane cele linków. Strony zawierające tylko obrazy wymagają najpierw OCR PDF. Uruchom OCR, pobierz przeszukiwalny plik PDF, a następnie wróć do tego ekstraktora.

Jak obsługiwane są duplikaty i liczniki?

Usuwanie duplikatów łączy rozpoznane równoważne wartości. Licznik pokazuje wykryte wystąpienia, a Strony wymieniają fizyczne pozycje na stronach PDF. Wyłącz tę opcję, aby zachować oddzielne wystąpienia. Wydrukowany cel i pasujący klikalny link na tej samej stronie nie są liczone podwójnie.

Jaka jest różnica między CSV a TXT?

CSV zawiera typ, wartość, liczbę wystąpień i odniesienia do stron. TXT oraz Kopiuj wszystko dostarczają tylko wartości, po jednej w wierszu. Uwzględnione są wszystkie wiersze pasujące do bieżącego filtra, a nie tylko widoczna strona tabeli.

Czy plik PDF jest przesyłany w celu ekstrakcji?

Nie. Analiza PDF, dopasowywanie i eksport działają w tej przeglądarce. Oryginalny plik PDF pozostaje niezmieniony. Żaden wyodrębniony link, adres e-mail ani numer telefonu nie jest kontaktowany automatycznie.

Jakie są limity?

Jeden plik PDF do 50 MiB i 500 stron. Ekstrakcja jest ograniczona do 250 000 znaków tekstu i 2 000 dopasowań na stronę, 10 milionów znaków i 20 000 dopasowań łącznie oraz 2 000 adnotacji na stronę. Wyniki zawierają powiadomienie, jeśli limity lub nieczytelne strony sprawiają, że są one częściowe.

Kontynuuj

Co chcesz zrobić dalej?

Wybierz narzędzie. Twój gotowy plik PDF będzie na Ciebie czekał.

PDF

Advertisements

Język38

English العربية Français Italiano Deutsch Español Português Nederlands Русский Türkçe 日本語 中文 हिन्दी Bahasa Indonesia Bahasa Melayu 한국어 Tiếng Việt ไทย Polski Svenska Українська Norsk বাংলা Ελληνικά فارسی اردو Čeština Dansk Magyar Română Suomi Български Filipino ქართული Slovenčina Azərbaycanca עברית Slovenščina