도구150

간편하고 유용한 PDF 작업

PDF에서 데이터 추출.

필요한 데이터를 찾으세요. 모든 결과에 출처 페이지를 함께 보관합니다.

Advertisements
나만의 PDF 작업 공간
내 기기에서 처리
또는 여기에 파일을 놓으세요
PDF가 이 브라우저에서 처리됩니다. PDF
Advertisements

PDF에서 데이터를 추출하는 방법

  1. 01

    PDF 하나 선택

    텍스트 선택이 가능한 문서를 불러오거나 샘플을 사용해 보세요.

  2. 02

    추출 및 검토

    추출을 선택하세요. 값, 개수 및 원본 페이지를 검토하고 목록을 필터링하거나 정렬하세요.

  3. 03

    복사 또는 다운로드

    값을 복사하거나, 페이지 참조가 포함된 CSV 또는 간단한 TXT 목록을 다운로드하세요.

블로그PDF에서 구조화된 데이터를 추출하는 방법가이드 읽기

PDF에서 구조화된 값을 CSV 또는 텍스트로 추출

필요한 데이터 유형(이메일, 전화번호, URL, 숫자 날짜, IPv4 주소, 도메인, DOI, ISBN, 해시태그, MAC 주소)을 선택하세요. 추출된 값을 개수 및 페이지 참조와 함께 검토하세요.

인식된 값은 출처 페이지 참조가 포함된 목록이 됩니다.
빠른 영상 튜토리얼 PDF에서 구조화된 데이터를 추출하는 방법 연락처와 연구 식별자를 하나의 정리된 목록으로 수집하세요. 영어 내레이션 영상 보기

PDF에서 구조화된 데이터를 추출하는 방법

언제 유용한가요?

연구

식별자 수집

DOI 및 ISBN 값을 해당 페이지와 함께 수집하세요.

보고서

숫자 세부 정보 추출

날짜가 기재된 항목과 IPv4 주소를 찾으세요.

디렉터리

연락처 목록 작성

이메일, 전화번호, 웹 링크를 하나의 구조화된 내보내기 파일로 결합합니다.

기능 및 제어

유용한 데이터 유형 선택

이메일, 전화번호, URL로 시작한 다음, 특수 값을 위해 '더 많은 데이터 유형'을 여세요.

인식기가 지원하는 항목

날짜는 4자리 연도를 포함하는 숫자 형식을 사용해야 합니다. 모호한 일/월 값은 소스 순서를 유지합니다. IPv4 옥텟은 유효성이 검사되지만, IPv6는 포함되지 않습니다.

도메인은 임의의 파일 이름이 아닌 인식된 이메일과 웹 링크에서 파생됩니다. DOI 추출은 일반적인 최신 DOI 형식을 다루며, 모든 과거 형식을 다루지는 않습니다. ISBN-13 값은 유효한 체크섬이 필요하며, ISBN-10은 ISBN 레이블도 필요합니다. 해시태그는 아랍어를 포함한 유니코드 문자를 포함할 수 있습니다.

MAC 주소는 콜론 또는 하이픈으로 구분된 6개의 쌍을 사용합니다. 이 도구는 추출된 주소나 식별자에 절대 연락하지 않습니다.

소스 페이지와 함께 값 검토

개수를 확인하고, PDF 페이지로 이동하며, 결과 목록을 필터링합니다.

검토 및 정리

각 결과는 PDF 내의 물리적 페이지 위치를 기록하며, 이는 인쇄된 페이지 번호와 다를 수 있습니다. 페이지 칩을 선택하여 대략적인 강조 표시와 함께 미리보기를 엽니다.

중복 제거는 기본적으로 활성화되어 있습니다. 개수는 동일한 값의 인식된 반복을 결합합니다. 별도의 발생 항목을 보려면 이 기능을 끄세요. 알파벳순 정렬은 목록 순서를 변경합니다. 필터링은 화면에 표시된 행뿐만 아니라 복사 및 다운로드에도 적용됩니다.

값 복사 또는 구조화된 목록 다운로드

개수와 페이지를 보려면 CSV를, 줄당 하나의 값을 보려면 TXT를 선택하세요.

각 다운로드에 포함된 내용

CSV에는 유형, 값, 개수 및 페이지 열이 포함됩니다. UTF-8 인코딩은 아랍어 및 기타 스크립트를 지원합니다. 스프레드시트 수식으로 해석될 수 있는 값은 더 안전한 가져오기를 위해 앞에 아포스트로피가 붙습니다.

TXT와 모두 복사는 줄당 하나의 값만 포함합니다. 화면의 표가 여러 결과 페이지에 걸쳐 있더라도 필터와 일치하는 모든 행이 포함됩니다. 새 PDF는 생성되지 않으며 원본 PDF는 변경되지 않습니다.

대규모 추출 관리 유지

명시적 제한과 부분 결과 알림을 통해 브라우저에서 하나의 PDF를 처리합니다.

파일, 제한 및 스캔된 페이지

최대 50 MiB 및 500페이지의 PDF 하나를 로드합니다. 추출은 페이지당 최대 250,000자 및 2,000개의 일치 항목, 전체적으로 1,000만 자 및 20,000개의 일치 항목, 페이지당 2,000개의 주석을 확인합니다. 90초의 추출 예산이 긴 작업을 제한합니다. 매우 복잡한 문서는 더 작은 파일로 분할할 때 더 잘 작동할 수 있습니다.

제한에 도달하거나 페이지를 완전히 읽을 수 없는 경우, 결과에 알림이 표시되며 제한되거나 실패한 실행은 파일 이름에 partial이 포함되어 내보내집니다. 선택 가능한 텍스트가 없는 페이지는 별도로 계산됩니다. 이미지 전용 스캔의 경우 PDF OCR을 사용한 다음, 인식된 텍스트를 추출하세요.

PDF 콘텐츠는 이 브라우저에서 로컬로 처리됩니다. 업로드된 문서는 추출 서버로 전송되지 않습니다. PDF 내에서 발견된 링크, 이메일 주소 및 전화번호는 자동으로 연락되지 않습니다.

지원되는 파일 및 처리

입력
PDF
출력
CSV / TXT

최대 50 MB 및 750 페이지까지 PDF 하나를 엽니다. 복잡한 문서의 경우 추가적인 출력, 메모리 및 처리 제한이 적용될 수 있습니다.

처리는 문서를 업로드하지 않고 기기에서 수행됩니다. 페이지를 닫기 전에 결과를 다운로드하고 원본은 별도로 보관하세요.

Advertisements
자주하는 질문

유용한 답변

시작하기 전에 무엇을 기대할 수 있는지 확인하세요.

내 기기에서 처리
이 도구는 무엇을 인식할 수 있나요?

이메일, 전화번호, URL, 숫자 날짜, IPv4 주소, 도메인, DOI, ISBN, 해시태그, MAC 주소 등 필요한 데이터 유형을 선택하십시오. 추출된 값을 개수 및 페이지 참조와 함께 검토하십시오. 이 도구는 테이블, 송장 또는 의미론적 필드가 아닌 인식 가능한 값을 추출합니다. 패턴과 체크섬은 노이즈를 줄여주지만 완전성을 보장하거나 식별자가 진품임을 증명하지는 않습니다.

스캔된 PDF에서 데이터를 추출할 수 있나요?

선택 가능한 텍스트와 인식된 링크 대상만 읽을 수 있습니다. 이미지 전용 페이지는 먼저 PDF OCR을 거쳐야 합니다. OCR을 실행하고 검색 가능한 PDF를 다운로드한 다음, 이 추출기로 돌아오십시오.

중복과 개수는 어떻게 처리되나요?

중복 제거 기능은 인식된 동일한 값을 결합합니다. 개수는 감지된 발생 횟수를 나타내며, 페이지는 물리적인 PDF 페이지 위치를 나열합니다. 발생 항목을 별도로 유지하려면 이 옵션을 비활성화하십시오. 동일한 페이지에 있는 인쇄된 대상과 일치하는 클릭 가능한 링크는 이중으로 계산되지 않습니다.

CSV와 TXT의 차이점은 무엇인가요?

CSV에는 유형, 값, 발생 횟수 및 페이지 참조가 포함됩니다. TXT와 모두 복사 기능은 값만 줄당 하나씩 제공합니다. 현재 필터와 일치하는 모든 행이 포함되며, 화면에 보이는 테이블 페이지만 포함되는 것은 아닙니다.

PDF가 추출을 위해 업로드되나요?

아니요. PDF 파싱, 일치 및 내보내기는 이 브라우저에서 실행됩니다. 원본 PDF는 변경되지 않습니다. 추출된 링크, 이메일 또는 전화번호는 자동으로 연락되지 않습니다.

제한 사항은 무엇인가요?

최대 50 MiB 및 500페이지의 PDF 하나를 처리할 수 있습니다. 추출은 페이지당 최대 250,000개의 텍스트 문자와 2,000개의 일치 항목, 전체적으로 1,000만 개의 문자와 20,000개의 일치 항목, 그리고 페이지당 2,000개의 주석으로 제한됩니다. 제한 사항이나 읽을 수 없는 페이지로 인해 결과가 부분적일 경우 알림이 표시됩니다.

계속하기

다음으로 무엇을 하시겠습니까?

도구를 선택하세요. 완성된 PDF는 그대로 유지됩니다.

PDF

Advertisements

언어38

English العربية Français Italiano Deutsch Español Português Nederlands Русский Türkçe 日本語 中文 हिन्दी Bahasa Indonesia Bahasa Melayu 한국어 Tiếng Việt ไทย Polski Svenska Українська Norsk বাংলা Ελληνικά فارسی اردو Čeština Dansk Magyar Română Suomi Български Filipino ქართული Slovenčina Azərbaycanca עברית Slovenščina