XML 처리 워크플로우에 공급
문서화된 출력 구조를 이해하는 스크립트나 애플리케이션을 위해 페이지 콘텐츠를 XML로 내보내세요.
PDF 텍스트, 이미지 및 드로잉 기하학적 구조를 XML로 내보내세요.
페이지 컨트롤을 사용하여 문서를 검사하세요.
결과물을 다운로드하거나 설정으로 돌아가 다른 버전을 만드세요.
기기에서 PDF 하나를 업로드하세요.
사용 가능한 설정을 검토한 후 처리를 시작하세요.
결과를 저장하고 공유하기 전에 확인하세요.
PDF 텍스트, 이미지 및 드로잉 지오메트리를 XML로 내보내세요. 페이지를 선택하고 구조화된 설명을 다운로드하며, 필요한 경우 이미지 에셋이 함께 패키징됩니다.
문서화된 출력 구조를 이해하는 스크립트나 애플리케이션을 위해 페이지 콘텐츠를 XML로 내보내세요.
콘텐츠 좌표를 사용하여 페이지 레이아웃을 연구하세요. 이는 브라우저 픽셀이 아닌 회전되지 않은 PDF 페이지를 참조합니다.
문서별 파싱 규칙을 만들기 전에 추출된 객체를 검토하세요. 스캔본은 인식된 텍스트를 위해 OCR이 필요합니다.
단순한 텍스트 사본이 아닌 페이지 콘텐츠의 구조화된 설명을 가져옵니다.
버전이 지정된 구조에는 페이지, 텍스트 블록 및 스팬, 글꼴, 경계 상자 및 벡터 드로잉 경로가 포함됩니다. 좌표는 회전되지 않은 페이지의 왼쪽 상단 원점을 기준으로 한 PDF 포인트 단위이며, 회전은 별도로 기록됩니다. 이는 인덱싱이나 문서 분석을 지원할 수 있지만, 변환기가 사용자의 비즈니스 스키마나 의미론적 필드 이름을 추론하지는 않습니다.
추출된 이미지가 포함된 경우 직접 데이터 파일이나 ZIP 파일을 받으세요.
페이지에 이미지 데이터가 포함된 경우, 아카이브에는 document.json 또는 document.xml과 참조된 이미지 파일 및 지원되는 마스크가 포함됩니다. 데이터를 다른 곳에서 로드할 때는 해당 경로를 함께 유지하세요. 이미지 전용 스캔은 이미지 데이터로 유지되며, 이 내보내기 기능은 누락된 텍스트 스팬을 생성하기 위해 OCR을 수행하지 않습니다.
전체 문서를 처리하거나 특정 페이지 번호 및 범위를 입력하세요.
페이지에 인쇄된 번호 대신 1부터 시작하는 PDF 위치를 사용하세요. 1, 3-5와 같은 목록은 4페이지를 포함합니다. 빈 범위는 모든 페이지를 사용합니다. 문서에 표지나 다르게 번호가 매겨진 챕터가 포함된 경우 미리보기를 확인하세요. 선택한 페이지만 이 변환에 포함됩니다.
텍스트 추출은 텍스트 레이어를 읽으며, 이미지 내의 글자는 인식하지 않습니다.
추출은 기존 텍스트 레이어를 사용하며 페이지 이미지의 글자를 인식하지 않습니다. 읽을 수 있는 텍스트가 없는 페이지의 경우 PDF OCR을 별도로 사용하세요. 빈 페이지도 텍스트를 생성하지 않을 수 있습니다. 혼합된 PDF의 경우 빈 페이지나 읽을 수 없는 페이지를 개별적으로 검사하세요. OCR은 선택한 페이지를 한 번에 하나씩 처리합니다.
최대 100 MB 및 750 페이지의 PDF 하나를 열 수 있습니다. 보호된 파일은 이 도구에서 암호 입력을 명시적으로 제공하지 않는 한 잠금 해제된 복사본이 필요합니다. 크거나 복잡한 페이지는 파일이 제한 내에 있더라도 더 많은 메모리가 필요하거나 처리 제한에 도달할 수 있습니다.
처리는 당사 서버를 사용합니다. 원본 파일, 임시 파일 및 결과물은 처리 완료 후 30분 이내에 서버에서 삭제됩니다. 당사는 문서 내용을 제3자와 공유하거나 AI 모델 학습에 사용하지 않습니다.
시작하기 전에 무엇을 기대할 수 있는지 확인하세요.
임시 서버 처리페이지 콘텐츠와 기하학적 구조를 내보내며, 자동으로 명명된 비즈니스 필드를 인식하지는 않습니다. 귀하의 애플리케이션이 해당 구조를 해석해야 합니다. 표 셀의 경우 'PDF에서 표 추출'을 사용하고, 스캔 문서의 경우 'PDF OCR'을 사용하십시오.
버전이 지정된 구조에는 페이지, 텍스트 블록 및 범위, 글꼴, 경계 상자 및 벡터 드로잉 경로가 포함됩니다. 좌표는 회전되지 않은 페이지의 왼쪽 상단 원점에서 PDF 포인트 단위로 표시되며, 회전은 별도로 기록됩니다. 이는 인덱싱이나 문서 분석을 지원할 수 있지만, 변환기가 귀하의 비즈니스 스키마나 의미론적 필드 이름을 추론하지는 않습니다.
페이지에 이미지 데이터가 포함된 경우, 아카이브에는 document.json 또는 document.xml과 참조된 이미지 파일 및 지원되는 마스크가 포함됩니다. 데이터를 다른 곳에서 로드할 때는 해당 경로를 함께 유지하세요. 이미지만 있는 스캔본은 이미지 데이터로 유지되며, 이 내보내기 기능은 누락된 텍스트 범위를 생성하기 위해 OCR을 수행하지 않습니다.
추출은 기존 텍스트 레이어를 사용하며 페이지 이미지의 문자를 인식하지 않습니다. 페이지에 읽을 수 있는 텍스트가 없으면 PDF OCR을 별도로 사용하세요. 빈 페이지는 텍스트를 생성하지 않을 수도 있습니다. 혼합된 PDF의 경우 비어 있거나 읽을 수 없는 페이지를 개별적으로 검사하세요. OCR은 선택한 페이지를 한 번에 하나씩 처리합니다.
최대 100 MB 및 750 페이지의 PDF 하나를 열 수 있습니다. 보호된 파일은 이 도구에서 암호 입력을 명시적으로 제공하지 않는 한 잠금 해제된 복사본이 필요합니다. 크거나 복잡한 페이지는 파일이 제한 내에 있더라도 더 많은 메모리가 필요하거나 처리 제한에 도달할 수 있습니다.
이 도구는 처리를 위해 당사 서버를 사용합니다. 원본 파일은 덮어쓰이지 않으며, 결과물은 별도의 다운로드 파일로 제공됩니다. 가능한 경우 결과를 미리 보고 검토한 후, 다시 시작하기 전에 필요한 사본을 다운로드하세요.
빠른 영상 튜토리얼
레이아웃 데이터와 함께 PDF를 XML로 변환하는 방법
나만의 워크플로우를 위한 구조화된 페이지 데이터를 가져오세요.
영어 내레이션
영상 보기