도구150

간편하고 유용한 PDF 작업

PDF를 XML로 변환.

PDF 텍스트, 이미지 및 드로잉 기하학적 구조를 XML로 내보내세요.

Advertisements
나만의 PDF 작업 공간
임시 서버 처리
또는 여기에 파일을 놓으세요
시작 시 임시 처리를 위해 전송됩니다. PDF
Advertisements

PDF를 XML로 변환하는 방법

  1. 01

    문서 선택

    기기에서 PDF 하나를 업로드하세요.

  2. 02

    결과 설정

    사용 가능한 설정을 검토한 후 처리를 시작하세요.

  3. 03

    파일 다운로드

    결과를 저장하고 공유하기 전에 확인하세요.

블로그레이아웃 데이터와 함께 PDF를 XML로 변환하는 방법가이드 읽기

PDF를 XML로

PDF 텍스트, 이미지 및 드로잉 지오메트리를 XML로 내보내세요. 페이지를 선택하고 구조화된 설명을 다운로드하며, 필요한 경우 이미지 에셋이 함께 패키징됩니다.

소스 구조 유지
빠른 영상 튜토리얼 레이아웃 데이터와 함께 PDF를 XML로 변환하는 방법 나만의 워크플로우를 위한 구조화된 페이지 데이터를 가져오세요. 영어 내레이션 영상 보기

레이아웃 데이터와 함께 PDF를 XML로 변환하는 방법

이 도구를 사용하는 실용적인 방법

개발자

XML 처리 워크플로우에 공급

문서화된 출력 구조를 이해하는 스크립트나 애플리케이션을 위해 페이지 콘텐츠를 XML로 내보내세요.

연구원

텍스트 위치 검사

콘텐츠 좌표를 사용하여 페이지 레이아웃을 연구하세요. 이는 브라우저 픽셀이 아닌 회전되지 않은 PDF 페이지를 참조합니다.

기술 검토

추출과 해석 분리

문서별 파싱 규칙을 만들기 전에 추출된 객체를 검토하세요. 스캔본은 인식된 텍스트를 위해 OCR이 필요합니다.

기능 및 제어

텍스트 및 드로잉 지오메트리 내보내기

단순한 텍스트 사본이 아닌 페이지 콘텐츠의 구조화된 설명을 가져옵니다.

스키마, 좌표 및 페이지 회전

버전이 지정된 구조에는 페이지, 텍스트 블록 및 스팬, 글꼴, 경계 상자 및 벡터 드로잉 경로가 포함됩니다. 좌표는 회전되지 않은 페이지의 왼쪽 상단 원점을 기준으로 한 PDF 포인트 단위이며, 회전은 별도로 기록됩니다. 이는 인덱싱이나 문서 분석을 지원할 수 있지만, 변환기가 사용자의 비즈니스 스키마나 의미론적 필드 이름을 추론하지는 않습니다.

이미지 자산을 데이터와 함께 보관

추출된 이미지가 포함된 경우 직접 데이터 파일이나 ZIP 파일을 받으세요.

데이터 파일 및 참조된 이미지

페이지에 이미지 데이터가 포함된 경우, 아카이브에는 document.json 또는 document.xml과 참조된 이미지 파일 및 지원되는 마스크가 포함됩니다. 데이터를 다른 곳에서 로드할 때는 해당 경로를 함께 유지하세요. 이미지 전용 스캔은 이미지 데이터로 유지되며, 이 내보내기 기능은 누락된 텍스트 스팬을 생성하기 위해 OCR을 수행하지 않습니다.

필요한 페이지 선택

전체 문서를 처리하거나 특정 페이지 번호 및 범위를 입력하세요.

페이지 범위 및 번호 매기기

페이지에 인쇄된 번호 대신 1부터 시작하는 PDF 위치를 사용하세요. 1, 3-5와 같은 목록은 4페이지를 포함합니다. 빈 범위는 모든 페이지를 사용합니다. 문서에 표지나 다르게 번호가 매겨진 챕터가 포함된 경우 미리보기를 확인하세요. 선택한 페이지만 이 변환에 포함됩니다.

이미지 전용 페이지에 OCR 사용

텍스트 추출은 텍스트 레이어를 읽으며, 이미지 내의 글자는 인식하지 않습니다.

스캔, 빈 페이지 및 OCR

추출은 기존 텍스트 레이어를 사용하며 페이지 이미지의 글자를 인식하지 않습니다. 읽을 수 있는 텍스트가 없는 페이지의 경우 PDF OCR을 별도로 사용하세요. 빈 페이지도 텍스트를 생성하지 않을 수 있습니다. 혼합된 PDF의 경우 빈 페이지나 읽을 수 없는 페이지를 개별적으로 검사하세요. OCR은 선택한 페이지를 한 번에 하나씩 처리합니다.

지원되는 파일 및 처리

입력
PDF
출력
XML, ZIP

최대 100 MB 및 750 페이지의 PDF 하나를 열 수 있습니다. 보호된 파일은 이 도구에서 암호 입력을 명시적으로 제공하지 않는 한 잠금 해제된 복사본이 필요합니다. 크거나 복잡한 페이지는 파일이 제한 내에 있더라도 더 많은 메모리가 필요하거나 처리 제한에 도달할 수 있습니다.

처리는 당사 서버를 사용합니다. 원본 파일, 임시 파일 및 결과물은 처리 완료 후 30분 이내에 서버에서 삭제됩니다. 당사는 문서 내용을 제3자와 공유하거나 AI 모델 학습에 사용하지 않습니다.

Advertisements
자주하는 질문

유용한 답변

시작하기 전에 무엇을 기대할 수 있는지 확인하세요.

임시 서버 처리
PDF to XML이 송장 필드나 표의 의미를 인식하나요?

페이지 콘텐츠와 기하학적 구조를 내보내며, 자동으로 명명된 비즈니스 필드를 인식하지는 않습니다. 귀하의 애플리케이션이 해당 구조를 해석해야 합니다. 표 셀의 경우 'PDF에서 표 추출'을 사용하고, 스캔 문서의 경우 'PDF OCR'을 사용하십시오.

구조화된 내보내기에는 어떤 정보가 포함되어 있나요?

버전이 지정된 구조에는 페이지, 텍스트 블록 및 범위, 글꼴, 경계 상자 및 벡터 드로잉 경로가 포함됩니다. 좌표는 회전되지 않은 페이지의 왼쪽 상단 원점에서 PDF 포인트 단위로 표시되며, 회전은 별도로 기록됩니다. 이는 인덱싱이나 문서 분석을 지원할 수 있지만, 변환기가 귀하의 비즈니스 스키마나 의미론적 필드 이름을 추론하지는 않습니다.

다운로드 파일에 가끔 ZIP이 포함되는 이유는 무엇인가요?

페이지에 이미지 데이터가 포함된 경우, 아카이브에는 document.json 또는 document.xml과 참조된 이미지 파일 및 지원되는 마스크가 포함됩니다. 데이터를 다른 곳에서 로드할 때는 해당 경로를 함께 유지하세요. 이미지만 있는 스캔본은 이미지 데이터로 유지되며, 이 내보내기 기능은 누락된 텍스트 범위를 생성하기 위해 OCR을 수행하지 않습니다.

이미지만 있는 스캔본에서 단어를 추출할 수 있나요?

추출은 기존 텍스트 레이어를 사용하며 페이지 이미지의 문자를 인식하지 않습니다. 페이지에 읽을 수 있는 텍스트가 없으면 PDF OCR을 별도로 사용하세요. 빈 페이지는 텍스트를 생성하지 않을 수도 있습니다. 혼합된 PDF의 경우 비어 있거나 읽을 수 없는 페이지를 개별적으로 검사하세요. OCR은 선택한 페이지를 한 번에 하나씩 처리합니다.

파일 및 페이지 제한은 어떻게 되나요?

최대 100 MB 및 750 페이지의 PDF 하나를 열 수 있습니다. 보호된 파일은 이 도구에서 암호 입력을 명시적으로 제공하지 않는 한 잠금 해제된 복사본이 필요합니다. 크거나 복잡한 페이지는 파일이 제한 내에 있더라도 더 많은 메모리가 필요하거나 처리 제한에 도달할 수 있습니다.

문서는 어디에서 처리되나요?

이 도구는 처리를 위해 당사 서버를 사용합니다. 원본 파일은 덮어쓰이지 않으며, 결과물은 별도의 다운로드 파일로 제공됩니다. 가능한 경우 결과를 미리 보고 검토한 후, 다시 시작하기 전에 필요한 사본을 다운로드하세요.

계속하기

다음으로 무엇을 하시겠습니까?

도구를 선택하세요. 완성된 PDF는 그대로 유지됩니다.

PDF

Advertisements

언어38

English العربية Français Italiano Deutsch Español Português Nederlands Русский Türkçe 日本語 中文 हिन्दी Bahasa Indonesia Bahasa Melayu 한국어 Tiếng Việt ไทย Polski Svenska Українська Norsk বাংলা Ελληνικά فارسی اردو Čeština Dansk Magyar Română Suomi Български Filipino ქართული Slovenčina Azərbaycanca עברית Slovenščina