פתח את PDF ל-JSON כדי לייצא רשומות עמודים, בלוקים של טקסט ונתוני שרטוט. קובץ ה-PDF שלנו בן ארבעת העמודים מפיק document.json בתוספת תמונת PNG מקושרת אחת בתוך קובץ ZIP.
בחר את עמודי ה-PDF
טען את ה-PDF והשאר את עמודים ריק עבור כל המסמך, או הזן את קבוצת המשנה שאתה צריך. הדוגמה שלנו כוללת את כל ארבעת העמודים.
ייצא ושמור את הנכסים יחד
בחר התחל. ייצוא עם נכסי תמונה יורד כ-ZIP. חלץ את כל הארכיון ושמור את ספריית images לצד document.json.
הדוגמה כוללת את images/page-001-image-005.png. הפניות לתמונות מצביעות על נתיבי נכסים במקום להטמיע נתונים בינאריים בתוך ה-JSON. ייצוא ללא נכסי תמונה יכול לרדת ישירות כ-.json.
קרא את מבנה המסמך
הדוגמה מצהירה על גרסה 1, יחידות pt ונקודת מוצא top-left. רשומות עמוד כוללות את מספר עמוד המקור, ממדים, סיבוב, בלוקים ושרטוטים. קואורדינטות מתארות את העמוד ללא סיבוב; קח בחשבון סיבוב בעת הצגת הנתונים.
נתח את ה-JSON באמצעות מנתח JSON. בדוק בלוקים, שורות וטווחים עבור טקסט ועיצוב, וערכי bbox עבור גיאומטריה. אובייקטים מקוננים מתארים פריסה במקום מחרוזת טקסט בודדת.
בדוק את סדר הקריאה והפניות לתמונות מול ה-PDF המקורי לפני השימוש בנתונים בזרימת העבודה שלך.
שאלות נפוצות
האם אוכל לבנות מחדש את ה-PDF המקורי במדויק?
אל תניח שחזור מדויק של הלוך-חזור. הייצוא מתאר תוכן וגיאומטריה זמינים, בעוד שתכונות וסמנטיקה של PDF יכולים להיות מורכבים יותר.
מדוע קיבלתי ZIP?
הדוגמה מכילה תמונה. ZIP שומר על document.json והנכס המקושר יחד כדי שניתן יהיה לאתר את התמונה.
נסה זאת עם המסמך שלך
סקור את התוצאה, ולאחר מכן שמור את הגרסה שאתה צריך.

