เครื่องมือ150

งาน PDF ที่มีประโยชน์ ทำให้เป็นเรื่องง่าย

ดึงข้อมูลจาก PDF.

ค้นหาข้อมูลที่คุณต้องการ เก็บหน้าแหล่งที่มาไว้พร้อมกับผลลัพธ์ทุกรายการ

Advertisements
พื้นที่ทำงาน PDF ของคุณ
บนอุปกรณ์ของคุณ
หรือวางไฟล์ของคุณที่นี่
ไฟล์ PDF ของคุณถูกประมวลผลในเบราว์เซอร์นี้ PDF
Advertisements

วิธีดึงข้อมูลจาก PDF

  1. 01

    เลือกหนึ่งไฟล์ PDF

    โหลดเอกสารที่มีข้อความที่เลือกได้ หรือลองใช้ตัวอย่าง

  2. 02

    ดึงข้อมูลและตรวจสอบ

    เลือก 'ดึงข้อมูล' ตรวจสอบค่า จำนวน และหน้าต้นฉบับ กรองหรือเรียงลำดับรายการ

  3. 03

    คัดลอกหรือดาวน์โหลด

    คัดลอกค่า หรือดาวน์โหลด CSV พร้อมการอ้างอิงหน้า หรือรายการ TXT แบบง่าย

บล็อกวิธีดึงข้อมูลที่มีโครงสร้างจาก PDFอ่านคู่มือ

ดึงค่าที่มีโครงสร้างจาก PDF เป็น CSV หรือข้อความ

เลือกประเภทข้อมูลที่คุณต้องการ: อีเมล, หมายเลขโทรศัพท์, URL, วันที่ที่เป็นตัวเลข, ที่อยู่ IPv4, โดเมน, DOI, ISBN, แฮชแท็ก และที่อยู่ MAC ตรวจสอบค่าที่ดึงมาพร้อมจำนวนและการอ้างอิงหน้า

ค่าที่ตรวจพบจะกลายเป็นรายการพร้อมการอ้างอิงหน้าแหล่งที่มา
วิดีโอสอนการใช้งานฉบับย่อ วิธีดึงข้อมูลที่มีโครงสร้างจาก PDF รวบรวมผู้ติดต่อและตัวระบุการวิจัยไว้ในรายการเดียวที่เป็นระเบียบ คำบรรยายภาษาอังกฤษ ดูวิดีโอ

วิธีดึงข้อมูลที่มีโครงสร้างจาก PDF

สิ่งนี้มีประโยชน์เมื่อใด?

การวิจัย

รวบรวมตัวระบุ

รวบรวมค่า DOI และ ISBN พร้อมหน้าที่มีข้อมูลปรากฏ

รายงาน

ดึงรายละเอียดที่เป็นตัวเลข

ค้นหารายการที่มีวันที่และที่อยู่ IPv4

ไดเรกทอรี

สร้างรายชื่อผู้ติดต่อ

รวมอีเมล หมายเลขโทรศัพท์ และลิงก์เว็บไว้ในการส่งออกที่มีโครงสร้างเดียว

ฟีเจอร์และการควบคุม

เลือกประเภทข้อมูลที่มีประโยชน์

เริ่มต้นด้วยอีเมล โทรศัพท์ และ URL จากนั้นเปิดประเภทข้อมูลเพิ่มเติมสำหรับค่าเฉพาะทาง

สิ่งที่ตัวจดจำรองรับ

วันที่ต้องใช้รูปแบบตัวเลขที่มีปีสี่หลัก ค่าวัน/เดือนที่กำกวมจะคงลำดับแหล่งที่มาไว้ ออคเต็ต IPv4 จะได้รับการตรวจสอบ ส่วน IPv6 จะไม่รวมอยู่ด้วย

โดเมนจะมาจากอีเมลและลิงก์เว็บที่จดจำได้ ไม่ใช่ชื่อไฟล์ตามอำเภอใจ การดึงข้อมูล DOI ครอบคลุมรูปแบบ DOI สมัยใหม่ทั่วไป ไม่ใช่ทุกรูปแบบในอดีต ค่า ISBN-13 ต้องมีเช็คซัมที่ถูกต้อง ส่วน ISBN-10 ต้องมีป้ายกำกับ ISBN ด้วย แฮชแท็กสามารถมีตัวอักษร Unicode รวมถึงภาษาอาหรับได้

ที่อยู่ MAC ใช้คู่ที่คั่นด้วยเครื่องหมายทวิภาคหรือยัติภังค์หกคู่ เครื่องมือจะไม่ติดต่อที่อยู่หรือตัวระบุที่ดึงมาโดยเด็ดขาด

ตรวจสอบค่าต่างๆ พร้อมกับหน้าแหล่งที่มา

ตรวจสอบจำนวน กระโดดไปยังหน้า PDF และกรองรายการผลลัพธ์

ตรวจสอบและจัดระเบียบ

ผลลัพธ์แต่ละรายการจะบันทึกตำแหน่งหน้าจริงใน PDF ซึ่งอาจแตกต่างจากเลขหน้าที่พิมพ์ เลือกชิปหน้าเพื่อเปิดตัวอย่างพร้อมไฮไลต์โดยประมาณ

การลบรายการซ้ำจะเปิดใช้งานไว้ตั้งแต่ต้น จำนวนจะรวมการซ้ำกันของค่าเดียวกันที่จดจำได้ ปิดสวิตช์เพื่อดูเหตุการณ์ที่แยกจากกัน การเรียงลำดับตามตัวอักษรจะเปลี่ยนลำดับรายการ การกรองจะมีผลกับการคัดลอกและการดาวน์โหลดรวมถึงแถวที่มองเห็นได้

คัดลอกค่าหรือดาวน์โหลดรายการที่มีโครงสร้าง

เลือก CSV สำหรับจำนวนและหน้า หรือ TXT สำหรับหนึ่งค่าต่อบรรทัด

สิ่งที่แต่ละการดาวน์โหลดประกอบด้วย

CSV ประกอบด้วยคอลัมน์ประเภท ค่า จำนวน และหน้า การเข้ารหัส UTF-8 รองรับภาษาอาหรับและสคริปต์อื่นๆ ค่าที่อาจถูกตีความว่าเป็นสูตรสเปรดชีตจะถูกนำหน้าด้วยเครื่องหมายอะพอสทรอฟีเพื่อการนำเข้าที่ปลอดภัยยิ่งขึ้น

TXT และการคัดลอกทั้งหมดประกอบด้วยค่าเท่านั้น หนึ่งค่าต่อบรรทัด แถวทั้งหมดที่ตรงกับตัวกรองจะถูกรวมไว้ แม้ว่าตารางบนหน้าจอจะครอบคลุมหลายหน้าผลลัพธ์ก็ตาม ไม่มีการสร้าง PDF ใหม่และ PDF ต้นฉบับจะไม่เปลี่ยนแปลง

จัดการการดึงข้อมูลขนาดใหญ่ให้ง่าย

ประมวลผล PDF หนึ่งไฟล์ในเบราว์เซอร์ของคุณ พร้อมขีดจำกัดที่ชัดเจนและประกาศผลลัพธ์บางส่วน

ไฟล์ ขีดจำกัด และหน้าที่สแกน

โหลด PDF หนึ่งไฟล์สูงสุด 50 MiB และ 500 หน้า การดึงข้อมูลจะตรวจสอบอักขระสูงสุด 250,000 ตัวและ 2,000 รายการที่ตรงกันต่อหน้า, อักขระ 10 ล้านตัวและ 20,000 รายการที่ตรงกันโดยรวม และ 2,000 คำอธิบายประกอบต่อหน้า งบประมาณการดึงข้อมูล 90 วินาทีจะจำกัดการทำงานที่ยาวนาน เอกสารที่ซับซ้อนมากอาจทำงานได้ดีขึ้นเมื่อแบ่งเป็นไฟล์ขนาดเล็ก

เมื่อถึงขีดจำกัดหรือหน้าไม่สามารถอ่านได้ทั้งหมด ผลลัพธ์จะแสดงประกาศ และการทำงานที่จำกัดหรือล้มเหลวจะส่งออกพร้อมคำว่า partial ในชื่อไฟล์ หน้าที่ไม่มีข้อความที่เลือกได้จะถูกนับแยกต่างหาก ใช้ PDF OCR สำหรับการสแกนที่เป็นรูปภาพเท่านั้น จากนั้นกลับมาเพื่อดึงข้อความที่จดจำได้

เนื้อหา PDF จะถูกประมวลผลในเครื่องในเบราว์เซอร์นี้ เอกสารที่อัปโหลดจะไม่ถูกส่งไปยังเซิร์ฟเวอร์การดึงข้อมูล ลิงก์ ที่อยู่อีเมล และหมายเลขโทรศัพท์ที่พบภายใน PDF จะไม่ถูกติดต่อโดยอัตโนมัติ

ไฟล์ที่รองรับและการประมวลผล

อินพุต
PDF
เอาต์พุต
CSV / TXT

เปิดไฟล์ PDF ได้หนึ่งไฟล์ขนาดสูงสุด 50 MB และ 750 หน้า อาจมีข้อจำกัดเพิ่มเติมด้านเอาต์พุต หน่วยความจำ และการประมวลผลสำหรับเอกสารที่มีความซับซ้อน

การประมวลผลจะเกิดขึ้นบนอุปกรณ์ของคุณโดยไม่ต้องอัปโหลดเอกสาร โปรดดาวน์โหลดผลลัพธ์ก่อนปิดหน้าเว็บ และเก็บไฟล์ต้นฉบับไว้แยกต่างหาก

Advertisements
คำถามที่พบบ่อย

คำตอบที่มีประโยชน์บางประการ

รู้ว่าจะเกิดอะไรขึ้นก่อนที่คุณจะเริ่ม

บนอุปกรณ์ของคุณ
เครื่องมือนี้สามารถตรวจจับอะไรได้บ้าง?

เลือกประเภทข้อมูลที่คุณต้องการ: อีเมล, หมายเลขโทรศัพท์, URL, วันที่ที่เป็นตัวเลข, ที่อยู่ IPv4, โดเมน, DOI, ISBN, แฮชแท็ก และที่อยู่ MAC ตรวจสอบค่าที่ดึงออกมาพร้อมจำนวนนับและการอ้างอิงหน้า เครื่องมือนี้ดึงค่าที่ตรวจจับได้ ไม่ใช่ตาราง ใบแจ้งหนี้ หรือฟิลด์เชิงความหมาย รูปแบบและผลรวมตรวจสอบ (checksum) ช่วยลดสัญญาณรบกวนแต่ไม่รับประกันความครบถ้วนหรือพิสูจน์ว่าตัวระบุนั้นเป็นของจริง

ฉันสามารถดึงข้อมูลจาก PDF ที่สแกนมาได้หรือไม่?

ระบบจะอ่านเฉพาะข้อความที่เลือกได้และเป้าหมายลิงก์ที่ตรวจพบเท่านั้น หน้าที่เป็นรูปภาพล้วนจำเป็นต้องทำ OCR สำหรับ PDF ก่อน ให้รัน OCR ดาวน์โหลด PDF ที่ค้นหาได้ แล้วจึงกลับมาที่เครื่องมือดึงข้อมูลนี้

รายการซ้ำและจำนวนถูกจัดการอย่างไร?

การลบรายการซ้ำจะรวมค่าที่ตรวจพบว่าเหมือนกันเข้าด้วยกัน โดยจำนวนนับจะแสดงการปรากฏที่ตรวจพบ และหน้าจะแสดงตำแหน่งหน้า PDF จริง ปิดตัวเลือกนี้หากต้องการแยกรายการที่ปรากฏออกจากกัน เป้าหมายที่พิมพ์ออกมาและลิงก์ที่คลิกได้ซึ่งตรงกันในหน้าเดียวกันจะไม่ถูกนับซ้ำ

CSV และ TXT แตกต่างกันอย่างไร?

CSV จะรวมประเภท ค่า จำนวนการปรากฏ และการอ้างอิงหน้า ส่วน TXT และคัดลอกทั้งหมดจะให้เฉพาะค่าเท่านั้น โดยแสดงค่าละหนึ่งบรรทัด ข้อมูลทุกแถวที่ตรงกับตัวกรองปัจจุบันจะถูกรวมไว้ ไม่ใช่แค่เฉพาะหน้าตารางที่มองเห็นได้เท่านั้น

PDF ถูกอัปโหลดเพื่อการดึงข้อมูลหรือไม่?

ไม่ การแยกวิเคราะห์ PDF การจับคู่ และการส่งออกจะทำงานในเบราว์เซอร์นี้ PDF ต้นฉบับจะไม่เปลี่ยนแปลง ไม่มีการติดต่อลิงก์ อีเมล หรือหมายเลขโทรศัพท์ที่ดึงมาโดยอัตโนมัติ

มีข้อจำกัดอะไรบ้าง?

PDF หนึ่งไฟล์ขนาดสูงสุด 50 MiB และ 500 หน้า การดึงข้อมูลจำกัดที่ 250,000 ตัวอักษรและ 2,000 รายการที่ตรงกันต่อหน้า รวมทั้งหมดไม่เกิน 10 ล้านตัวอักษรและ 20,000 รายการที่ตรงกัน และคำอธิบายประกอบ 2,000 รายการต่อหน้า ผลลัพธ์จะมีประกาศแจ้งหากถึงขีดจำกัดหรือมีหน้าที่ไม่สามารถอ่านได้ทำให้ข้อมูลไม่ครบถ้วน

ทำต่อไป

คุณต้องการทำอะไรต่อไป?

เลือกเครื่องมือ PDF ที่เสร็จสมบูรณ์ของคุณจะไปกับคุณ

PDF

Advertisements

ภาษา38

English العربية Français Italiano Deutsch Español Português Nederlands Русский Türkçe 日本語 中文 हिन्दी Bahasa Indonesia Bahasa Melayu 한국어 Tiếng Việt ไทย Polski Svenska Українська Norsk বাংলা Ελληνικά فارسی اردو Čeština Dansk Magyar Română Suomi Български Filipino ქართული Slovenčina Azərbaycanca עברית Slovenščina