ข้ามไปยังเนื้อหาหลัก
← กลับไปบล็อก
อ่าน 5 นาทีDocCrunch Team

แปลง PDF เป็น Word ไม่ได้หมายถึงกู้เอกสารต้นฉบับกลับมา

แยกชั้นข้อความ PDF การทำ OCR และการจัดเค้าโครงใหม่ เลือกวิธีแปลงที่เหมาะ แล้วตรวจข้อความ ตาราง ตัวเลข และรูปแบบเอกสาร

PDF เป็น Wordชั้นข้อความ PDFOCR ไฟล์สแกนตรวจผลแปลง PDF

หลังแปลง PDF เป็น Word ข้อความอาจแก้ไขได้ แต่เอกสารยังไม่พร้อมส่ง ย่อหน้าอาจแตก คอลัมน์ตารางเลื่อน และหัวกระดาษปนกับเนื้อหา สิ่งที่เคยเรียบร้อยอาจต้องจัดใหม่

ไม่ได้แปลว่าการแปลงล้มเหลวเสมอไป PDF เน้นเก็บหน้าตาของหน้า ส่วน Word ต้องมีโครงสร้างที่แก้ได้ เช่น ย่อหน้า ตาราง และสไตล์ เครื่องมือต้องอนุมานโครงสร้างเหล่านี้จากข้อมูลที่มี ซึ่งอาจไม่ได้เก็บความสัมพันธ์เดิมไว้ครบ

ก่อนเลือกส่งออก ควรรู้ว่าไฟล์มีอะไรและต้องการนำอะไรออกมา

ตรวจชั้นข้อความก่อน

PDF สองไฟล์ที่หน้าตาเหมือนกันอาจต่างกันภายใน เอกสารจากโปรแกรมมักมีวัตถุข้อความ ไฟล์สแกนอาจมีแค่ภาพหน้า และบางไฟล์มีชั้นข้อความที่ผ่าน OCR แล้ว

ประเภทไฟล์ สิ่งที่มักมี วิธีที่เหมาะ
PDF ที่สร้างจากโปรแกรม ข้อความ ภาพ และข้อมูลตำแหน่ง ลองดึงข้อความโดยตรง
สแกนที่มีแต่ภาพ หน้าที่ไม่มีข้อความให้ดึง ใช้ OCR
สแกนที่ผ่าน OCR ภาพและชั้นข้อความที่รู้จำแล้ว ดึงข้อความแล้วตรวจข้อผิดพลาด

วิธีตรวจเบื้องต้นคือเลือกข้อความบางส่วน วางในโปรแกรมข้อความล้วน แล้วค้นหาคำหนึ่งใน PDF

ถ้าข้อความที่คัดลอกอ่านได้ แสดงว่ามีข้อมูลข้อความที่ใช้ได้อย่างน้อยบางส่วน หากตัวอักษรเพี้ยน ลำดับผิด หรือเลือกได้แค่ทั้งภาพ ต้องตรวจต่อ วิธีนี้ช่วยเลือกเส้นทาง แต่ไม่รับประกันข้อความทั้งไฟล์

ดึงข้อความได้ ไม่ได้แปลว่าโครงสร้างยังเหมือนเดิม

เมื่อมีชั้นข้อความ DocCrunch PDF เป็น Word จะดึงข้อความที่มีอยู่และจัดตามหน้าและตำแหน่ง

บรรทัดที่ดูต่อเนื่องอาจประกอบด้วยชิ้นส่วนแยกกัน ย่อหน้าเดียวอาจถูกเก็บเป็นหลายส่วนเพราะการขึ้นบรรทัด คอลัมน์ หรือเปลี่ยนหน้า เครื่องมือต้องตัดสินใจว่าส่วนใดควรรวมกัน

ผลที่พบบ่อย ได้แก่:

  • ย่อหน้าต่อเนื่องกลายเป็นหลายย่อหน้าสั้น
  • ลำดับอ่านของหน้าสองคอลัมน์เปลี่ยนไป
  • หัวกระดาษ ท้ายกระดาษ หรือเลขหน้าเข้าไปอยู่ในเนื้อหา
  • ใช้ช่องว่างและระยะเยื้องประมาณตำแหน่งเดิม

ถ้าต้องการแค่ข้อความไปแก้ อาจยอมรับได้ แต่การคืนสไตล์ ตำแหน่งภาพ และการแบ่งหน้าต้องเผื่อเวลาจัดใหม่

OCR อ่านไฟล์สแกน ไม่ได้คืนเค้าโครงทั้งหมด

ไฟล์สแกนที่มีแต่ภาพไม่มีข้อความสำเร็จรูปให้ดึง ต้องรู้จำตัวอักษรจากภาพก่อน

ปัจจุบัน PDF เป็น Word และ Excel ของ DocCrunch ไม่ทำ OCR โดยตรงกับหน้าที่มีแต่ภาพ ให้ส่งออกหน้าที่ต้องการด้วย PDF เป็นรูปภาพ แล้วใช้ รูปภาพเป็น Word หรือ รูปภาพเป็น Excel

ไฟล์ที่มีชั้น OCR อยู่แล้วสามารถลองดึงโดยตรงได้ แต่ชั้นข้อความไม่ได้รับประกันความถูกต้อง หน้าที่เห็นอาจเป็นภาพต้นฉบับ ขณะที่ข้อความที่คัดลอกมีข้อผิดพลาดจากการรู้จำเดิม

หน้าเอียง แสงสะท้อน คอนทราสต์ต่ำ ตัวเล็ก ตราประทับหรือข้อความเขียนทับล้วนเพิ่มข้อผิดพลาด ควรใช้สแกนต้นฉบับชัดและหลีกเลี่ยงการบีบอัดแรงก่อน OCR ซึ่งอาจลบรายละเอียดที่ต้องใช้

ตรวจทั้งเนื้อหาและตำแหน่งในตาราง

ข้อผิดพลาดไม่ใช่แค่อ่านตัวอักษรผิด ยอดเงินถูกแต่ลงผิดคอลัมน์ หรือหนึ่งรายการถูกแยกเป็นสองแถว ก็อาจเปลี่ยนความหมาย

PDF เป็น Excel ใช้ลองดึงตารางที่มีชั้นข้อความได้ แต่หัวตารางซับซ้อน เซลล์รวม ตารางข้ามหน้า และระยะคอลัมน์ไม่สม่ำเสมอต้องตรวจ

ดูโครงสร้างก่อน หัวตารางต้องตรงกับข้อมูล แต่ละแถวยังเป็นรายการเดียวกัน และส่วนข้ามหน้าต้องไม่ขาดหรือซ้ำ

แล้วตรวจค่า ดูจุดทศนิยม เครื่องหมายลบ เปอร์เซ็นต์ วันที่ หน่วย และเลขศูนย์ต้นรหัส รวมถึงตัวเลขที่ถูกเก็บเป็นข้อความ

ตารางที่ดูเป็นระเบียบยังไม่รับประกันว่าพร้อมคำนวณหรือนำเข้าระบบอื่น

กำหนดขอบเขตตรวจตามการใช้งาน

ถ้าดึงเพียงไม่กี่ย่อหน้า ให้เน้นเนื้อหาและลำดับ การแบ่งหน้าเดิมอาจไม่สำคัญ

ถ้าจะแก้ทั้งเอกสาร ให้ตรวจการรวมย่อหน้า ระดับหัวข้อ เลขรายการ และตาราง ก่อนตั้งสไตล์ให้เหมือนกัน วิธีนี้ดูแลง่ายกว่าปรับช่องว่างทีละบรรทัด

ถ้าจะส่งอย่างเป็นทางการ ต้องดูเลขหน้า ภาพ หมายเหตุ และตัวแบ่งหน้าด้วย ส่งออก PDF ใหม่แล้วเทียบต้นฉบับทีละหน้า

ยอดเงิน เลขบัญชี วันที่ ชื่อ และรหัสสินค้าต้องเทียบของเดิม เครื่องตรวจสะกดอย่างเดียวไม่พอ และรูปแบบที่ดูสมเหตุสมผลไม่ได้ยืนยันเนื้อหาถูก

เก็บต้นฉบับแล้วสร้างสำเนาที่แก้ได้

Word หรือ Excel ที่ได้เหมาะเป็นสำเนาทำงาน มากกว่าจะใช้แทน PDF โดยตรง

การเก็บต้นฉบับทำให้ยังมีหลักเทียบหลังแปลงหลายรอบ ถ้ามีข้อความใช้ได้ ให้ดึงจากต้นฉบับแทนการทำหน้าเป็นภาพบีบอัดแล้วกลับไป OCR

ลำดับที่ชัดเจนคือจำแนกไฟล์ เลือกดึงหรือรู้จำ ตรวจเนื้อหา จัดโครงสร้าง แล้วจึงเก็บรายละเอียดเค้าโครง

การแปลงช่วยลดเวลาพิมพ์ใหม่ แต่ความถูกต้องและโครงสร้างที่ใช้ได้ยังต้องยืนยันด้วยการตรวจ

เครื่องมือ DocCrunch ที่แนะนำ

เครื่องมือเหล่านี้ทำงานในเบราว์เซอร์ในเครื่องเมื่อเป็นไปได้ จึงไม่ต้องอัปโหลดไฟล์ไปยังเซิร์ฟเวอร์