ข้ามไปยังเนื้อหาหลัก
← กลับไปบล็อก
อ่าน 5 นาทีDocCrunch Team

ทำไมข้อความจึงคัดลอกไม่ได้หลังบีบอัด PDF?

เข้าใจการแปลงหน้า PDF เป็นภาพและชั้นข้อความ พร้อมตรวจการคัดลอก ค้นหา ลิงก์ และแบบฟอร์มก่อนใช้งานไฟล์ที่บีบอัดแล้ว

บีบอัด PDFชั้นข้อความ PDFคัดลอกข้อความ PDF ไม่ได้แปลงหน้า PDF เป็นภาพ

หลังบีบอัด PDF หน้าเอกสารอาจดูแทบไม่เปลี่ยน แต่เลือกข้อความไม่ได้ และค้นหาคำที่เห็นอยู่ก็ไม่พบ ปัญหาอาจไม่ได้มาจากโปรแกรมอ่าน เพราะการบีบอัดอาจเปลี่ยนทั้งหน้าให้เป็นภาพไปแล้ว

ขนาดไฟล์และความคมชัดจึงยังไม่เพียงพอสำหรับตัดสินผลลัพธ์ ต้องตรวจด้วยว่าฟังก์ชันเดิมของเอกสารยังอยู่หรือไม่

หน้าตาเหมือนเดิม แต่วิธีเก็บข้อมูลอาจเปลี่ยนไป

หนึ่งหน้า PDF สามารถมีข้อความ ภาพ กราฟิกเวกเตอร์ และลิงก์อยู่ร่วมกัน สิ่งที่เห็นบนหน้าจอเป็นผลจากการแสดงองค์ประกอบเหล่านั้นร่วมกัน

วัตถุข้อความมักรองรับการเลือก คัดลอก และค้นหา ส่วนตัวอักษรในภาพเป็นเพียงพิกเซล การดูเหมือนข้อความไม่ได้ทำให้ดึงข้อความออกมาโดยตรงได้

เอกสารสแกนอาจมีชั้นข้อความที่ OCR สร้างไว้ใต้ภาพที่แสดงด้วย ดังนั้น PDF ที่ดูเหมือนภาพถ่ายก็อาจค้นหาและคัดลอกข้อความได้

หากการบีบอัดเก็บไว้เฉพาะสิ่งที่มองเห็น แล้วนำภาพแต่ละหน้าไปใส่ใน PDF ใหม่ ชั้นข้อความเดิมอาจหายไป เอกสารยังอ่านได้ แต่วิธีเก็บเนื้อหาเปลี่ยนแล้ว

PDF บีบอัดได้หลายวิธี

แต่ละวิธีเปลี่ยนคนละส่วนของไฟล์

วิธี สิ่งที่เปลี่ยนหลัก ๆ สิ่งที่ควรระวัง
จัดโครงสร้างไฟล์ใหม่ วิธีเก็บวัตถุและข้อมูล อาจลดได้ไม่มาก และยังต้องตรวจฟังก์ชัน
บีบอัดภาพภายในหน้า ความละเอียดหรือคุณภาพการเข้ารหัสภาพ รายละเอียดภาพอาจลดลงโดยไม่จำเป็นต้องกระทบข้อความ
เปลี่ยนทั้งหน้าเป็นภาพ วิธีเก็บเนื้อหาหน้า ข้อความ เวกเตอร์ และการโต้ตอบอาจไม่ถูกเก็บไว้

วิธีที่สามเรียกว่าการแรสเตอร์ไรซ์ โดยเรนเดอร์หน้าเอกสารแล้วสร้าง PDF ใหม่จากภาพ สำหรับบางไฟล์วิธีนี้ลดขนาดได้มาก แต่ผลกระทบไม่ได้มีเพียงความคมชัดที่ลดลงเล็กน้อย

ปัจจุบัน DocCrunch บีบอัด PDF สร้างทั้งเวอร์ชันที่บันทึกโครงสร้างใหม่และเวอร์ชันที่สร้างจากภาพหน้าเอกสาร แล้วเลือกไฟล์ที่เล็กกว่า หากทั้งสองไม่เล็กกว่าต้นฉบับ จะส่งคืนไฟล์ต้นฉบับ

วิธีที่ถูกเลือกจึงขึ้นอยู่กับเนื้อหา ไม่ควรถือว่าผลลัพธ์ทุกไฟล์จะยังคัดลอกข้อความได้

การตั้งค่าชัดที่สุดไม่ได้รับประกันชั้นข้อความ

ความคมชัดอธิบายภาพที่เห็น ส่วนชั้นข้อความอธิบายโครงสร้างไฟล์

ภาพหน้าเอกสารความละเอียดสูงอาจคมชัดมากแต่เลือกข้อความโดยตรงไม่ได้ ในทางกลับกัน PDF ที่มีวัตถุข้อความอาจคัดลอกข้อความได้ตามปกติ แม้ภาพประกอบจะไม่ชัด

ระดับการบีบอัดของ DocCrunch มีผลต่อคุณภาพภาพและสเกลการเรนเดอร์เมื่อสร้างหน้าใหม่ ปัจจุบันไม่มีตัวเลือกแยกที่รับประกันว่าจะเก็บชั้นข้อความไว้เสมอ ดังนั้นเลือกค่าชัดที่สุดก็ไม่ได้รับประกันว่าจะเลือกข้อความได้

หากต้องค้นหา อ้างข้อความ หรือแปลงเป็นเอกสารที่แก้ไขได้ภายหลัง ควรทดลองฟังก์ชันเหล่านั้น ไม่ใช่แค่ขยายดูขอบตัวอักษร

ไม่ใช่แค่การคัดลอกที่อาจเปลี่ยน

เมื่อหน้าเอกสารกลายเป็นภาพ ต้องตรวจฟังก์ชันที่เคยอาศัยวัตถุแยกกันด้วย

  • การค้นหา: คำที่เห็นอาจไม่ปรากฏในผลค้นหาของเอกสาร
  • ลิงก์: ที่อยู่อาจยังแสดง แต่พื้นที่คลิกเดิมอาจหายไป
  • แบบฟอร์ม: ช่องกรอกอาจเหลือเพียงหน้าตาและไม่รับข้อมูล
  • การขยาย: ขอบข้อความและเส้นเวกเตอร์อาจเริ่มเห็นเป็นพิกเซล
  • การแปลงต่อ: ข้อความที่เคยดึงได้อาจต้องทำ OCR ใหม่

โปรแกรมอ่านบางตัวรู้จำข้อความในภาพอัตโนมัติ ทำให้ยังเลือกหรือคัดลอกได้ แต่นั่นไม่ได้พิสูจน์ว่า PDF เองเก็บชั้นข้อความไว้ โปรแกรมอื่นอาจทำงานต่างกัน

ถ้ายังต้องแปลงเป็น Word ให้เก็บ PDF ต้นฉบับและใช้ PDF เป็น Word กับไฟล์นั้น เครื่องมือปัจจุบันของ DocCrunch เน้นดึงข้อความที่มีอยู่ ไม่ได้ทำ OCR กับหน้าสแกนโดยตรง

ก่อนลดขนาด ให้ตัดสินใจว่าอะไรต้องคงอยู่

ถ้าเอกสารมีไว้เพื่ออ่านเท่านั้น การสร้างหน้าใหม่ด้วยภาพอาจยอมรับได้ ควรตรวจข้อความเล็ก แผนภูมิ และเส้นบางให้ชัดเจน

ถ้าต้องค้นหา กรอกแบบฟอร์ม หรือแปลงต่อ ควรรวมสิ่งเหล่านี้เป็นเงื่อนไขของการบีบอัด ไฟล์ที่เล็กกว่าไม่ได้เหมาะสำหรับส่งมอบมากกว่าเสมอไป

ไม่จำเป็นต้องเริ่มจากลดคุณภาพทุกครั้ง หากต้องการเพียงบางหน้า ให้ใช้ ลบหน้า PDF แล้วตรวจขนาดอีกครั้ง ขนาดอาจไม่ได้ลดตามสัดส่วนจำนวนหน้า แต่บางกรณีช่วยหลีกเลี่ยงการสร้างหน้าที่เก็บไว้เป็นภาพโดยไม่จำเป็น

หากมีเอกสารต้นทาง อีกทางเลือกคือปรับภาพประกอบที่ใหญ่เกินไปแล้วส่งออก PDF ใหม่ วิธีนี้จัดการเนื้อหาที่ใช้พื้นที่โดยไม่ต้องเปลี่ยนทั้งหน้าเป็นภาพ

ตรวจผลลัพธ์ตามการใช้งานจริง

หลังดาวน์โหลด:

  1. ตรวจจำนวนหน้า ลำดับ และความครบถ้วนของเนื้อหา
  2. ขยายข้อความเล็ก เส้นบาง แผนภูมิ และเนื้อหาสีอ่อน
  3. เลือกข้อความส่วนหนึ่งแล้ววางในโปรแกรมแก้ไขข้อความธรรมดา
  4. ค้นหาคำที่แน่ใจว่ามีอยู่ รวมถึงคำในหน้าท้าย ๆ
  5. ทดสอบลิงก์และแบบฟอร์มที่ต้องใช้ พร้อมตรวจขนาดไฟล์จริง

ถ้าต้นฉบับคัดลอกข้อความไม่ได้อยู่แล้ว การบีบอัดไม่ได้ทำให้แก้ไขได้โดยอัตโนมัติ นั่นเป็นงานของการรู้จำข้อความ

หลัง บีบอัด PDF ควรเก็บทั้งต้นฉบับและไฟล์ที่เล็กลง สำเนาที่เหมาะสำหรับส่งอาจไม่เหมาะกับการแก้ไข ค้นหา หรือแปลงต่อ การแยกเวอร์ชันส่งมอบออกจากต้นทางช่วยให้งานภายหลังสะดวกขึ้น

เครื่องมือ DocCrunch ที่แนะนำ

เครื่องมือเหล่านี้ทำงานในเบราว์เซอร์ในเครื่องเมื่อเป็นไปได้ จึงไม่ต้องอัปโหลดไฟล์ไปยังเซิร์ฟเวอร์