Chuyển PDF sang Word không đồng nghĩa khôi phục tài liệu gốc
Phân biệt lớp chữ PDF, OCR bản quét và khôi phục bố cục. Chọn đường chuyển đổi phù hợp rồi kiểm tra chữ, bảng, số liệu và định dạng.
Sau khi chuyển PDF sang Word, chữ có thể sửa được nhưng tài liệu chưa chắc sẵn sàng giao. Đoạn văn bị chia nhỏ, cột bảng lệch và đầu trang lẫn vào nội dung. Bố cục vốn gọn gàng có thể cần sắp xếp lại.
Đó chưa chắc là chuyển đổi thất bại. PDF giữ cách trình bày trang, còn Word cần cấu trúc chỉnh sửa được như đoạn, bảng và kiểu định dạng. Công cụ phải suy ra những cấu trúc này; quan hệ biên tập ban đầu không phải lúc nào cũng còn đầy đủ trong PDF.
Trước khi chọn nút xuất, cần xác định file có gì và muốn lấy lại gì.
Kiểm tra lớp chữ trước
Hai PDF nhìn giống nhau có thể khác bên trong. Tài liệu xuất từ phần mềm thường có đối tượng văn bản. Bản quét có thể chỉ là ảnh trang. Một số bản quét đã có lớp chữ nhận dạng bằng OCR.
| Loại file | Nội dung thường có | Cách phù hợp |
|---|---|---|
| PDF tạo từ phần mềm | Chữ, ảnh và thông tin vị trí | Thử trích xuất trực tiếp |
| Bản quét chỉ có ảnh | Trang không có chữ để trích xuất | Dùng OCR |
| Bản quét có OCR | Ảnh và lớp chữ nhận dạng | Trích xuất rồi kiểm tra lỗi nhận dạng |
Để kiểm tra sơ bộ, chọn một đoạn, dán vào trình soạn văn bản thuần và tìm một từ trong PDF.
Chữ sao chép đọc được cho thấy ít nhất có thông tin văn bản dùng được. Ký tự lỗi, thứ tự sai hoặc chỉ chọn được cả ảnh trang cần xem thêm. Phép thử giúp chọn đường xử lý, không bảo đảm toàn bộ chữ đầy đủ và chính xác.
Trích xuất chữ chưa chắc giữ cấu trúc
Với file có lớp chữ, DocCrunch PDF sang Word lấy văn bản hiện có và sắp theo trang, vị trí.
Một dòng trông liên tục có thể gồm nhiều mảnh độc lập. Đoạn văn cũng có thể lưu thành nhiều phần do xuống dòng, chia cột hoặc sang trang. Công cụ cần xác định những phần nào thuộc cùng nhau.
Kết quả thường gặp gồm:
- Một đoạn liền thành nhiều đoạn ngắn.
- Thứ tự đọc thay đổi ở bố cục hai cột.
- Đầu trang, chân trang hoặc số trang lọt vào thân bài.
- Khoảng trắng và thụt lề mô phỏng gần đúng vị trí cũ.
Nếu chỉ lấy chữ để sửa, những vấn đề này có thể chấp nhận được. Muốn khôi phục kiểu chữ, vị trí ảnh và phân trang thì cần thời gian dàn lại.
OCR nhận dạng bản quét, không phục dựng toàn bộ bố cục
Bản quét chỉ có ảnh không có sẵn chữ để lấy. Trước hết phải nhận dạng ký tự trong hình.
Hiện công cụ PDF sang Word và Excel của DocCrunch không chạy OCR trực tiếp trên trang chỉ có ảnh. Hãy xuất trang cần dùng qua PDF sang ảnh, rồi dùng ảnh sang Word hoặc ảnh sang Excel.
Bản quét đã có lớp OCR có thể thử trích xuất trực tiếp. Nhưng lớp chữ không chứng minh nội dung đúng: trang hiển thị ảnh gốc, còn chữ sao chép có thể chứa lỗi nhận dạng từ trước.
Trang nghiêng, phản sáng, tương phản thấp, chữ nhỏ, dấu và ghi chú đè lên nội dung đều làm tăng lỗi. Nên dùng bản quét gốc rõ và tránh nén mạnh trước OCR vì có thể làm mất chi tiết cần thiết.
Kiểm tra cả nội dung và vị trí trong bảng
Lỗi bảng không chỉ là một ký tự đọc sai. Số tiền đúng nhưng vào nhầm cột, hoặc một bản ghi tách thành hai hàng, cũng có thể đổi ý nghĩa.
PDF sang Excel cho phép thử lấy bảng có lớp chữ. Tiêu đề phức tạp, ô gộp, bảng qua nhiều trang và khoảng cột không đều đều cần kiểm tra.
Xem cấu trúc trước. Đối chiếu tiêu đề với cột, bảo đảm mỗi hàng vẫn là một bản ghi, kiểm tra phần qua trang có thiếu hay lặp không.
Sau đó xem giá trị. Kiểm tra dấu thập phân, dấu âm, phần trăm, ngày, đơn vị và số 0 đầu mã. Xem các số có bị lưu thành văn bản không.
Một bảng trông ngay ngắn chưa chắc dùng được để tính toán hoặc nhập hệ thống khác.
Chọn mức kiểm tra theo mục đích
Nếu chỉ lấy vài đoạn, ưu tiên độ chính xác và thứ tự đọc; phân trang cũ có thể không cần.
Nếu sửa cả tài liệu, kiểm tra việc nối đoạn, cấp tiêu đề, đánh số danh sách và cấu trúc bảng trước khi thống nhất kiểu định dạng. Cách này dễ duy trì hơn chỉnh khoảng trắng từng dòng.
Để giao chính thức, cần xem thêm số trang, ảnh, chú thích và ngắt trang. Xuất một PDF mới rồi so với nguồn từng trang.
Số tiền, tài khoản, ngày, tên và mã sản phẩm phải đối chiếu bản gốc. Kiểm tra chính tả không đủ; định dạng hợp lý không chứng minh nội dung đúng.
Giữ file gốc và tạo bản sao chỉnh sửa được
Word hoặc Excel chuyển ra nên là bản làm việc, không phải thay thế trực tiếp cho PDF.
Giữ nguồn giúp duy trì căn cứ đối chiếu sau nhiều lần chuyển. Nếu còn lớp chữ dùng được, lấy trực tiếp từ gốc thay vì nén trang thành ảnh rồi quay lại OCR.
Trình tự rõ ràng là xác định loại file, chọn trích xuất hoặc nhận dạng, kiểm tra nội dung, sắp cấu trúc và hoàn thiện bố cục.
Chuyển đổi tiết kiệm thời gian gõ lại. Độ chính xác và khả năng sử dụng cấu trúc vẫn cần được kiểm chứng.
Công cụ DocCrunch được đề xuất
Các công cụ này chạy cục bộ trong trình duyệt khi có thể, nên không cần tải tệp lên máy chủ.