Chuyển đến nội dung chính
← Quay lại blog
5 phút đọcDocCrunch Team

Tôi đã bớt vội tải hợp đồng và bảng điểm lên các trang PDF miễn phí

Nén, gộp và sắp xếp PDF cục bộ với DocCrunch. Những điểm cần kiểm tra về lớp chữ, OCR bản quét và chuyển đổi Word, Excel, PPT.

công cụ PDF cục bộnén PDFgộp PDFbản quét sang Word

PDF thường đi kèm việc gấp: nộp bảng điểm, gộp vài báo giá, hoặc giảm tệp đính kèm xuống dưới 10 MB. Rồi người nhận lại muốn bản quét ở dạng Word.

Mở trang quen thuộc, chọn file rồi chờ rất dễ. Tải xong tôi mới tự hỏi bản hợp đồng có dấu vừa được gửi đi đâu, máy chủ còn giữ bản sao không. Tôi không nghĩ dịch vụ nào cũng dùng sai tài liệu. Chỉ là nếu trình duyệt làm được một chỉnh sửa nhỏ, tôi muốn tránh gửi cả hồ sơ đi.

Bắt đầu từ việc cần làm

Thường chỉ là nén, gộp file, bỏ trang hoặc đổi thứ tự. DocCrunch có từng công cụ riêng như nén PDF và gộp PDF, không cần tạo tài khoản.

Công cụ nén nhận tối đa 10 PDF, mỗi file dưới 500 MB, với ba mức chất lượng. Đây là giới hạn chọn file, không phải lời hứa máy tính bình thường sẽ xử lý nhẹ nhàng mười file sát ngưỡng. Nên thử một file trước.

File nhỏ hơn có thể không còn hoạt động như cũ

PDF chủ yếu là chữ có thể vốn đã nhẹ. Bản quét thường có thêm chỗ để giảm, nhưng không chắc sẽ xuống dưới giới hạn email.

Công cụ so sánh bản tối ưu cấu trúc với bản dựng lại từ ảnh từng trang, chọn bản nhỏ hơn. Nếu cả hai không nhỏ hơn, nó giữ file gốc. Nếu chọn bản dựng bằng ảnh, chữ có thể không còn chọn hay tìm kiếm được. Liên kết và biểu mẫu cũng không nên mặc nhiên coi là còn nguyên.

Tôi xem chữ nhỏ và con dấu, thử chọn chữ, mở các liên kết cần dùng. Nếu mức nén mạnh làm trang mờ đi, tôi lùi một mức. Bản gốc vẫn được giữ, nhất là tài liệu có chữ ký số hoặc dùng để in.

Đúng trang, đúng thứ tự

Gộp PDF theo thứ tự danh sách file, có thể chỉnh bằng nút lên xuống. Tách PDF tạo một PDF cho mỗi trang rồi gom vào ZIP. Muốn bỏ vài trang thì xóa trang PDF thường tiện hơn. Xoay PDF sửa trang nằm ngang, còn sắp xếp trang đưa bìa về đúng chỗ.

Xóa cả trang khác với che một số tài khoản trong trang. Cắt phần nhìn thấy hoặc phủ một hình chữ nhật không chứng minh dữ liệu bên dưới đã bị xóa.

Có file Word chưa có nghĩa là xong

PDF sang Word và PDF sang Excel lấy lớp chữ có sẵn rồi sắp xếp theo trang và vị trí. Chúng không phục dựng nguyên vẹn bố cục. Nhiều cột và bảng phức tạp có thể cần sửa lại.

Các công cụ chuyển PDF này hiện không chạy OCR trực tiếp trên bản quét chỉ có ảnh. Hãy xuất trang cần dùng bằng PDF sang ảnh, rồi dùng ảnh sang Word hoặc ảnh sang Excel để nhận dạng. Bản quét đã có lớp chữ OCR có thể thử trích xuất trực tiếp.

Ánh sáng phản chiếu, giấy nghiêng và dấu đè lên chữ làm nhận dạng khó hơn. Số tiền, tài khoản, tên và ngày tháng phải đối chiếu bản gốc. PDF sang PPT đặt ảnh mỗi trang lên một slide; tiêu đề và biểu đồ không trở thành các đối tượng sửa riêng được.

Xử lý cục bộ cũng có giới hạn

Những thao tác này không gửi file gốc hay kết quả lên máy chủ xử lý. Trang web, mã lệnh và tài nguyên OCR vẫn có thể cần tải về. File lớn dùng nhiều bộ nhớ; một số PDF mã hóa có thể không mở được. Chữ ký, biểu mẫu tương tác và màu in chính xác cần công cụ có khả năng kiểm tra chúng. Máy dùng chung và tiện ích trình duyệt là chuyện khác nữa.

Tôi giữ bản gốc và lấy chữ trước khi nén nếu cần. Ảnh chụp biên lai có thể qua ảnh sang PDF rồi gộp cùng sao kê. Bài trước về ảnh điện thoại nói cách giảm dung lượng ảnh, nhưng các con số nhỏ vẫn phải đọc được.

Nếu chỉ vướng dung lượng đính kèm, thử nén một PDF. Mở bản tải về và kiểm tra trước khi gửi.

Công cụ DocCrunch được đề xuất

Các công cụ này chạy cục bộ trong trình duyệt khi có thể, nên không cần tải tệp lên máy chủ.