Mengapa teks tidak bisa disalin lagi setelah PDF dikompresi?
Pahami rasterisasi dan lapisan teks PDF, lalu periksa penyalinan, pencarian, tautan, serta formulir sebelum memakai hasil kompresi.
Setelah dikompresi, halaman PDF bisa terlihat hampir sama, tetapi teks tidak lagi dapat dipilih dan pencarian gagal menemukan kata yang terlihat. Penyebabnya belum tentu aplikasi pembaca: kompresi mungkin telah mengubah seluruh halaman menjadi gambar.
Ukuran file dan ketajaman saja tidak cukup untuk menilai hasil. Periksa juga apakah fungsi asli dokumen masih tersedia.
Tampilan yang sama bisa memiliki penyimpanan berbeda
Satu halaman PDF dapat berisi teks, gambar, grafik vektor, dan tautan. Tampilan di layar merupakan gabungan semuanya.
Objek teks umumnya mendukung pemilihan, penyalinan, dan pencarian. Huruf dalam gambar hanyalah piksel; tampak seperti teks tidak berarti bisa langsung diekstrak.
Dokumen hasil pemindaian juga bisa memiliki lapisan teks dari OCR di balik gambar yang terlihat. Karena itu, PDF yang tampak seperti foto tetap mungkin mendukung pencarian dan penyalinan.
Jika kompresi hanya menyimpan tampilan halaman lalu memasukkan gambarnya ke PDF baru, lapisan teks tersebut dapat hilang. Dokumen masih terbaca, tetapi cara penyimpanan isinya berubah.
Ada beberapa cara mengompresi PDF
Setiap metode mengubah bagian yang berbeda.
| Metode | Perubahan utama | Hal yang perlu diperhatikan |
|---|---|---|
| Menata ulang struktur file | Penyimpanan objek dan data | Pengurangan mungkin terbatas; fungsi tetap perlu diperiksa |
| Mengompresi gambar di dalam halaman | Resolusi atau kualitas pengodean gambar | Detail gambar dapat berkurang tanpa harus memengaruhi teks |
| Mengubah seluruh halaman menjadi gambar | Penyimpanan isi halaman | Objek teks, vektor, dan fungsi interaktif mungkin tidak dipertahankan |
Metode ketiga biasanya disebut rasterisasi halaman. Halaman dirender, lalu PDF dibangun kembali menggunakan gambar. Untuk sebagian file, penghematannya besar, tetapi dampaknya lebih dari sekadar tampilan yang sedikit kabur.
DocCrunch Kompres PDF saat ini membuat versi yang disimpan ulang secara struktural dan versi yang dibangun dari gambar halaman, lalu memilih yang lebih kecil. Jika keduanya tidak lebih kecil dari sumber, file asli dikembalikan.
Metode yang terpilih bergantung pada isi dokumen. Jangan menganggap semua hasil mempertahankan teks yang dapat disalin.
Pengaturan paling jernih tidak menjamin lapisan teks
Ketajaman menjelaskan tampilan, sedangkan lapisan teks menjelaskan struktur file.
Gambar halaman beresolusi tinggi dapat terlihat tajam tanpa menyediakan teks yang bisa langsung dipilih. Sebaliknya, PDF dengan objek teks dapat mendukung penyalinan meski ilustrasinya buram.
Preset DocCrunch memengaruhi kualitas gambar dan skala render saat membangun ulang halaman. Saat ini tidak ada pilihan terpisah yang selalu menjamin lapisan teks dipertahankan. Memilih preset paling jernih tidak menjamin teks dapat dipilih.
Jika dokumen perlu dicari, dikutip, atau dikonversi menjadi file yang bisa diedit, uji fungsi tersebut, bukan hanya tepi huruf saat diperbesar.
Bukan hanya penyalinan yang bisa berubah
Setelah halaman menjadi gambar, periksa fitur yang bergantung pada objek terpisah.
- Pencarian: kata yang terlihat mungkin tidak lagi ditemukan.
- Tautan: alamat tetap terlihat, tetapi area yang dapat diklik mungkin hilang.
- Formulir: kolom tampak sama, tetapi mungkin tidak menerima isian.
- Pembesaran: teks dan garis vektor bisa mulai terlihat berpiksel.
- Konversi berikutnya: teks yang semula bisa diekstrak mungkin perlu OCR lagi.
Sebagian pembaca otomatis mengenali teks dalam gambar sehingga masih mengizinkan pemilihan atau penyalinan. Ini tidak membuktikan PDF itu sendiri mempertahankan lapisan teks; aplikasi lain bisa berperilaku berbeda.
Jika konversi Word masih diperlukan, simpan PDF asli dan gunakan PDF ke Word pada file tersebut. Alat DocCrunch saat ini terutama mengekstrak teks yang sudah ada dan tidak langsung menjalankan OCR pada halaman hasil pemindaian.
Tentukan apa yang harus dipertahankan sebelum mengecilkan file
Untuk dokumen yang hanya akan dibaca, membangun ulang halaman sebagai gambar mungkin dapat diterima. Pastikan teks kecil, bagan, dan garis tipis tetap jelas.
Jika pencarian, pengisian formulir, atau konversi lanjutan diperlukan, jadikan itu persyaratan kompresi. File lebih kecil belum tentu lebih cocok dikirim.
Menurunkan kualitas bukan selalu langkah pertama. Jika hanya beberapa halaman dibutuhkan, gunakan Hapus Halaman PDF, lalu periksa ukurannya. Pengurangan tidak selalu sebanding dengan jumlah halaman, tetapi dapat menghindari pembangunan ulang halaman yang dipertahankan secara tidak perlu.
Jika dokumen sumber tersedia, pilihan lain adalah mengecilkan ilustrasi yang terlalu besar di sana dan mengekspor PDF baru. Cara ini menargetkan isi yang memakan ruang tanpa mengubah seluruh halaman menjadi gambar.
Uji hasil sesuai penggunaan sebenarnya
Setelah mengunduh:
- Pastikan jumlah, urutan, dan isi halaman lengkap.
- Perbesar teks kecil, garis tipis, bagan, dan unsur berwarna pucat.
- Salin satu bagian teks ke editor teks biasa.
- Cari beberapa kata yang diketahui ada, termasuk pada halaman belakang.
- Uji tautan dan formulir yang diperlukan, lalu pastikan ukuran file sebenarnya.
Jika teks asli memang tidak dapat disalin, kompresi tidak otomatis membuatnya bisa diedit. Itu membutuhkan pengenalan teks.
Setelah kompresi PDF, simpan file asli bersama hasil yang lebih kecil. Salinan untuk pengiriman belum tentu cocok untuk pengeditan, pencarian, atau konversi lanjutan. Memisahkan versi kiriman dan sumber memudahkan pekerjaan berikutnya.
Alat DocCrunch yang direkomendasikan
Alat ini berjalan secara lokal di browser bila memungkinkan, sehingga file tidak perlu diunggah ke server.