Mengubah PDF ke Word Tidak Memulihkan Dokumen Aslinya
Pahami lapisan teks PDF, OCR pindai, dan pemulihan tata letak. Pilih jalur konversi lalu periksa teks, tabel, angka, serta format hasilnya.
Setelah PDF diubah ke Word, teks mungkin bisa diedit tetapi dokumen belum siap dikirim. Paragraf terpecah, kolom bergeser, dan header bercampur dengan isi. Konten yang tadinya rapi bisa perlu disusun ulang.
Ini belum tentu kegagalan konversi. PDF mempertahankan tampilan halaman, sedangkan Word membutuhkan struktur seperti paragraf, tabel, dan gaya. Konverter harus menyimpulkan struktur tersebut dari informasi yang tersedia. Hubungan penyuntingan aslinya tidak selalu tersimpan lengkap.
Sebelum memilih ekspor, tentukan isi file dan bagian yang ingin diperoleh.
Periksa lapisan teks terlebih dahulu
Dua PDF yang tampak sama bisa berbeda di dalam. Dokumen yang diekspor dari perangkat lunak biasanya memiliki objek teks. Pindaian bisa hanya berupa gambar halaman. Sebagian pindaian sudah memiliki lapisan teks hasil OCR.
| Jenis file | Isi umum | Cara yang sesuai |
|---|---|---|
| PDF yang dibuat secara digital | Teks, gambar, dan informasi posisi | Coba ekstraksi langsung |
| Pindaian hanya gambar | Halaman tanpa teks yang bisa diekstrak | Gunakan OCR |
| Pindaian dengan OCR | Gambar dan lapisan teks hasil pengenalan | Ekstrak lalu periksa kesalahan pengenalan |
Sebagai pemeriksaan awal, pilih satu bagian teks, tempel ke editor teks biasa, lalu cari sebuah kata di PDF.
Teks salinan yang terbaca menandakan setidaknya ada informasi yang dapat dipakai. Karakter rusak, urutan keliru, atau hanya gambar penuh yang dapat dipilih memerlukan pemeriksaan lebih lanjut. Tes ini membantu menentukan jalur, bukan menjamin seluruh teks.
Ekstraksi teks belum tentu mempertahankan struktur
Untuk file dengan lapisan teks, DocCrunch PDF ke Word mengambil teks yang ada dan menyusunnya berdasarkan halaman serta posisi.
Satu baris yang terlihat utuh bisa terdiri dari fragmen terpisah. Paragraf dapat tersimpan dalam potongan akibat pergantian baris, kolom, atau halaman. Konverter perlu menentukan bagian mana yang harus digabung.
Hasil yang umum antara lain:
- Satu paragraf menjadi beberapa paragraf pendek.
- Urutan baca berubah pada halaman dua kolom.
- Header, footer, atau nomor halaman masuk ke teks utama.
- Spasi dan indentasi dipakai untuk mendekati posisi asli.
Hal ini mungkin cukup jika hanya perlu mengambil teks untuk diedit. Memulihkan gaya, letak gambar, dan pembagian halaman membutuhkan pekerjaan tata letak.
OCR membaca pindaian, bukan memulihkan seluruh tata letak
Pindaian yang hanya berupa gambar tidak mempunyai teks siap ambil. Karakternya harus dikenali dahulu.
Konverter PDF ke Word dan Excel DocCrunch saat ini tidak menjalankan OCR langsung pada halaman gambar saja. Ekspor halaman lewat PDF ke gambar, lalu gunakan gambar ke Word atau gambar ke Excel.
Pindaian dengan lapisan OCR dapat dicoba melalui ekstraksi langsung. Lapisan itu bukan jaminan benar: tampilan halaman menunjukkan pindaian asli, sementara teks yang disalin mungkin mengandung kesalahan lama.
Kemiringan, pantulan, kontras rendah, huruf kecil, serta stempel atau tulisan tangan di atas teks meningkatkan kesalahan. Gunakan pindaian asli yang jelas dan hindari kompresi berat sebelum OCR karena detail dapat hilang.
Periksa isi dan posisi tabel
Kesalahan tabel bukan hanya karakter yang keliru. Angka benar di kolom salah atau satu catatan yang terpecah menjadi dua baris bisa mengubah makna.
PDF ke Excel dapat dipakai untuk mencoba mengekstrak tabel dengan lapisan teks. Header kompleks, sel gabungan, tabel lintas halaman, dan jarak kolom tidak teratur perlu diperiksa.
Periksa struktur dahulu. Pastikan header cocok dengan kolom, setiap baris tetap satu catatan, dan pergantian halaman tidak menimbulkan bagian hilang atau ganda.
Lalu periksa nilainya. Cek pemisah desimal, tanda minus, persentase, tanggal, satuan, dan nol di awal identitas. Pastikan juga apakah angka disimpan sebagai teks.
Tabel yang terlihat rapi belum tentu siap dihitung atau diimpor ke sistem lain.
Sesuaikan pemeriksaan dengan penggunaan
Untuk beberapa kutipan, utamakan isi yang akurat dan urutan baca. Pembagian halaman asli mungkin tidak diperlukan.
Untuk menyunting seluruh dokumen, periksa gabungan paragraf, tingkat judul, penomoran daftar, dan tabel sebelum menerapkan gaya yang konsisten. Cara ini lebih mudah dipelihara daripada membetulkan spasi per baris.
Untuk penyerahan resmi, periksa nomor halaman, gambar, catatan, dan pemisah halaman. Ekspor PDF baru dan bandingkan halaman demi halaman dengan sumber.
Nominal, rekening, tanggal, nama, dan kode produk harus dicocokkan dengan asli. Pemeriksa ejaan saja tidak cukup; format yang masuk akal tidak membuktikan isi benar.
Simpan asli dan buat salinan yang bisa diedit
Word atau Excel hasil konversi lebih tepat menjadi salinan kerja daripada pengganti langsung PDF.
Sumber asli menjadi acuan setelah beberapa kali konversi. Jika masih ada teks yang dapat digunakan, ambil langsung darinya, bukan mengubah halaman menjadi gambar terkompresi lalu kembali ke OCR.
Urutan yang jelas adalah mengenali jenis file, memilih ekstraksi atau pengenalan, memeriksa isi, menyusun struktur, dan menyelesaikan tata letak.
Konversi menghemat pengetikan ulang. Ketepatan informasi dan struktur yang berguna tetap perlu diperiksa.
Alat DocCrunch yang direkomendasikan
Alat ini berjalan secara lokal di browser bila memungkinkan, sehingga file tidak perlu diunggah ke server.