PDFをWordに変換しても、元の文書が戻るとは限らない
PDFの文字層、スキャンのOCR、レイアウト復元の違いを解説。適切な変換方法を選び、文章・表・数値・書式を確認する手順を紹介します。
PDFをWordに変換すると文字は編集できても、そのまま提出できるとは限りません。段落が分かれたり、表の列がずれたり、ヘッダーが本文に混ざったりして、内容の整理が必要になることがあります。
必ずしも変換の失敗ではありません。PDFは主にページの見た目を保持し、Wordは段落、表、スタイルなど編集可能な構造を必要とします。変換ツールは利用できる情報から構造を推測しますが、元の編集上の関係がPDFに完全に残っているとは限りません。
書き出し方法を選ぶ前に、ファイルの中身と、取り出したい内容を確認することが重要です。
まず文字層があるかを確認する
同じ見た目でも、PDFの内部は異なる場合があります。ソフトから出力した文書には通常文字オブジェクトがありますが、スキャンはページ画像だけかもしれません。OCRで認識した文字層が付いたスキャンもあります。
| ファイルの種類 | 一般的な内容 | 適した方法 |
|---|---|---|
| 電子的に生成したPDF | 文字、画像、配置情報 | 直接抽出を試す |
| 画像だけのスキャン | 抽出可能な文字がないページ画像 | OCRを使う |
| OCR済みのスキャン | ページ画像と認識文字層 | 抽出後に認識ミスを確認する |
最初の確認として、文章を選択してプレーンテキストのエディターに貼り付け、PDF内の単語を検索してみます。
読める文字をコピーできれば、少なくとも利用可能な文字情報があります。文字化け、順序の乱れ、ページ画像全体しか選べない場合は、さらに確認が必要です。このテストは方法を選ぶ助けになりますが、全文の正確さは保証しません。
文字を取り出しても構造が保たれるとは限らない
文字層があるファイルでは、DocCrunchのPDFからWordが既存の文字を抽出し、ページと位置に基づいて整理します。
連続して見える1行も、内部では独立した断片の場合があります。段落も改行、段組み、改ページによって分割保存されることがあります。変換ツールはどの部分をまとめるか判断しなければなりません。
よくある結果は次のとおりです。
- ひと続きの段落が複数の短い段落になる。
- 2段組みの読む順番が変わる。
- ヘッダー、フッター、ページ番号が本文に入る。
- 空白やインデントで元の位置を近似する。
文字を取り出して編集するだけなら対応できる場合があります。スタイル、画像位置、ページ割りまで戻すなら、レイアウトを整える時間が必要です。
OCRは文字認識であり、版面全体の復元ではない
画像だけのスキャンには、そのまま取り出せる文字がありません。先に画像中の文字を認識する必要があります。
現在のDocCrunchのPDFからWord/Excelは、画像だけのページに直接OCRを行いません。PDFから画像で必要なページを出力し、画像からWordや画像からExcelで認識します。
OCR文字層があるスキャンは直接抽出を試せます。ただし、文字層が正しいとは限りません。表示される原画像は正しくても、コピーされる文字に過去の誤認識が含まれることがあります。
傾き、反射、低いコントラスト、小さな文字、本文に重なる印影や手書きは誤りを増やします。鮮明な原本を使い、OCR前に強く圧縮して必要な細部を失わないようにします。
表は内容と位置の両方を確認する
表の誤りは、1文字の読み違いだけではありません。正しい金額でも列が違ったり、1件のデータが2行に分かれたりすると意味が変わります。
PDFからExcelでは、文字層のある表の抽出を試せます。複雑な見出し、結合セル、複数ページの表、不規則な列間隔は確認が必要です。
先に構造を確認します。 見出しと列の対応、1行が同じ1件の記録を示しているか、改ページ部分の欠落や重複を見ます。
次に値を確認します。 小数点、負号、百分率、日付、単位、識別番号の先頭のゼロを確認します。数値が文字列として保存されていないかも見ます。
見た目が整った表でも、計算や別システムへの取り込みに使えるとは限りません。
用途に合わせて確認範囲を決める
数段落を抜き出すだけなら、内容と読む順番が重要で、元のページ割りは不要かもしれません。
全文を編集する場合は、段落の結合、見出し階層、リスト番号、表を確認してからスタイルを統一します。行ごとに空白を調整するより維持しやすくなります。
正式な提出では、ページ番号、画像、注記、改ページも確認します。新しいPDFに出力し、原本とページごとに比較します。
金額、口座番号、日付、氏名、品番は原本との照合が必要です。スペルチェックだけでは足りず、自然な書式でも内容が正しい証明にはなりません。
原本を残して編集用コピーを作る
変換したWordやExcelは、PDFの直接の代替ではなく作業用コピーとして扱うほうが適切です。
原本を残せば、変換を繰り返しても照合の基準を失いません。使える文字層があるなら、先にページを圧縮画像にしてOCRへ戻るのではなく、原本から直接抽出します。
ファイルの種類を確認し、抽出か認識を選び、内容を照合し、構造を整理してからレイアウトを仕上げる、という順序が基本です。
PDF変換が節約するのは再入力の時間です。情報の正確さと構造の使いやすさは、引き続き確認が必要です。
おすすめの DocCrunch ツール
これらのツールは可能な限りブラウザ内でローカル実行され、ファイルをサーバーへアップロードする必要がありません。