メインコンテンツへ移動
← ブログに戻る
5 分で読めますDocCrunch Team

PDFを圧縮したら、文字をコピーできなくなったのはなぜ?

PDFのラスタライズと文字層の関係を解説。圧縮後のコピー、検索、リンク、フォームを確認し、用途に合うファイルを選びます。

PDF圧縮PDF文字層PDF文字をコピーできないPDFラスタライズ

PDFを圧縮しても見た目はほとんど変わらないのに、文字を選択できず、見えている単語も検索で見つからないことがあります。閲覧ソフトの不具合とは限りません。圧縮時にページ全体が画像へ変換された可能性があります。

結果を評価するときは、容量と鮮明さに加えて、元の文書の機能が残っているかも確認する必要があります。

同じ見た目でも、内部の保存方法は違うことがある

PDFの一ページには、文字、画像、ベクター図形、リンクを一緒に含められます。画面にはそれらを組み合わせた結果が表示されます。

文字オブジェクトは通常、選択、コピー、検索に対応します。一方、画像内の文字は画素であり、文字に見えるだけでは直接抽出できません。

スキャン文書でも、表示される画像の下にOCRで作った文字層を持つ場合があります。そのため、写真のように見えるPDFでも検索やコピーができることがあります。

圧縮時に見た目だけを残し、各ページを画像として新しいPDFへ入れると、その文字層が失われる可能性があります。読むことはできても、内容の保存方法は変わっています。

PDF圧縮の方法は一つではない

方法によって変更される部分が異なります。

方法 主に変わるもの 注意点
ファイル構造の再整理 オブジェクトやデータの保存方法 容量削減が小さい場合もあり、機能確認は必要
ページ内の画像の圧縮 画像の解像度や符号化品質 画像の細部が減っても、文字には影響しない場合がある
ページ全体の画像化 ページ内容の保存方法 文字、ベクター、操作機能が残らない場合がある

三つ目は一般にラスタライズと呼ばれます。ページを描画し、その画像でPDFを作り直します。ファイルによっては大きく縮小できますが、影響は多少ぼやけることだけではありません。

DocCrunchのPDF圧縮は現在、構造を再保存した版と、ページ画像から再構築した版を作り、小さい方を選びます。どちらも元ファイルより小さくならなければ、元ファイルを返します。

採用される方法は内容によって決まるため、すべての結果にコピー可能な文字が残るとは限りません。

高画質の設定でも文字層は保証されない

鮮明さは見た目の性質であり、文字層はファイル構造の性質です。

高解像度のページ画像は鮮明でも、文字を直接選択できるとは限りません。反対に、文字オブジェクトを持つPDFなら、挿絵がぼやけていても本文をコピーできる場合があります。

DocCrunchの圧縮設定は、ページ再構築時の画像品質と描画倍率に影響します。現在、「文字層を必ず保持する」という独立した設定はありません。高画質の設定を選ぶだけでは、文字を選択できる保証にはなりません。

検索、引用、編集可能な文書への変換が必要なら、拡大して文字の輪郭を見るだけでなく、それぞれの機能を試してください。

変わるのはコピー機能だけではない

ページが画像になると、独立したオブジェクトに依存する機能も確認が必要です。

  • 検索:見えている単語が文書内検索で見つからないことがあります。
  • リンク:URLが表示されていても、クリック領域が残っているとは限りません。
  • フォーム:入力欄の見た目だけが残り、入力できなくなる場合があります。
  • 拡大表示:文字やベクター線の輪郭に画素が見える場合があります。
  • 後の変換:以前は抽出できた文字に、再びOCRが必要になることがあります。

閲覧ソフトによっては画像内の文字を自動認識し、選択やコピーを可能にします。それだけではPDF自体に文字層が残っている証拠にはなりません。別のソフトでは動作が異なる可能性があります。

Wordへの変換が必要なら、元のPDFを保存し、原本からPDFをWordに変換する方法を優先できます。DocCrunchの現在の機能は主に既存の文字を抽出するもので、スキャンページに直接OCRを行いません。

容量を減らす前に、残す必要があるものを決める

読むだけの文書であれば、ページ画像による再構築を受け入れられる場合があります。小さな文字、グラフ、細線が明瞭かを確認します。

検索、フォーム入力、後の変換も必要なら、それらを圧縮の条件に含めます。小さいファイルが必ずしも提出に適しているわけではありません。

最初から画質を落とす必要がない場合もあります。一部のページだけが必要なら、PDFページの削除を使ってから容量を確認できます。ページ数に比例して小さくなるとは限りませんが、残すページの不要な画像化を避けられることがあります。

元の文書があれば、大きすぎる挿絵をそこで調整してPDFを再出力する方法もあります。ページ全体を画像にせず、容量を使っている内容を対象にできます。

圧縮後は実際の用途で確認する

ダウンロード後、次の順序で確認します。

  1. ページ数、順序、内容に欠落がないか確認する。
  2. 小さな文字、細線、グラフ、淡い色の内容を拡大する。
  3. 本文の一部を選び、プレーンテキストのエディターへコピーする。
  4. 後半のページも含め、存在することが分かっている単語を検索する。
  5. 必要なリンクやフォームを試し、実際のファイル容量を確認する。

原本でも文字をコピーできなかった場合、圧縮だけで編集可能にはなりません。それには文字認識が必要です。

PDF圧縮後は小さくなったファイルだけでなく原本も残してください。送信に適したコピーが、その後の編集、検索、変換にも適しているとは限りません。提出用と原本を分けて保存すると、後の作業が進めやすくなります。

おすすめの DocCrunch ツール

これらのツールは可能な限りブラウザ内でローカル実行され、ファイルをサーバーへアップロードする必要がありません。