PDF 压缩后,为什么文字不能复制了?
了解 PDF 压缩、页面栅格化与文字层的关系,检查压缩后的复制、搜索、链接和表单功能,选择适合交付与后续编辑的版本。
PDF 压缩后,页面看起来没有明显变化,文字却选不中,搜索也找不到原本存在的词。这不一定是阅读器出了问题,也可能是压缩过程中,整页内容被转换成了图片。
判断压缩结果是否合适,除了文件大小和清晰度,还需要检查文档原本具备的功能是否保留下来。
页面看起来一样,内部可能已经不同
PDF 的一页可以同时包含文字、图片、矢量图形和链接。屏幕上看到的完整页面,是这些内容组合后的结果。
其中,文字对象通常支持选择、复制和搜索;图片里的文字只有像素外观,不能仅凭“看起来像字”就直接提取。
扫描件还有一种情况:页面显示的是扫描图,下面另有 OCR 生成的文字层。因此,一份看起来像照片的 PDF,也可能支持搜索和复制。
如果压缩时只保留页面的视觉结果,再把它保存为图片放进新 PDF,原来的文字层就可能消失。页面仍然能阅读,但已经不再以原来的方式存储内容。
PDF 压缩不只有一种做法
不同压缩方式,改变的内容并不相同。
| 处理方式 | 主要改变 | 需要注意 |
|---|---|---|
| 重新组织文件结构 | 对象和数据的保存方式 | 缩小幅度可能有限,仍需检查功能 |
| 压缩页面中的图片 | 图片分辨率或编码质量 | 图片细节可能减少,文字未必受到影响 |
| 将整页转换成图片 | 页面内容的存储方式 | 文字、矢量图形和交互功能可能不再保留 |
第三种方式通常称为页面栅格化。它先把页面渲染出来,再用图片重建 PDF。对于某些文件,这能明显减小体积,但代价不只是画面稍微变模糊。
DocCrunch PDF 压缩目前会生成结构重存和页面图片重建两种结果,选择体积较小的版本;如果两者都没有比原文件更小,则返回原文件。
这意味着,最终采用哪种方式与文件内容有关,不能默认所有压缩结果都会保留可复制的文字。
“清晰”档不等于保留文字层
清晰度描述的是页面呈现效果,文字层描述的是文件结构,两者不是同一件事。
一张高分辨率的页面图片可以非常清楚,却仍然无法直接选择文字。反过来,带有文字对象的 PDF 即使插图较模糊,正文也可能正常复制。
DocCrunch 的压缩档位会影响页面重建时的图片质量和渲染比例,但当前并没有一个独立的“始终保留文字层”选项。因此,即使选择清晰档,也不能据此判断文字一定可选。
如果文件需要继续搜索、引用或转换成可编辑文档,应实际测试这些功能,而不是只放大查看字边。
变化可能不止发生在复制功能上
整页变成图片后,原来依赖独立对象的功能也需要重新检查。
- 搜索:可见的文字未必还能被文档搜索找到。
- 链接:网址可能仍然显示,但原来的可点击区域未必保留。
- 表单:输入框可能只剩外观,不能继续填写。
- 放大查看:原来的文字和矢量线条可能开始出现像素边缘。
- 后续转换:原本可以提取的文字,可能需要重新进行 OCR。
有些阅读器会自动识别图片中的文字,让用户仍然能够选择或复制。这并不能证明 PDF 文件本身保留了文字层;换一个阅读器,表现可能不同。
对于还需要转成 Word 的文件,可以优先保留原始 PDF,并从原件使用 PDF 转 Word。DocCrunch 当前的这项工具主要提取已有文字,不会直接对扫描页面进行 OCR。
文件太大时,先判断哪些内容必须保留
如果文档只需要供人阅读,页面图片重建可能是可以接受的。关键是确认小字、图表和细线仍然清楚。
如果文档还需要搜索、填写或继续转换,则应把这些功能作为压缩条件。不能仅因为新文件更小,就认定它更适合交付。
有时也不必先降低画质。只交付部分页面时,可以使用删除 PDF 页面去掉不需要的部分,再检查体积。减少页面不一定能按比例缩小文件,但可以避免对保留内容进行不必要的图片重建。
如果有原始文档,另一个选择是在源文件中调整过大的插图,再重新导出 PDF。这样可以针对真正占用空间的内容处理,而不必把整页一起变成图片。
压缩后,检查一次实际用途
下载结果后,可以按以下顺序核对:
- 确认页数、顺序和页面内容完整。
- 放大查看小字、细线、图表和浅色内容。
- 选择一段正文,复制到纯文本编辑器中检查。
- 搜索几个确定存在的词,包括后面页面的内容。
- 测试需要使用的链接和表单,并确认实际文件大小。
如果原件本来就不能复制文字,压缩也不会自动让它变得可编辑;那属于文字识别的任务。
PDF 压缩完成后,值得保留的不只是更小的文件,也包括原件。一个适合发送的副本,未必适合继续编辑、检索或转换。把交付版本和原始版本分开保存,后续处理会更从容。
推荐 DocCrunch 工具
以下工具均可在浏览器本地处理,无需上传服务器。