본문으로 건너뛰기
← 블로그로 돌아가기
5분 읽기DocCrunch Team

PDF를 압축한 뒤 텍스트를 복사할 수 없게 된 이유는 무엇일까요?

PDF 래스터화와 텍스트 레이어의 관계를 살펴보고 압축 후 복사, 검색, 링크, 양식 기능이 남아 있는지 확인하세요.

PDF 압축PDF 텍스트 레이어PDF 텍스트 복사 불가PDF 래스터화

PDF를 압축해도 페이지는 거의 그대로 보이는데 텍스트를 선택할 수 없고, 눈에 보이는 단어도 검색되지 않을 수 있습니다. 뷰어 문제만은 아닙니다. 압축 과정에서 페이지 전체가 이미지로 바뀌었을 가능성이 있습니다.

결과를 판단하려면 파일 크기와 선명도뿐 아니라 문서의 기존 기능이 유지되는지도 확인해야 합니다.

겉모습이 같아도 저장 방식은 달라질 수 있습니다

PDF 한 페이지에는 텍스트, 이미지, 벡터 그래픽, 링크가 함께 들어갈 수 있습니다. 화면에는 이 요소들이 조합된 결과가 표시됩니다.

텍스트 객체는 보통 선택, 복사, 검색을 지원합니다. 이미지 속 글자는 픽셀이므로 글자처럼 보인다는 이유만으로 바로 추출할 수는 없습니다.

스캔 문서도 보이는 이미지 아래에 OCR로 만든 텍스트 레이어를 가질 수 있습니다. 그래서 사진처럼 보이는 PDF에서도 검색과 복사가 가능할 수 있습니다.

압축할 때 시각적 결과만 남기고 각 페이지를 이미지로 새 PDF에 넣으면 기존 텍스트 레이어가 사라질 수 있습니다. 문서는 읽을 수 있지만 내용의 저장 방식은 바뀐 것입니다.

PDF 압축에는 여러 방식이 있습니다

방식마다 달라지는 요소가 다릅니다.

방식 주요 변경 사항 확인할 점
파일 구조 재정리 객체와 데이터의 저장 방식 용량 감소가 적을 수 있으며 기능 확인도 필요
페이지 내부 이미지 압축 이미지 해상도 또는 인코딩 품질 이미지 세부 정보가 줄어도 텍스트는 영향을 받지 않을 수 있음
페이지 전체를 이미지로 변환 페이지 내용의 저장 방식 텍스트, 벡터, 상호작용 기능이 유지되지 않을 수 있음

세 번째는 일반적으로 래스터화라고 합니다. 페이지를 렌더링한 뒤 이미지로 PDF를 다시 만듭니다. 일부 파일은 크게 작아지지만 영향은 약간 흐려지는 것에 그치지 않습니다.

DocCrunch PDF 압축은 현재 구조를 다시 저장한 버전과 페이지 이미지로 재구성한 버전을 만들어 더 작은 쪽을 선택합니다. 둘 다 원본보다 작지 않으면 원본 파일을 반환합니다.

선택되는 방식은 내용에 따라 달라집니다. 모든 압축 결과에 복사 가능한 텍스트가 남는다고 가정할 수 없습니다.

선명한 품질 설정이 텍스트 레이어를 보장하지는 않습니다

선명도는 외관에 관한 속성이고 텍스트 레이어는 파일 구조에 관한 속성입니다.

고해상도 페이지 이미지는 매우 선명해도 텍스트를 직접 선택할 수 없을 수 있습니다. 반대로 텍스트 객체가 있는 PDF는 삽화가 흐려도 본문을 정상적으로 복사할 수 있습니다.

DocCrunch의 압축 단계는 페이지 재구성 시 이미지 품질과 렌더링 배율에 영향을 줍니다. 현재 텍스트 레이어를 항상 유지하는 별도 옵션은 없습니다. 따라서 가장 선명한 설정도 텍스트 선택을 보장하지 않습니다.

검색, 인용, 편집 가능한 문서로의 변환이 필요하다면 글자 테두리를 확대해 보는 데 그치지 말고 해당 기능을 직접 시험하세요.

복사 이외의 기능도 달라질 수 있습니다

페이지가 이미지로 바뀌면 독립된 객체에 의존하던 기능을 확인해야 합니다.

  • 검색: 보이는 단어가 문서 검색에서 발견되지 않을 수 있습니다.
  • 링크: 주소는 남아도 클릭 영역은 사라질 수 있습니다.
  • 양식: 입력란의 모양만 남고 입력이 불가능할 수 있습니다.
  • 확대: 텍스트와 벡터 선의 가장자리가 픽셀 형태로 보일 수 있습니다.
  • 후속 변환: 이전에는 추출 가능했던 텍스트에 OCR이 다시 필요할 수 있습니다.

일부 뷰어는 이미지의 글자를 자동 인식해 선택이나 복사를 지원합니다. 이것만으로 PDF 자체에 텍스트 레이어가 남아 있다고 판단할 수는 없습니다. 다른 뷰어에서는 다르게 동작할 수 있습니다.

Word 변환이 필요하면 원본 PDF를 보관하고 원본에 PDF Word 변환을 사용하는 편이 좋습니다. DocCrunch의 현재 도구는 주로 기존 텍스트를 추출하며 스캔 페이지에 직접 OCR을 수행하지 않습니다.

용량을 줄이기 전에 무엇을 유지해야 할지 정하세요

읽기만 하는 문서라면 페이지를 이미지로 재구성해도 괜찮을 수 있습니다. 작은 글자, 차트, 가는 선이 명확한지 확인하세요.

검색, 양식 입력, 추가 변환도 필요하면 이를 압축 조건에 포함해야 합니다. 더 작은 파일이 반드시 전달에 더 적합한 것은 아닙니다.

처음부터 화질을 낮출 필요가 없는 경우도 있습니다. 일부 페이지만 필요하면 PDF 페이지 삭제 후 용량을 확인할 수 있습니다. 페이지 수에 비례해 줄지는 않아도 남길 페이지를 불필요하게 이미지로 재구성하는 일을 피할 수 있습니다.

원본 문서가 있다면 너무 큰 삽화를 조정한 뒤 PDF로 다시 내보내는 방법도 있습니다. 페이지 전체를 이미지로 만들지 않고 실제로 용량을 차지하는 내용을 다룰 수 있습니다.

압축 후 실제 용도에 맞게 확인하세요

다운로드한 뒤 다음을 확인하세요.

  1. 페이지 수, 순서, 내용이 온전한지 확인합니다.
  2. 작은 글자, 가는 선, 차트, 옅은 색 내용을 확대합니다.
  3. 본문 일부를 선택해 일반 텍스트 편집기에 붙여 넣습니다.
  4. 뒤쪽 페이지를 포함해 존재하는 단어 몇 개를 검색합니다.
  5. 필요한 링크와 양식을 시험하고 실제 파일 크기를 확인합니다.

원본에서도 복사할 수 없던 텍스트가 압축만으로 편집 가능해지지는 않습니다. 이는 문자 인식이 필요한 작업입니다.

PDF 압축 후에는 줄어든 파일뿐 아니라 원본도 보관하세요. 전송용 사본이 후속 편집, 검색, 변환에도 적합한 것은 아닙니다. 전달용 버전과 원본을 구분해 두면 이후 작업이 편해집니다.

추천 DocCrunch 도구

이 도구들은 가능한 경우 브라우저에서 로컬로 실행되며 파일을 서버에 업로드할 필요가 없습니다.