- 텍스트를 추출할 PDF를 끌어다 놓거나 클릭해 선택합니다.
- 페이지를 순서대로 읽으며 텍스트를 모으는 동안 진행률이 표시됩니다.
- 추출이 끝나면 텍스트를 확인·수정한 뒤 텍스트 복사로 가져갑니다.
PDF에서 글자가 뽑히느냐 마느냐는 그 PDF가 어떻게 만들어졌는지에 달려 있습니다. 같은 글처럼 보여도 안에 든 데이터는 전혀 다릅니다.
- 디지털 PDF: 워드·한글·웹 페이지를 'PDF로 저장'해 만든 파일은 글자 정보(텍스트 레이어)가 들어 있어 그대로 추출·복사됩니다.
- 스캔본·사진 PDF: 종이를 스캔하거나 사진을 PDF로 묶은 파일은 글자가 '그림'이라 추출할 텍스트가 없습니다. 이때는 OCR로 글자를 인식해야 합니다.
- 구분하는 법: PDF 뷰어에서 글자를 마우스로 드래그해 선택되면 디지털, 통째로 그림처럼 잡히면 스캔본입니다.
스캔본에서 글자를 꺼내는 방법은 사진 글자 추출(OCR) 가이드에 정리해 두었습니다.
- 디지털 PDF에 강합니다: 워드·한글·웹에서 '저장'으로 만든 PDF는 글자 정보가 들어 있어 깔끔하게 추출됩니다. 반면 스캔본은 글자가 이미지라 추출되지 않습니다.
- 붙여넣기 전 정리: 추출한 텍스트에는 줄바꿈이 원본과 다르게 들어갈 수 있습니다. 도구상자의 '공백·줄바꿈 정리'로 다듬으면 깔끔해집니다.
- 표·다단은 검토: 표나 2단 편집된 문서는 순서가 섞일 수 있으니, 해당 부분만 원본과 비교해 손봐 주세요.
스캔본이나 사진으로 만든 PDF는 글자가 '이미지'로 들어 있어 추출할 텍스트 레이어가 없습니다. 이 경우에는 글자를 인식하는 OCR이 필요합니다. 도구상자의 '이미지 OCR' 도구로 해당 페이지를 이미지로 만들어 글자를 인식하는 방법을 사용하세요.
그럴 수 있습니다. PDF는 글자의 위치 정보로 이루어져 있어, 표·다단 편집·복잡한 레이아웃에서는 추출된 텍스트의 순서가 화면 보기와 다르게 섞일 수 있습니다. 추출 후 문단·표 부분은 한 번 훑어보고 다듬는 것이 좋습니다.
아니요. PDF를 여는 것부터 텍스트를 뽑아내는 과정까지 모두 사용자의 브라우저 안에서 이뤄집니다. 파일은 서버로 전송되거나 저장되지 않으므로 계약서·보고서 같은 민감한 문서도 안전하게 처리할 수 있습니다.
이 도구는 PDF의 모든 페이지를 처음부터 끝까지 순서대로 읽어 한 번에 텍스트로 뽑아냅니다. 결과는 페이지 구분선과 함께 표시되므로, 필요한 부분만 쓰려면 추출이 끝난 뒤 해당 쪽 구간을 골라 복사하면 됩니다.
PDF는 글자가 화면 위 좌표에 흩어져 있는 형태라, 어디까지가 한 문장이고 어디서 줄을 바꿔야 하는지가 명확하지 않습니다. 그래서 줄바꿈이 원본 보기와 다르게 들어갈 수 있습니다. 추출 후 공백·줄바꿈 정리 도구로 한 번 다듬으면 문단이 깔끔해집니다.