PDF 글자 복사·추출하는 법: 줄바꿈 깨짐까지 깔끔하게 정리
PDF에서 글을 복사하면 줄이 왜 끊기는지, 텍스트 추출 방법 비교, 스캔 PDF가 안 되는 이유, 쪽 구분·TXT 저장과 줄바꿈 정리 순서까지 한 번에 설명합니다.
보고서나 논문, 계약서 PDF에서 문장 몇 줄을 옮기려고 복사했는데, 붙여 넣으면 문장 중간마다 줄이 끊겨 있는 경우가 많습니다. 한두 줄이면 손으로 고치면 되지만 여러 쪽이면 시간이 꽤 걸립니다.
이 글에서는 PDF에서 복사한 글의 줄바꿈이 깨지는 이유를 먼저 알아봅니다. 이어서 텍스트를 뽑는 방법을 비교하고, 파일을 올리지 않고 브라우저 안에서 글자를 추출한 뒤 문단을 정리하는 순서를 단계별로 정리합니다.
PDF에서 복사하면 줄바꿈이 깨지는 이유
PDF는 원래 “어느 위치에 어떤 글자를 찍을지”를 기록하는 문서 형식입니다. 워드 문서처럼 “이 문장은 한 문단”이라는 정보를 가진 것이 아니라, 화면에 보이는 한 줄 한 줄을 각각 정해진 자리에 놓아 둔 것에 가깝습니다.
그래서 글을 복사하면 프로그램이 글자 위치를 보고 줄을 다시 짜 맞춥니다. 이때 화면에서 줄이 넘어간 자리마다 줄바꿈(엔터)이 들어가 문장이 토막 납니다. 자주 생기는 증상은 다음과 같습니다.
- 문장 중간마다 줄이 끊긴다
- 단어 사이 띄어쓰기가 두세 칸으로 늘어나거나 사라진다
- 두 단(칼럼)으로 나뉜 글이나 표는 읽는 순서가 뒤섞인다
- 쪽 번호나 머리글이 본문 사이에 끼어든다
즉, 줄바꿈이 깨지는 것은 복사 프로그램의 문제라기보다 PDF라는 형식의 특성입니다. 그래서 글자를 뽑은 다음 따로 정리하는 단계가 필요합니다.
스캔한 PDF는 글자를 뽑을 수 없습니다
먼저 확인해야 할 것이 있습니다. 종이를 스캐너나 휴대폰으로 찍어 만든 PDF는 겉보기에 글자가 있어도 실제로는 글자 모양의 사진입니다. 글자 정보가 없으니 복사도 추출도 되지 않습니다.
이런 파일에서 글자를 얻으려면 이미지 속 글자를 읽어 내는 문자 인식(OCR, 그림 속 글자를 텍스트로 바꾸는 기술)이 필요합니다. Deftivo의 PDF 텍스트 추출 도구는 OCR을 하지 않습니다. 스캔한 쪽은 결과가 비어 나오고, 도구가 “글자가 없는 쪽”이라고 쪽 번호와 함께 알려 줍니다.
간단히 구분하는 방법은 PDF를 열고 글자 하나를 마우스로 끌어 선택해 보는 것입니다. 글자 단위로 파랗게 선택되면 글자 정보가 있는 PDF이고, 쪽 전체가 그림처럼 한꺼번에 잡히거나 아예 선택되지 않으면 스캔본일 가능성이 높습니다.
PDF 텍스트 추출 방법 비교
| 방법 | 특징 | 줄바꿈 정리 | 파일 업로드 |
|---|---|---|---|
| PDF 뷰어에서 직접 복사 | 짧은 글에 가장 빠름 | 직접 고쳐야 함 | 없음 |
| PDF 편집 프로그램의 내보내기 | 설치형 프로그램이 필요할 수 있음 | 프로그램마다 다름 | 대체로 없음 |
| 온라인 변환 사이트 | 설치 없이 사용 | 사이트마다 다름 | 서버에 올리는 방식이 많음 |
| Deftivo PDF 텍스트 추출 | 브라우저에서 처리, 쪽 선택·쪽 구분선·TXT 저장 | 줄바꿈 정리 도구와 이어서 사용 | 없음 |
몇 줄만 필요하다면 뷰어에서 바로 복사해도 충분합니다. 여러 쪽을 한꺼번에 옮기거나 계약서·개인정보가 담긴 파일처럼 외부 서버에 올리기 꺼려지는 문서라면 브라우저 안에서 처리하는 방식이 편합니다.
Deftivo로 PDF 글자 추출하기
PDF 텍스트 추출 도구는 파일을 서버로 보내지 않고 내 기기의 브라우저에서 글자를 읽어 냅니다. 순서는 다음과 같습니다.
- PDF 파일을 넣는 칸에 파일을 넣습니다. 한 번에 여러 개를 넣을 수 있고, 목록에 파일별 쪽수와 크기가 표시됩니다.
- 필요한 쪽만 뽑으려면 쪽 선택 칸에
1-3, 5처럼 적습니다. 비워 두면 전체 쪽을 추출합니다. - 「— N쪽 —」 구분선 넣기를 켜 두면 쪽마다 구분선이 붙어 어느 쪽 글인지 알 수 있습니다. 기본으로 켜져 있습니다.
- 텍스트 추출 버튼을 누릅니다. 진행 막대가 끝나면 아래 칸에 추출한 글과 글자 수가 나타납니다.
- 텍스트 복사로 바로 붙여 넣거나, .txt로 내려받기로 파일을 저장합니다. 파일을 여러 개 넣었다면 TXT 파일들을 묶은 ZIP으로 받습니다.
저장되는 TXT는 윈도우 메모장에서도 한글이 깨지지 않도록 만들어집니다. 암호가 걸린 PDF는 열리지 않으니 암호를 먼저 해제한 뒤 넣어야 합니다.
줄바꿈 없애기 도구로 문단 정리하기
추출한 글에 아직 문장 중간 줄바꿈이 남아 있다면 줄바꿈·공백 정리 도구로 넘어갑니다.
- 추출한 글을 복사해 왼쪽 원문 칸에 붙여 넣습니다.
- 붙여 넣는 즉시 오른쪽 정리된 글 칸에 결과가 나타납니다.
- 기본으로 줄바꿈 없애기(한 줄로 잇기), 문단(빈 줄)은 남기기, 여러 칸 공백을 한 칸으로, 줄 앞뒤 공백 지우기가 켜져 있어, 끊긴 줄은 이어지고 빈 줄로 나뉜 문단은 그대로 남습니다.
- 필요하면 빈 줄 지우기나 같은 줄 중복 지우기를 켭니다. 반복되는 머리글을 줄일 때 쓸모가 있습니다.
- 결과 복사를 눌러 문서나 메일에 붙여 넣습니다.
영어 단어가 줄 끝에서 하이픈(-)으로 나뉜 경우에는 하이픈을 지우고 단어를 붙여 줍니다.
주의점과 팁
- 문단으로 정리할 글이라면 쪽 구분선을 끄고 추출하세요. 구분선 줄이 바로 다음 문장과 한 줄로 이어질 수 있습니다.
- 추출 도구는 줄 간격이 크게 벌어진 곳을 빈 줄(문단)로 넣어 줍니다. 이 빈 줄 덕분에 줄바꿈 정리 도구의 “문단은 남기기”가 제대로 작동합니다.
- 두 단으로 나뉜 글이나 표는 순서가 바뀌어 나올 수 있으니 결과를 한 번 훑어보는 것이 좋습니다.
- 목록이나 시처럼 줄바꿈 자체가 의미 있는 글은 “줄바꿈 없애기”를 끄고 공백 정리만 하세요.
자주 묻는 질문
PDF에서 복사한 글의 줄바꿈을 한 번에 없앨 수 있나요?
네. 복사한 글을 줄바꿈·공백 정리 도구에 붙여 넣으면 끊긴 줄이 바로 이어집니다. “문단은 남기기”를 켜 두면 빈 줄로 나뉜 문단 구분은 유지됩니다.
스캔한 PDF도 글자를 추출할 수 있나요?
Deftivo로는 할 수 없습니다. 스캔본은 글자가 아니라 사진이고, Deftivo는 문자 인식(OCR)을 하지 않기 때문입니다. 스캔한 쪽은 비어 나오며 도구가 해당 쪽 번호를 알려 줍니다.
파일이 서버에 올라가지 않나요?
올라가지 않습니다. PDF를 읽고 글자를 뽑는 과정이 모두 내 기기의 브라우저 안에서 이루어집니다. 그래서 개인정보가 담긴 문서도 부담 없이 쓸 수 있습니다.
여러 PDF를 한꺼번에 TXT로 바꿀 수 있나요?
네. 파일을 여러 개 넣고 추출하면 화면에는 파일 이름 머리줄과 함께 한데 보이고, 내려받을 때는 파일마다 TXT로 나뉜 ZIP으로 저장됩니다. 쪽 선택 범위는 모든 파일에 똑같이 적용됩니다.