OCR
이미지에서 텍스트를 추출하는 기술 — Tesseract · pytesseract
CLICK TO OPEN
이미지에서 텍스트를 추출하는 기술 — Tesseract · pytesseract
CLICK TO OPEN
Tesseract 설치 · 이미지 텍스트 인식 · lang 옵션 활용
OCR 개요 & 설치
OCR 개요 & 설치
OCR은 사진 속 글자를 읽어내는 AI 눈, 간판·문서·손글씨도 텍스트로 변환
구글 Tesseract 엔진을 파이썬 pytesseract로 감싸 사용
설치 순서
① Tesseract 실행 파일 설치 → ② Python 라이브러리 설치 → ③ 실행 파일 경로 지정
① Tesseract-OCR 설치 (Windows)
② Python 라이브러리 설치
• pytesseract — 파이썬에서 Tesseract 부르는 통역사
• PIL — 사진 파일 여닫는 파이썬 이미지 도구(pillow)
이미지 텍스트 인식
이미지 텍스트 인식 (v19_01_ocr_img.py)
PIL로 사진 열기 → image_to_string으로 글자 뽑아내기, 사진을 텍스트로 바꾸는 4단계 흐름
단계별 흐름
① Tesseract 경로 지정 → ② 이미지 불러오기 → ③ OCR 수행 → ④ 결과 출력
전체 코드
핵심 함수 설명
• pytesseract.tesseract_cmd — Tesseract 실행 파일 위치 알려주기
• Image.open(경로) — PIL로 사진 파일 열기
• image_to_string(image, lang) — 사진에서 글자 뽑아 문자열로 반환
• lang='eng' — OCR이 쓸 언어 지정 (언어팩 설치 필수)
lang 옵션 & 결과 해석
lang 파라미터 & 결과 해석
lang은 OCR에게 읽을 언어 알려주기, +로 여러 언어 동시 인식 (예: eng+kor)
더 똑똑한 대안 EasyOCR·PaddleOCR (딥러닝 기반)
주요 lang 옵션
| lang 값 | 설명 | 예시 코드 |
|---|---|---|
eng | 영어 (기본값, 별도 설치 없이 사용 가능) | lang='eng' |
kor | 한국어 (한국어 언어팩 별도 설치 필요) | lang='kor' |
eng+kor | 영어 + 한국어 동시 인식 | lang='eng+kor' |
chi_sim | 중국어 간체 | lang='chi_sim' |
jpn | 일본어 | lang='jpn' |
복합 언어 사용 예시
실행 결과 예시 (image.png → v19_01 코드 출력)
• 결과에 줄바꿈(\n) 포함 → .strip()으로 공백 제거
• 사진 해상도 낮거나 글꼴 특수하면 인식률 저하 → 전처리(흑백 변환·크기 조정)로 개선