OCR

이 브라우저에서 처리

파일 한도: 32 MB

이 도구는 입력을 업로드하지 않습니다.

처음 사용할 때 브라우저에서 라이브러리를 받을 수 있습니다.

Tesseract는 영어(eng) 우선입니다. 주민등록증·한글 서류에 쓰지 마세요. 처음에는 이 탭에서 모델을 받습니다.

파일을 놓으세요

파일을 여기에 놓거나 선택하세요.

예시: 인쇄 글자 사진을 놓고 처리하세요. 처음 사용 시 모델을 받습니다.

그림 속 글자를 읽되, 언어는 영어가 우선입니다. 디지털 PDF의 텍스트 층을 꺼내는 도구가 아니고, 신분증 인식기가 아닙니다.

영어 메뉴판이나 에러 화면을 복사해야 하는데, 파일이 그림일 때입니다. 이 페이지는 이미지 → 글자이며 언어는 영어(eng)가 우선입니다.

이미 글자가 들어 있는 PDF는 PDF 텍스트 추출입니다. 페이지를 그림으로 뽑는 일은 PDF를 JPG로입니다.

읽을 때, 읽지 않을 때

잘 되는 편: 또렷한 영문 스크린샷, 고대비 인쇄물.

자주 실패: 손글씨, 도장, 흐린 휴대폰 사진, 표, 우리가 불러오지 않은 언어.

주민등록증·신분증 OCR을 앞세우지 않습니다. 클라우드 명함·신분증 앱이 그 검색어를 가져갑니다. 여기는 그 제품이 아닙니다.

사용 순서

  1. 이미지나 스캔 페이지를 놓습니다. HEIC면 먼저 HEIC를 JPG로 하세요. 대략 32MB까지입니다.
  2. 나온 글을 확인하고 틀린 줄을 고칩니다. 군더더기 공백은 공백 정리가 이어집니다.
  3. 디지털 PDF면 처음부터 PDF 텍스트 추출을 쓰세요.

제한

  • 손글씨, 도장, 낮은 해상도는 자주 실패합니다.
  • 검색 가능한 PDF를 만들어 주지 않습니다.
  • 법정 녹취나 99% 정확도를 약속하지 않습니다.
  • 업로드하지 않습니다.

자주 묻는 질문

한글 문서도 잘 읽히나요?

엔진은 영어(eng)가 우선입니다. 한글 인쇄물은 틀리거나 비어 있을 수 있습니다. 주민등록증·운전면허·손글씨를 목표로 하지 않습니다.

PDF에서 글자를 빼고 싶습니다.

텍스트 층이 있는 디지털 PDF는 PDF 텍스트 추출이 맞습니다. 여기는 이미지·스캔용입니다.

정확도가 클라우드 OCR과 같나요?

브라우저에서 도는 Tesseract입니다. 흐린 사진·기울어진 도장은 자주 실패합니다. 검색 가능한 PDF를 만들어 주지 않습니다.

표까지 엑셀로 만들어 주나요?

글자 열만 나옵니다. 표 구조를 보장하지 않습니다.

첫 실행이 느립니다.

영어 모델이 한 번 내려갑니다. 그 다운로드는 인식 엔진이지, 사진을 서버에 쌓는 일이 아닙니다.

사진이 업로드되나요?

아닙니다. 인식은 이 탭에서만 이뤄집니다. 대략 32MB까지입니다.

관련 도구