스캔한 PDF를 검색 가능한 텍스트로 변환하는 방법은?
- 1단계: 이미지만 있는 PDF 업로드
볼 수만 있고 텍스트를 선택할 수 없는 스캔 데이터나 사진으로 만든 PDF를 업로드합니다.
- 2단계: 인식 언어 선택
최고의 인식률을 보장하기 위해 드롭다운 메뉴에서 문서에 해당하는 언어(영어, 중국어, 일본어 등)를 정확하게 선택합니다.
- 3단계: 대기 및 다운로드
엔진이 페이지별로 세부적인 OCR 추출을 수행한 후 텍스트를 자유롭게 복사하고 검색할 수 있는 2중 레이어 PDF를 생성합니다.
왜 이 OCR 도구를 사용해야 할까요?
- 고정밀 최첨단 AI 모델
업계를 선도하는 Tesseract 및 딥 러닝 비주얼 모델을 채택하여 강한 빛, 기울어짐 또는 약간 흐릿한 스캔 데이터라도 놀라운 인식 정확도를 유지합니다.
- 2중 레이어 구조를 완벽하게 유지
단순히 텍스트 TXT만 엉성하게 제공하는 것이 아닙니다! 생성된 PDF에는 원본 이미지 위에 완벽하게 겹치는 보이지 않는 텍스트 레이어가 포함되어 있어 원본 레이아웃을 100% 유지하면서 자유로운 강조 표시 및 복사가 가능합니다.
- 다국어 혼합 인식
글로벌 문서 처리 요구에 부응하여 수십 개의 주요 언어에 대한 정확한 인식을 완벽하게 지원합니다.
OCR 인식에 대한 자주 묻는 질문
현재 우리의 OCR 코어 엔진은 주로 '인쇄체'의 방대한 데이터에 대해 특별한 훈련을 실시하고 있습니다. 손글씨, 특히 알아보기 힘든 필기체의 경우 현재의 인식률에는 아직 한계가 있습니다.
OCR(광학 문자 인식)은 컴퓨팅 부하가 높은 AI 작업입니다. 로컬 기기가 다운되지 않도록 클라우드의 고성능 GPU 클러스터를 사용하여 글자별로 스캔하기 때문에 수십 페이지의 고해상도 이미지를 처리하는 데 시간이 조금 걸립니다.
표 내의 텍스트 콘텐츠는 정확하게 추출되어 원본 위치에 오버레이되므로 마우스를 사용하여 표 내의 숫자를 직접 선택할 수 있습니다. 하지만 표 구조 전체를 Excel로 완벽하게 내보내려면 전용 PDF to Excel 변환 도구를 사용하는 것이 좋습니다.