본문 바로가기
문서 AI·OCR

OCR 정확도 99%, 그대로 믿으면 안 되는 이유 — 우리 문서로 검증하는 PoC 7단계

'정확도 99%'가 글자 단위인지 항목 단위인지에 따라 줄어드는 업무량은 크게 달라집니다. 계산으로 보는 OCR 정확도, 틀린 값이 조용히 통과하지 않는 구조, 우리 문서로 하는 PoC 설계법.

OCR 정확도 99%, 그대로 믿으면 안 되는 이유 — 우리 문서로 검증하는 PoC 7단계

문서 OCR을 검토하다 보면 제안서마다 같은 숫자를 봅니다. "인식 정확도 99%". 그런데 도입한 뒤에도 담당자가 결과를 하나하나 다시 확인하고 있다면, 99%가 거짓이어서가 아닐 가능성이 큽니다. 그 99%가 무엇을 센 숫자인지가 업무에 필요한 숫자와 다르기 때문입니다.

이 문제는 새롭지 않습니다. 미국 국립표준기술연구소(NIST)는 1992년 OCR 시스템 평가 보고서에 이렇게 적었습니다. 이 결과가 마케팅 자료에 실리더라도 잠재 구매자는 이를 구매 결정의 주된 근거로 삼아서는 안 되며, 자기 업무의 데이터로 현실적인 환경에서 시스템을 철저히 시험해야 한다고요. 30여 년이 지난 지금도 유효한 조언입니다.

이 글은 정확도라는 말 뒤에 숨은 세 가지 단위를 계산으로 풀고, 도입 전에 우리 회사 문서로 공정하게 검증하는 방법을 정리한 것입니다. 그린다에이아이가 문서 OCR을 만들며 정확도 수치를 약속하지 않고 고객 문서로 먼저 확인하게 하는 이유이기도 합니다.

핵심 요약

  • OCR 정확도는 최소 세 가지 단위로 나뉩니다. 글자 정확도, 항목(필드) 정확도, 문서 단위 자동 처리율입니다. 제안서의 99%가 어느 단위인지부터 확인해야 합니다.
  • 오류가 서로 독립이라고 단순화하면, 글자 정확도 99%·항목 평균 5글자·항목 20개인 문서가 통째로 맞을 확률은 약 37%입니다.
  • 업무에서 가장 위험한 숫자는 평균 정확도가 아니라 "확신하며 틀린 채 통과한 값"의 비율입니다. 신뢰도가 낮은 값만 사람에게 보내는 구조가 필요합니다.
  • 검증은 실제로 받는 문서 그대로, 정답지를 먼저 만들고, 항목별로 따로 재는 것이 원칙입니다.

정확도는 적어도 세 가지다

같은 "정확도"라도 무엇을 세느냐에 따라 전혀 다른 숫자가 나옵니다.

단위 무엇을 세나 예시 업무에서의 의미
글자 정확도 맞게 읽은 글자의 비율 1,000자 중 990자를 맞게 읽음 읽기 성능. 업무 결과와 직결되지 않음
항목 정확도 값이 통째로 맞은 항목의 비율 공급가액 "12,480,000"이 한 자도 틀리지 않음 사람이 고치지 않아도 되는 값의 비율
문서 단위 자동 처리율 사람 손을 거치지 않고 끝까지 간 문서의 비율 세금계산서 한 장의 모든 항목이 맞음 실제로 줄어드는 업무량

업무 시스템에 들어가는 것은 글자가 아니라 항목입니다. 공급가액에서 숫자 하나만 틀려도 그 항목은 틀린 것이고, 그 항목 하나 때문에 문서 전체를 사람이 다시 봐야 합니다.

같은 이름의 지표도 공급사마다 세는 법이 다릅니다. OCR 평가 도구를 비교한 연구는 구현 방식의 차이 때문에 흔히 쓰는 오류율조차 서로 직접 비교할 수 없는 경우가 많다고 결론지었습니다. 정규화 규칙 하나로도 숫자가 달라집니다. 구글 Document AI의 평가 문서는 "1"과 "1.00"을 같은 값으로 보지 않는다고 적고 있습니다. 비교하려면 같은 문서, 같은 정답지, 같은 판정 규칙이 필요합니다.

계산해 보기: 99%는 문서 단위에서 얼마가 되나

단순한 모델로 계산해 보겠습니다. 글자마다 오류가 서로 독립적으로 일어난다고 가정합니다. 항목 하나가 통째로 맞을 확률은 글자 정확도를 항목의 글자 수만큼 곱한 값이고, 문서가 통째로 맞을 확률은 항목 정확도를 항목 수만큼 곱한 값입니다.

가정 항목 하나가 맞을 확률 항목 20개 문서가 통째로 맞을 확률
글자 정확도 99%, 항목 평균 5글자 95.1% (0.99의 5제곱) 36.6%
글자 정확도 99%, 항목 평균 10글자 90.4% (0.99의 10제곱) 13.4%
항목 정확도 95% 95% 35.8%
항목 정확도 99% 99% 81.8%
항목 정확도 99.5% 99.5% 90.5%

같은 "99%"라도 글자 단위면 문서 10장 중 네 장도 사람 손 없이 통과하지 못할 수 있고, 항목 단위면 여덟 장이 통과합니다. 제안서의 99%가 어느 단위인지 물어야 하는 이유입니다.

물론 실제 오류는 독립적이지 않습니다. 오류는 흐린 팩스, 기울어진 사진, 도장이 겹친 칸처럼 특정 문서와 특정 항목에 몰립니다. 그래서 실제 문서 단위 결과는 위 표보다 좋을 수도, 나쁠 수도 있습니다. 어느 쪽인지는 계산이 아니라 우리 문서로 재야만 알 수 있습니다.

업무에서 봐야 할 숫자: 자동 처리율과 '조용한 오류'

평균 정확도보다 중요한 것은 틀린 값이 어디로 가느냐입니다. 틀린 값이 사람에게 보이면 고치면 되지만, 틀린 값이 확신을 가진 채 ERP까지 들어가면 사고가 됩니다. 그래서 문서 AI는 항목마다 신뢰도를 계산해, 확신하는 값은 자동으로 넘기고 애매한 값만 사람에게 보냅니다. 이 구조에서는 네 가지 숫자를 봅니다.

  • 자동 처리율: 사람 확인 없이 넘어간 항목(또는 문서)의 비율. 실제로 줄어드는 업무량입니다.
  • 검수율: 신뢰도가 낮아 사람에게 간 항목의 비율. 검수 인력 계획의 기준입니다.
  • 조용한 오류율: 자동으로 넘어간 항목 가운데 실제로는 틀린 항목의 비율. 가장 위험한 숫자이고, 허용 한도를 먼저 정해야 합니다.
  • 검수 포함 처리 시간: 문서가 들어와서 검수를 거쳐 시스템에 들어가기까지 걸린 시간.

신뢰도 기준을 높이면 조용한 오류는 줄고 검수율은 늘어납니다. 마이크로소프트의 문서 AI 안내는 신뢰도 0.95를 "20번 중 19번은 맞을 가능성이 높다"는 뜻으로 설명하고, 이 값으로 자동 승인과 사람 검토를 가르라고 권합니다. 다만 신뢰도 숫자가 실제 정확도와 맞는지는 문서마다 다릅니다. 앞의 평가 도구 연구도 엔진이 내놓는 신뢰도가 실제 정확도를 잘 나타내지 못한 사례를 보고했습니다.

그래서 기준은 이렇게 정합니다. 정답지와 비교해 신뢰도 구간별로 실제 정확도를 재고, 조용한 오류율이 우리가 정한 허용 한도 아래로 내려가는 가장 낮은 기준을 고릅니다. 이때 기준은 통계 지표가 아니라 비용으로 정합니다. 구글 Document AI는 기본값으로 F1 점수가 가장 높은 기준을 고르지만, 틀린 금액 하나가 ERP에 들어가는 비용이 검수 한 번보다 훨씬 크다면 기준은 더 엄격해야 합니다. 항목마다 기준을 다르게 둘 수도 있습니다. 금액과 사업자등록번호는 엄격하게, 비고란은 느슨하게 두는 식입니다.

형식 검사와 교차 검증도 조용한 오류를 줄입니다. 세금계산서라면 세액이 공급가액의 10%인지, 합계가 공급가액과 세액의 합인지 확인할 수 있습니다. 사업자등록번호는 국세청이 공공데이터포털로 제공하는 사업자등록 상태조회 서비스로 실제 등록된 번호인지 대조할 수 있습니다. 읽기 성능이 같아도 이런 검증을 얼마나 붙였느냐에 따라 업무 정확도는 크게 달라집니다.

생성형 AI 기반 OCR에서 특히 볼 것

최근의 문서 AI는 대형 언어모델이나 이미지까지 읽는 멀티모달 모델을 씁니다. 템플릿을 등록하지 않아도 처음 보는 양식을 이해하고, 손글씨와 문맥을 함께 읽는다는 장점이 큽니다. 대신 새로운 종류의 오류가 생깁니다. 흐린 숫자를 "그럴듯한 값"으로 채우거나, 원문을 조용히 고쳐 쓰는 오류입니다. 글자를 못 읽어 빈칸이 되는 오류는 눈에 띄지만, 그럴듯하게 채운 오류는 눈에 띄지 않습니다.

연구도 이 점을 반복해서 보고합니다. 문서 파싱 벤치마크 OmniDocBench는 멀티모달 모델의 정확도가 낮은 주된 이유로 빽빽한 페이지에서 내용을 빠뜨리는 것과 알아보기 어려운 페이지에서 없는 내용을 지어내는 것(환각)을 꼽았고, olmOCR 연구진은 GPT-4o 같은 범용 모델이 원문에 충실하지 않게 내용을 고쳐 쓰거나 채워 넣는 경향을 기록했습니다. 금융 문서 850여 쪽으로 만든 FinCriticalED에서는 숫자와 통화 단위가 가장 취약한 항목이었고, 한국어가 포함된 전사 충실도 연구에서는 같은 모델이라도 한국어의 성능 저하가 영어보다 대체로 컸습니다. 세금계산서와 거래명세서에서 가장 중요한 값이 바로 숫자라는 점을 생각하면 가볍게 넘길 결과가 아닙니다.

그래서 생성형 모델을 쓰는 문서 AI일수록 두 가지를 확인해야 합니다. 원본 이미지의 어느 위치에서 읽은 값인지 되짚을 수 있는지, 그리고 신뢰도가 낮은 값을 스스로 표시해 사람에게 넘기는지입니다.

몇 장으로 무엇을 말할 수 있나

샘플 수에도 한계가 있습니다. 통계에는 "3의 법칙"이라는 어림셈이 있습니다. n번 시험해서 오류가 한 번도 없었다면, 실제 오류율은 95% 신뢰 수준에서 대략 3/n까지 있을 수 있다는 뜻입니다.

오류 0건을 확인한 표본 95% 신뢰 수준에서 남는 오류율 상한
문서 10장 약 26~30%
문서 100장 약 3%
항목 300개 약 1%
항목 3,000개 약 0.1%

문서 10장에서 오류가 하나도 없었다는 결과로는 "문서의 4분의 1 이상이 틀려도 이상하지 않다"는 것 이상을 말할 수 없습니다. 그래서 유형별 5~10장으로 하는 무료 테스트는 어떤 항목을 잘 읽고 어떤 오류가 나는지 보는 적합성 확인이고, 정확도를 판단하는 것은 문서 유형과 품질별로 표본을 나눠 수백 장 단위로 재는 파일럿입니다.

우리 문서로 공정하게 검증하는 PoC 7단계

  1. 실제로 받는 문서 그대로 모읍니다. 문서 유형마다 깨끗한 것만 고르지 말고 손글씨, 도장이 겹친 칸, 흐린 팩스, 휴대폰으로 찍은 사진을 섞습니다. 무료 테스트라면 유형별 5~10장으로 방향을 보고, 도입 판단은 파일럿에서 더 많은 문서로 합니다.
  2. 추출할 항목과 형식을 먼저 정합니다. 날짜는 YYYY-MM-DD, 금액은 숫자만처럼 형식까지 정해야 "맞았다"를 판정할 수 있습니다.
  3. 정답지를 만듭니다. 사람이 두 번 입력해 대조한 값을 정답으로 둡니다. 정답지 없이 결과 화면을 눈으로 훑는 검증은 검증이 아닙니다.
  4. 항목별로 따로 잽니다. 평균 하나로 뭉치면 금액처럼 중요한 항목의 약점이 가려집니다.
  5. 신뢰도 기준을 정하고 네 숫자를 계산합니다. 자동 처리율, 검수율, 조용한 오류율, 검수 포함 처리 시간입니다.
  6. 처리량과 시간을 잽니다. 월 처리량 기준으로 대량 문서를 넣었을 때 걸리는 시간을 확인합니다.
  7. 연동된 모양으로 확인합니다. 결과가 ERP·엑셀에 들어간 형태로 받아 봐야 실제 업무에서 쓸 수 있는지 판단할 수 있습니다.

결과는 아래처럼 한 장으로 정리하면 공급사끼리 공정하게 비교할 수 있습니다.

항목 표본 수 항목 정확도 자동 처리율 검수율 조용한 오류율
공급자 상호
사업자등록번호
공급가액
비고(손글씨)

한국 문서에서 특히 확인할 것

  • 도장과 서명: 인감이 글자 위에 겹친 칸, 손으로 쓴 서명은 인식 난도가 높습니다. 이런 칸이 신뢰도 낮음으로 제대로 표시되는지 봅니다.
  • 손글씨 기재란: 신청서·청구서의 수기 칸은 문서마다 품질 차이가 큽니다.
  • 팩스와 휴대폰 사진: 현장에서는 스캔보다 팩스와 사진이 더 많이 들어오는 경우가 흔합니다. 기울기·그림자 보정 후 결과를 봅니다.
  • 여러 언어가 섞인 문서: 무역 서류는 한 장에 한국어·영어·한자가 섞입니다. 언어별 결과를 따로 봅니다.
  • 개인정보: 신분증·증명서처럼 민감한 값이 있는 문서는 추출과 함께 마스킹이 되는지, 문서가 사내 인프라 밖으로 나가지 않게 구축할 수 있는지 확인합니다.
  • 이미 전자로 오는 문서: 법인은 2011년부터, 직전 연도 공급가액 8천만 원 이상인 개인사업자는 2024년 7월부터 전자세금계산서 발급이 의무입니다(국세청). 이렇게 처음부터 데이터로 오는 문서는 OCR보다 데이터를 그대로 가져오는 편이 정확합니다. OCR이 필요한 것은 종이·스캔·팩스·사진으로 들어오는 거래명세서, 계약서, 신청서, 수출입 서류 같은 문서입니다.

그린다에이아이 문서 OCR은 이렇게 검증합니다

저희는 정확도 수치를 먼저 약속하지 않습니다. 인식 성능은 문서 품질과 유형에 따라 달라지기 때문입니다. 대신 신청서를 받으면 담당자가 추출할 항목과 샘플을 안전하게 보내는 방법을 안내하고, 필요하면 비밀유지계약(NDA)을 먼저 맺습니다. 보내 주신 샘플로 추출을 실행해 항목별 결과와 신뢰도, 자동 처리 가능 범위, 검수·연동 방식 제안을 리포트로 드립니다. 보내 주신 문서는 그 테스트에만 쓰고 외부 모델 학습에는 쓰지 않습니다.

운영 단계에서는 신뢰도가 낮은 항목만 사람이 검수하고, 검증된 데이터는 표준 API나 엑셀로 ERP·RPA에 연결합니다. 문서 자동화 전체 흐름은 IDP(지능형 문서 처리) 가이드에, 도입 절차는 문서 OCR 솔루션에 정리해 두었습니다.

자주 묻는 질문

OCR 정확도 99%는 믿을 수 있는 숫자인가요?

숫자 자체보다 무엇을 센 숫자인지가 중요합니다. 공개된 정확도 수치는 측정 단위와 시험 문서를 밝히지 않은 경우가 많은데, 업무에 필요한 것은 항목 단위 정확도와 문서가 사람 손 없이 끝까지 간 비율입니다. 같은 99%라도 단위가 다르면 실제로 줄어드는 업무량이 크게 달라지므로, 어느 단위의 숫자인지와 어떤 문서로 잰 숫자인지를 함께 물어보세요.

OCR 테스트에는 문서가 몇 장 필요한가요?

방향을 보는 무료 테스트라면 문서 유형별 5~10장이면 충분합니다. 손글씨, 도장, 저화질처럼 까다로운 문서가 섞여 있을수록 도입 후의 결과를 가깝게 가늠할 수 있습니다. 도입을 판단하는 정확도는 파일럿에서 더 많은 문서와 정답지로 재는 것이 맞습니다.

LLM 기반 OCR은 기존 OCR보다 정확한가요?

처음 보는 양식이나 손글씨처럼 문맥이 필요한 문서에서는 강점이 큽니다. 다만 흐린 값을 그럴듯하게 채우는 오류가 생길 수 있어, 값을 원본 위치와 대조할 수 있는지와 신뢰도가 낮은 값을 사람에게 넘기는지를 함께 확인해야 합니다.

정확도가 100%가 아니면 결국 사람이 전부 다시 봐야 하나요?

그렇지 않습니다. 항목마다 신뢰도를 매겨 확실한 값은 자동으로 넘기고 애매한 값만 사람에게 보내면, 사람은 전체가 아니라 일부만 봅니다. 이때 정해야 할 것은 조용한 오류율의 허용 한도이고, 그 한도에 맞춰 신뢰도 기준을 고르면 됩니다.

OCR문서 자동화PoC데이터 추출

참고한 자료

  1. The First Census Optical Character Recognition Systems Conference (NIST IR 4912) — 미국 국립표준기술연구소(NIST), 1992-01
  2. A survey of OCR evaluation tools and metrics (HIP '21) — Neudecker 외, ACM, 2021
  3. Evaluate performance — Document AI — Google Cloud
  4. Interpret and improve model accuracy and confidence scores — Document Intelligence — Microsoft Learn
  5. OmniDocBench: Benchmarking Diverse PDF Document Parsing (CVPR 2025) — Ouyang 외, 2025-03
  6. olmOCR: Unlocking Trillions of Tokens in PDFs with Vision Language Models — Allen Institute for AI, 2025-02
  7. FinCriticalED: 금융 문서 OCR 의 사실 정확도 벤치마크 — arXiv 2511.14998, 2026-04
  8. Do VLMs Read or Rewrite? On Transcription Faithfulness in VLMs — arXiv 2607.21617, 2026-09
  9. 전자세금계산서 제도 안내 — 국세청
  10. 국세청_사업자등록정보 진위확인 및 상태조회 서비스 — 공공데이터포털

외부 수치에는 원문 링크를 달았고, 그린다에이아이의 수치는 사내 수치 레지스트리에 정의·기준 시점과 함께 등록된 값만 씁니다. 예시로 든 회사와 숫자는 본문에 예시라고 표시했습니다. 사실과 다른 내용을 발견하시면 알려 주세요.

글쓴이

강호진그린다에이아이 대표이사

KAIST에서 AI를 공부하고 2023년 대전에서 그린다에이아이를 창업했습니다. 해외영업 에이전트 린다, 회사 메신저에서 일하는 AI 직원 Ara, 문서 OCR을 만들고, 기업의 AX 도입을 진단부터 현업 정착까지 함께 설계합니다.

관련 글