한국의 문서 업무는 아직 종이에서 시작하는 경우가 많습니다. 행정안전부는 국민이 매년 발급하는 민원증명서류가 7억 건이 넘는다고 밝혔습니다. 회사 안도 비슷합니다. 거래처마다 양식이 다른 거래명세서, 도장이 찍힌 계약서, 팩스로 들어오는 발주서, 휴대폰으로 찍어 보내는 영수증이 매일 누군가의 손을 거쳐 ERP에 입력됩니다.
이 입력 업무를 자동화하는 기술이 IDP(Intelligent Document Processing, 지능형 문서 처리)입니다. OCR과 자주 같은 말처럼 쓰이지만, OCR은 IDP의 첫 단계일 뿐입니다. 이 글은 IDP가 무엇이고, 문서가 업무 데이터가 되기까지 어떤 단계를 거치며, 도입 전에 무엇을 확인해야 하는지를 정리한 것입니다.
핵심 요약
- IDP는 문서를 읽는 데서 끝나지 않고 분류·추출·검증을 거쳐 업무 시스템에 넣는 전 과정입니다. OCR은 그중 글자를 읽는 단계입니다.
- 문서 자동화는 수집, 분류, 추출, 검증, 연동의 다섯 단계로 나눠 보면 어디서 막히는지 보입니다. 실패는 대개 추출보다 검증과 연동에서 납니다.
- 사람 검수는 세 가지 규칙으로 보냅니다. 신뢰도가 낮은 값, 필수 항목이 빠진 문서, 그리고 무작위로 뽑은 표본입니다.
- 비용은 처리량, 문서 유형과 항목 수, 구축 방식, 연동 범위로 정해지고, 효과는 "입력 시간 − 검수 시간"으로 계산합니다.
IDP란 무엇인가
IDP는 스캔·사진·PDF로 들어온 문서를 분류하고, 필요한 항목을 추출해 검증한 뒤, 업무 시스템에 구조화된 데이터로 넣는 기술과 과정입니다. 시장조사기관 IDC는 IDP를 AI와 고급 분석, 비즈니스 규칙을 조합해 콘텐츠와 문서의 처리 흐름과 의사결정을 지원하는 기술로 정의하고, 공급사들이 문서의 분류·추출·분석·검증을 자동화하는 방향으로 움직인다고 설명합니다.
핵심은 "읽기"가 아니라 "업무에 쓸 수 있는 데이터"입니다. 공급가액을 12,480,000이라고 정확히 읽는 것과, 그 값이 세액과 맞는지 확인해 올바른 거래처의 전표로 ERP에 넣는 것은 다른 일입니다.
OCR·IDP·RPA·LLM은 무엇이 다른가
| 기술 | 하는 일 | 멈추는 곳 |
|---|---|---|
| OCR | 이미지 속 글자를 텍스트로 읽는다 | 어떤 글자가 어떤 항목인지는 모른다 |
| IDP | 문서를 분류하고 항목을 추출·검증해 데이터로 만든다 | 추출한 데이터로 업무를 처리하는 것은 다음 시스템의 몫 |
| RPA | 정해진 화면 순서대로 입력·클릭을 반복한다 | 문서의 내용을 이해하지 못한다. 형식이 바뀌면 멈춘다 |
| LLM·멀티모달 모델 | 문맥을 이해해 처음 보는 양식에서도 항목을 찾는다 | 흐린 값을 그럴듯하게 채우는 오류가 있어 검증이 필요하다 |
실제 도입에서는 이 기술들이 겹쳐 쓰입니다. 최근의 IDP는 OCR과 언어모델을 함께 써서 템플릿 없이 항목을 찾고, 검증된 데이터를 API로 넘기면 RPA나 ERP가 다음 일을 처리합니다. 언어모델 기반 추출의 정확도를 어떻게 재야 하는지는 OCR 정확도 99%의 함정에서 자세히 다뤘습니다.
문서 자동화의 5단계
1단계. 수집 — 문서가 어디로, 어떤 모양으로 들어오나
메일 첨부, 스캐너, 팩스, 휴대폰 사진, 거래처 포털 다운로드처럼 채널이 여럿입니다. 이 단계에서 기울기·그림자·해상도를 보정하고, 여러 문서가 한 PDF에 합쳐져 들어온 경우 문서 단위로 나눕니다.
확인할 것: 우리 회사에 문서가 들어오는 채널을 모두 적어 봤는가. 가장 많은 채널이 스캔이 아니라 팩스나 사진일 수도 있습니다.
2단계. 분류 — 이 문서는 무엇인가
세금계산서인지 거래명세서인지, B/L인지 원산지증명서인지, 어느 거래처의 문서인지를 가립니다. 분류가 틀리면 그 뒤의 추출 규칙이 통째로 틀리므로, 분류 결과에도 신뢰도를 두고 애매하면 사람에게 넘깁니다.
확인할 것: 분류 대상 문서 유형이 몇 가지인가, 유형마다 월 몇 장인가.
3단계. 추출 — 필요한 항목만 뽑는다
추출에는 두 방식이 있습니다. 양식마다 항목의 위치를 등록하는 템플릿 방식은 정형 서식에서 빠르고 안정적이지만, 거래처가 양식을 바꾸면 다시 등록해야 합니다. 문서의 의미를 이해해 항목을 찾는 방식은 처음 보는 양식도 처리하지만, 결과를 검증하는 장치가 더 중요해집니다.
특히 어려운 것은 표입니다. 거래명세서의 품목 행처럼 줄 수가 매번 다른 표는 행이 밀리거나 합쳐지는 오류가 흔합니다. 추출한 값이 원본 이미지의 어느 위치에서 왔는지 함께 기록해 두면, 검수자가 원본을 한 번에 대조할 수 있습니다. 마이크로소프트는 문서 자동화 튜토리얼에서 이 위치 정보가 감사와 사람 검토에 결정적이라고 설명합니다.
4단계. 검증 — 틀린 값이 통과하지 않게
실패는 대개 추출보다 이 단계에서 납니다. 검증은 네 겹으로 겁니다.
- 신뢰도: 항목별 신뢰도가 기준보다 낮으면 사람에게 보냅니다.
- 형식: 날짜·금액·사업자등록번호처럼 형식이 정해진 값은 형식부터 검사합니다.
- 교차 검증: 세액이 공급가액의 10%인지, 품목 합계가 총액과 맞는지처럼 문서 안의 값끼리 맞춰 봅니다.
- 외부 대조: 거래처 마스터나 공개 데이터와 대조합니다. 사업자등록번호는 국세청 상태조회로 실제 등록 여부를 확인할 수 있습니다.
5단계. 연동 — 업무 시스템까지
검증된 데이터를 표준 API나 배치로 ERP·그룹웨어·RPA에 넘기거나, 엑셀·CSV로 내보냅니다. 여기서 자주 빠지는 것이 예외 처리입니다. 검수에서 반려된 문서, 거래처에 다시 요청해야 하는 문서가 어디로 가서 누가 처리하는지를 정해 두지 않으면, 자동화된 흐름 옆에 수작업 흐름이 하나 더 생깁니다.
사람 검수는 어디에 두나
모든 결과를 사람이 다시 보면 자동화의 의미가 없고, 아무것도 보지 않으면 틀린 값이 조용히 쌓입니다. 클라우드 공급사들의 문서에 자주 나오는 설계는 세 가지 규칙으로 사람 검수를 부르는 것입니다. 아마존의 사람 검수 설계 예가 바로 이 세 조건을 씁니다.
| 규칙 | 언제 사람에게 가나 | 막는 것 |
|---|---|---|
| 신뢰도 기준 | 항목 신뢰도가 기준보다 낮을 때 | 애매한 값이 그대로 들어가는 것 |
| 필수 항목 누락 | 꼭 있어야 할 항목을 찾지 못했을 때 | 빈칸이 있는 전표 |
| 무작위 표본 | 신뢰도가 높아도 일정 비율을 무작위로 | 확신하며 틀린 "조용한 오류" |
세 번째 규칙이 가장 자주 빠집니다. 신뢰도가 높은 결과만 자동으로 통과시키면, 모델이 확신하며 틀린 값은 영영 발견되지 않습니다. 무작위로 뽑은 일부를 계속 사람이 확인해야 신뢰도 기준이 여전히 맞는지 알 수 있습니다. 기준 자체도 업무의 무게에 맞춥니다. 아마존은 Textract 모범 사례에서 기록물의 손글씨는 50% 정도로 낮게, 금융 판단에 쓰는 값은 90% 이상으로 높게 두는 예를 듭니다.
문서 유형별로 무엇을 뽑나
| 산업 | 대표 문서 | 주로 뽑는 항목 |
|---|---|---|
| 금융·은행 | 여신 심사 증빙, 신청서 | 신청인, 상품, 수기 기재란, 서명 |
| 무역·물류 | 인보이스, B/L, 원산지증명서 | 선적항, 도착항, 인코텀즈, 품목 |
| 공공·행정 | 민원 신청서, 심사 접수 서류 | 신청 항목, 첨부 서류 여부, 기한 |
| 법무 | 계약서 | 당사자, 금액, 기간, 특약 조항 |
| 보험 | 청구 서류, 진단서 | 청구인, 청구 금액, 수기 기재란 |
| 제조·유통 | 발주서, 거래명세서 | 품목, 수량, 단가, 납기 |
클라우드인가, 온프레미스인가
문서에 개인정보·계약 조건·금융 정보가 담겨 있거나, 망분리 환경이라 외부 서비스에 문서를 보낼 수 없다면 온프레미스나 프라이빗 클라우드 구축이 맞습니다. 데이터를 특정 국가·지역 안에 두어야 하는 경우도 같습니다. 반대로 민감도가 낮고 빠르게 시작하는 것이 중요하다면 클라우드가 유리합니다. 어느 쪽이든 공급사가 고객 문서를 외부 모델 학습에 쓰지 않는지는 계약으로 확인합니다.
비용과 효과는 어떻게 계산하나
비용을 정하는 것은 네 가지입니다. 월 처리량, 문서 유형과 추출 항목 수, 구축 방식(클라우드·온프레미스), 연동 범위입니다. 효과는 입력 시간에서 검수 시간을 뺀 값으로 계산합니다.
월 절감 시간 = 월 문서 수 × 문서당 수기 입력 시간 − 월 문서 수 × 검수율 × 문서당 검수 시간 − 예외 처리 시간
가상의 예로 계산해 보겠습니다. 거래명세서가 월 3,000장 들어오고, 한 장을 손으로 입력하는 데 4분이 걸린다면 입력에만 월 200시간이 듭니다. 도입 후 검수율이 20%이고 검수에 1분 30초가 걸린다면 검수는 월 15시간이고, 반려·재요청 같은 예외 처리에 월 10시간이 든다고 하면 월 175시간이 줄어듭니다. 숫자는 예시일 뿐이고, 실제 검수율은 파일럿에서 우리 문서로 재야 합니다. 이 계산에서 가장 민감한 변수가 검수율이기 때문입니다.
도입은 어떤 순서로 하나
그린다에이아이의 문서 OCR은 세 단계로 도입합니다. 먼저 12주 동안 문서 유형·처리량·업무 흐름을 분석해 추출 항목과 검수 기준을 정합니다. 다음 24주는 고객사의 실제 문서로 추출 모델을 맞추고 결과를 직접 확인하는 파일럿입니다. 마지막으로 ERP·기간계와 연동하고, 정식 가동 후에도 데이터 품질을 계속 모니터링합니다. 시작 전에 갖고 계신 문서로 무료 추출 테스트를 먼저 해 볼 수 있고, 자세한 절차는 문서 OCR 솔루션에 정리해 두었습니다.
자주 묻는 질문
IDP와 OCR은 무엇이 다른가요?
OCR은 이미지 속 글자를 텍스트로 읽는 기술이고, IDP는 그 결과를 바탕으로 문서를 분류하고 필요한 항목을 추출·검증해 업무 시스템에 넣는 전 과정입니다. OCR의 결과는 글자이고, IDP의 결과는 ERP에 들어갈 수 있는 검증된 데이터입니다.
거래처마다 양식이 다른데 템플릿을 모두 등록해야 하나요?
템플릿 방식이라면 양식마다 등록이 필요하고, 양식이 바뀔 때마다 다시 등록해야 합니다. 문서의 의미를 이해해 항목을 찾는 방식은 등록 없이 처음 보는 양식도 처리합니다. 대신 신뢰도와 교차 검증으로 결과를 확인하는 장치가 함께 있어야 합니다.
거래명세서의 품목 표도 추출할 수 있나요?
추출할 수 있지만, 줄 수가 매번 다른 표는 행이 밀리거나 합쳐지는 오류가 생기기 쉬워 가장 꼼꼼히 확인해야 하는 부분입니다. 품목 합계와 총액을 대조하는 검증을 붙이고, 파일럿에서 실제 표로 결과를 확인하는 것이 좋습니다.
문서가 사내 밖으로 나가지 않게 구축할 수 있나요?
온프레미스나 프라이빗 클라우드로 구축하면 문서가 사내 인프라 밖으로 나가지 않도록 설계할 수 있습니다. 그린다에이아이는 두 방식 모두 지원하며, 고객사 데이터를 외부 모델 학습에 쓰지 않습니다.




