본문 바로가기
Azure AI Services Engineering/Document

[ Azure AI Services #3 ] Azure AI Document Intelligence란? 문서를 데이터로 바꾸는 AI

by yunalee-dev 2026. 6. 18.

Azure AI Document Intelligence란? 문서를 데이터로 바꾸는 AI

이전 글에서는 Gradio를 이용해 AI 실습 결과를 웹 화면으로 보여주는 방법을 살펴봤습니다.

이제부터는 Azure AI Services의 개별 기능을 하나씩 다뤄보겠습니다.

 

첫 번째 주제는 Azure AI Document Intelligence입니다.

문서는 사람이 보기에는 익숙하지만, 컴퓨터가 바로 처리하기에는 꽤 까다로운 데이터입니다. 계약서, 영수증, 청구서, 신청서, 명함처럼 문서 안에는 텍스트뿐만 아니라 표, 항목, 위치, 서식, 필드 값이 함께 들어 있습니다.

 

예를 들어 영수증을 사람이 보면 “총 결제 금액은 18,000원이고, 결제일은 2026년 6월 18일이구나”라고 바로 이해할 수 있습니다. 하지만 컴퓨터 입장에서는 그저 이미지나 PDF 파일일 뿐입니다. 문서 안에 어떤 글자가 있고, 그 글자가 어떤 의미인지, 어느 항목에 해당하는지 따로 분석해야 합니다.

 

Azure AI Document Intelligence는 바로 이 문제를 해결하기 위한 서비스입니다. 문서를 단순 이미지나 파일로 두는 것이 아니라, 분석 가능한 데이터로 바꿔주는 역할을 합니다.

이 글의 핵심 질문
Document Intelligence는 PDF, 이미지, 스캔 문서에서 텍스트와 구조를 추출하고, 필요한 정보를 JSON 같은 구조화된 데이터로 변환해주는 Azure의 문서 AI 서비스입니다.

1. 문서 AI가 필요한 이유

기업이나 기관에서 다루는 데이터는 생각보다 문서 형태로 많이 존재합니다.

계약서, 견적서, 세금계산서, 영수증, 신분증, 신청서, 보험 청구서, 진료 기록처럼 중요한 정보가 문서 안에 들어 있습니다.

문제는 이런 문서들이 데이터베이스처럼 깔끔한 행과 열로 정리되어 있지 않다는 점입니다.

사람은 문서를 읽고 필요한 정보를 찾을 수 있지만, 컴퓨터가 자동으로 처리하려면 먼저 문서 안의 내용을 구조화해야 합니다.

예를 들어 영수증 처리 업무를 생각해보겠습니다. 사람이 직접 처리한다면 아래와 같은 과정을 반복해야 합니다.

  • 영수증 이미지를 열어본다.
  • 상호명을 찾는다.
  • 결제 날짜를 확인한다.
  • 총 결제 금액을 입력한다.
  • 부가세나 품목 정보를 따로 정리한다.
  • 시스템에 하나씩 옮겨 적는다.

문서가 몇 장이라면 괜찮지만, 수백 장, 수천 장이 되면 사람이 직접 처리하기 어렵습니다. 시간도 오래 걸리고, 오타나 누락 같은 실수도 생깁니다.

Document Intelligence는 이런 반복적인 문서 처리 과정을 자동화하는 데 사용됩니다. 문서에서 텍스트를 읽고, 문서의 구조를 파악하고, 필요한 항목을 추출해서 프로그램이 사용할 수 있는 데이터 형태로 바꿔줍니다.

문서 AI의 핵심 역할
문서 AI는 사람이 눈으로 읽고 판단하던 문서 내용을 컴퓨터가 처리할 수 있는 데이터로 바꾸는 기술입니다. 즉, 문서를 사람이 읽는 자료에서 시스템이 처리하는 데이터로 바꿔주는 중간 다리 역할을 합니다.

 

2. Document Intelligence란?

Azure AI Document Intelligence는 문서에서 텍스트, 표, 키-값 쌍, 필드 정보를 추출하는 Azure의 문서 분석 서비스입니다.

이 서비스는 과거에 Form Recognizer라는 이름으로 불렸습니다. 이름이 바뀌었지만 핵심 목적은 동일합니다. 문서를 분석해서 필요한 정보를 구조화된 데이터로 반환하는 것입니다.

 

여기서 구조화된 데이터라는 표현이 중요합니다. 구조화된 데이터는 컴퓨터가 항목별로 이해하고 처리하기 쉬운 형태의 데이터입니다. 예를 들어 단순히 영수증 전체 문장을 텍스트로 뽑는 것이 아니라, 아래처럼 항목별로 구분하는 것이 구조화입니다.

{
  "merchantName": "ABC Store",
  "transactionDate": "2026-06-18",
  "totalAmount": 18000,
  "currency": "KRW"
}

이렇게 결과가 나오면 사람이 다시 읽고 옮겨 적을 필요가 줄어듭니다. 시스템은 이 JSON 데이터를 바로 데이터베이스에 저장하거나, 검수 화면에 보여주거나, 자동 승인 규칙에 활용할 수 있습니다.

Document Intelligence가 처리하는 대표 작업

  • 문서 이미지에서 글자 추출
  • 문서 안의 표 구조 인식
  • 영수증, 청구서, 신분증 같은 문서 유형 분석
  • 문서 안의 특정 필드 값 추출
  • 맞춤형 문서 양식에 맞는 데이터 추출 모델 생성

정리하면 Document Intelligence는 OCR처럼 글자만 읽는 도구가 아니라, 문서의 의미 있는 정보를 뽑아내는 문서 처리 AI에 가깝습니다.

3. OCR과 Document Intelligence의 차이

Document Intelligence를 이해할 때 가장 먼저 헷갈리는 개념이 OCR입니다.

OCR은 Optical Character Recognition의 약자로, 이미지나 스캔 문서 안의 글자를 인식하는 기술입니다.

쉽게 말해 “이미지 속 글자를 텍스트로 바꾸는 기술”입니다.

예를 들어 영수증 이미지를 OCR로 처리하면 아래와 비슷한 결과를 얻을 수 있습니다.

ABC Store
2026-06-18
Americano 4500
Sandwich 13500
Total 18000

이것만으로도 유용하지만, 아직 부족합니다. 컴퓨터는 여기서 어떤 값이 상호명인지, 어떤 값이 날짜인지, 어떤 값이 총액인지 확실히 알기 어렵습니다.

Document Intelligence는 여기서 한 단계 더 나아갑니다. 글자를 읽는 것뿐만 아니라, 문서 안의 위치와 구조를 분석하고, 특정 문서 유형에 맞춰 의미 있는 필드 값을 추출합니다.

구분 OCR Document Intelligence
주요 목적 이미지 속 글자 인식 문서 내용과 구조 분석
출력 결과 텍스트 중심 텍스트, 표, 필드, JSON
문서 구조 이해 제한적 상대적으로 강함
예시 이미지에서 글자 추출 영수증에서 날짜, 상호명, 총액 추출
쉽게 구분하기
OCR이 “무슨 글자가 적혀 있는가?”에 답한다면, Document Intelligence는 “이 문서에서 어떤 정보가 어떤 항목에 해당하는가?”에 더 가깝습니다.

 

4. 문서 분석 모델: Read, Layout, General Documents

Document Intelligence에는 문서를 분석하는 여러 모델이 있습니다.

처음에는 모델 이름이 많아 보여서 복잡하지만, 기본적으로는 문서를 얼마나 깊게 이해할 것인지에 따라 나누어 볼 수 있습니다.

Read 모델

Read 모델은 문서에서 텍스트를 읽는 데 초점을 둡니다. 이미지나 PDF 안에 있는 글자를 추출하는 기능입니다. OCR에 가장 가까운 역할을 한다고 볼 수 있습니다.

예를 들어 스캔한 문서에서 본문 내용을 텍스트로 가져오거나, 이미지 속 문장을 추출할 때 사용할 수 있습니다.

Layout 모델

Layout 모델은 텍스트뿐만 아니라 문서의 배치와 구조를 분석합니다. 문서 안에 문단이 어디에 있는지, 표가 있는지, 행과 열이 어떻게 구성되어 있는지를 파악합니다.

계약서나 보고서처럼 문서 구조가 중요한 경우에는 단순 텍스트보다 Layout 분석이 더 유용합니다. 표 데이터나 문단 위치를 유지해야 하는 경우에도 Layout 모델이 필요합니다.

General Documents 모델

General Documents 모델은 일반적인 문서에서 텍스트, 표, 키-값 쌍 등 여러 정보를 추출하는 데 사용됩니다. 여기서 키-값 쌍은 “항목 이름과 그에 대응하는 값”을 의미합니다.

예를 들어 신청서에 이름: 김민정, 생년월일: 2000-01-01처럼 적혀 있다면, “이름”이 키이고 “김민정”이 값입니다. 문서 처리 자동화에서는 이런 키-값 쌍을 잘 뽑아내는 것이 중요합니다.

모델 주요 역할 적합한 상황
Read 문서에서 텍스트 추출 이미지나 PDF의 글자를 읽고 싶을 때
Layout 문서의 배치, 표, 구조 분석 표와 문단 구조가 중요한 문서
General Documents 일반 문서에서 텍스트, 표, 키-값 쌍 추출 정형 양식이 아닌 일반 문서 분석

이 세 가지를 구분하는 기준은 간단합니다. 글자만 필요하면 Read, 문서 구조가 중요하면 Layout, 일반 문서에서 여러 정보를 함께 뽑고 싶으면 General Documents를 떠올리면 됩니다.

5. 사전 제작된 모델

사전 제작된 모델, 즉 Prebuilt Model은 Azure에서 미리 학습해 제공하는 문서 분석 모델입니다.

사용자가 따로 데이터를 모으고 모델을 학습시키지 않아도, 특정 문서 유형에 맞춰 바로 사용할 수 있습니다.

예를 들어 영수증, 청구서, 신분증, 명함은 많은 기업에서 반복적으로 사용하는 문서입니다. 이런 문서들은 구조가 어느 정도 비슷하기 때문에, Azure가 미리 학습한 모델을 제공할 수 있습니다.

대표적인 사전 제작 모델 예시

  • Invoice: 청구서에서 금액, 공급자, 날짜, 품목 정보 추출
  • Receipt: 영수증에서 상호명, 결제일, 총액 추출
  • Identity Document: 신분증에서 이름, 생년월일, 문서 번호 추출
  • Business Card: 명함에서 이름, 회사명, 전화번호, 이메일 추출

사전 제작 모델의 장점은 빠르게 사용할 수 있다는 점입니다. 문서 유형이 Azure에서 제공하는 모델과 잘 맞는다면, 별도 학습 없이도 꽤 좋은 결과를 얻을 수 있습니다.

Prebuilt Model을 쓰면 좋은 경우
영수증, 청구서, 신분증, 명함처럼 문서 유형이 일반적이고, Azure에서 이미 지원하는 형식이라면 사전 제작 모델을 먼저 사용해보는 것이 좋습니다.

6. 맞춤형 모델

모든 문서가 사전 제작 모델로 해결되는 것은 아닙니다.

회사마다 사용하는 신청서 양식이 다르고, 계약서 형식도 다르고, 내부 문서 구조도 다를 수 있습니다.

 

예를 들어 어떤 회사의 납품 확인서에는 “납품처”, “검수 담당자”, “승인 번호”, “프로젝트 코드” 같은 고유한 항목이 있을 수 있습니다. 이런 문서는 일반적인 영수증이나 청구서 모델로 정확히 처리하기 어렵습니다.

 

이때 사용하는 것이 Custom Model, 즉 맞춤형 모델입니다.

맞춤형 모델은 사용자가 직접 준비한 문서와 레이블 데이터를 바탕으로 특정 문서 양식에 맞게 학습됩니다.

여기서 레이블이란 모델이 뽑아야 할 정답 위치를 사람이 표시해주는 작업입니다. 예를 들어 문서에서 “승인 번호”가 어디에 있고, “납품일”이 어디에 있는지 표시해주면 모델이 그 패턴을 학습합니다.

구분 Prebuilt Model Custom Model
학습 필요 여부 필요 없음 사용자 데이터로 학습 필요
적합한 문서 영수증, 청구서, 신분증 등 일반 문서 회사 내부 양식, 특수 문서
장점 빠르게 사용 가능 업무 문서에 맞게 최적화 가능
한계 지원하지 않는 문서 형식에는 부정확할 수 있음 학습 데이터 준비와 검수가 필요함

정리하면, 먼저 사전 제작 모델로 해결 가능한지 확인하고, 부족하다면 맞춤형 모델을 고려하는 흐름이 자연스럽습니다.

7. Custom Extraction과 Custom Classifier

맞춤형 모델을 공부하다 보면 Custom Extraction과 Custom Classifier라는 표현이 나옵니다. 둘 다 Custom Model과 관련 있지만 역할은 다릅니다.

Custom Extraction

Custom Extraction은 문서에서 필요한 필드를 추출하는 모델입니다. 즉, “이 문서에서 어떤 값을 뽑아낼 것인가?”에 초점이 있습니다.

예를 들어 납품 확인서에서 납품일, 승인 번호, 담당자, 프로젝트 코드를 추출하고 싶다면 Custom Extraction 모델을 만들 수 있습니다.

Custom Classifier

Custom Classifier는 문서의 종류를 분류하는 모델입니다. 즉, “이 문서가 어떤 유형인가?”를 먼저 판단하는 역할입니다.

예를 들어 한 폴더 안에 계약서, 영수증, 신청서, 신분증이 섞여 있다고 해보겠습니다. 이때 Classifier는 문서를 먼저 분류하고, 그 다음에 문서 유형에 맞는 추출 모델을 적용할 수 있게 도와줍니다.

문서 업로드
→ Custom Classifier가 문서 유형 판단
→ 유형에 맞는 Custom Extraction 모델 선택
→ 필요한 필드 값 추출
→ JSON 결과 반환
구분 역할 예시
Custom Extraction 문서에서 필요한 필드 추출 계약서에서 계약일, 계약금액 추출
Custom Classifier 문서 유형 분류 업로드 문서가 영수증인지 계약서인지 판단
쉽게 기억하기
Classifier는 문서가 무엇인지 먼저 고르는 역할이고, Extraction은 그 문서 안에서 필요한 값을 뽑는 역할입니다.

8. Document Intelligence Studio

Document Intelligence Studio는 Document Intelligence 기능을 웹 화면에서 테스트하고 학습할 수 있는 도구입니다.

코드를 작성하지 않아도 문서를 업로드하고, 분석 모델을 선택하고, 결과를 확인할 수 있습니다.

처음 Document Intelligence를 공부할 때 Studio가 중요한 이유는 결과를 눈으로 확인할 수 있기 때문입니다. API를 바로 호출하면 JSON 결과가 길게 나오기 때문에 처음에는 어떤 정보가 어디에 있는지 이해하기 어렵습니다. Studio를 사용하면 문서 위에 인식된 텍스트나 영역이 시각적으로 표시되어 결과를 더 쉽게 파악할 수 있습니다.

Studio에서 확인할 수 있는 것

  • 문서에서 인식된 텍스트
  • 문서 안의 표 구조
  • 필드별 추출 결과
  • 바운딩 박스 위치
  • 분석 결과 JSON
  • 샘플 코드

여기서 바운딩 박스는 문서 안에서 특정 텍스트나 영역이 어디에 위치하는지를 나타내는 좌표 정보입니다. 예를 들어 영수증의 총액이 문서 오른쪽 아래에 있다면, 바운딩 박스는 그 위치를 좌표로 알려줍니다.

Studio는 개념을 이해하고 결과를 확인하는 데 좋고, REST API나 SDK는 실제 애플리케이션에 연결할 때 사용합니다. 이 둘은 역할이 다릅니다.

사용 방식 특징 적합한 상황
Document Intelligence Studio 웹 화면에서 문서 업로드 후 결과 확인 기능 이해, 모델 테스트, 결과 확인
REST API HTTP 요청으로 문서 분석 호출 웹 서비스나 자동화 시스템에 연결
SDK Python, JavaScript 등 코드에서 쉽게 사용 개발 코드에 안정적으로 통합

9. 실무 활용 사례

Document Intelligence는 문서가 많은 업무에서 특히 유용합니다. 단순히 문서를 읽는 것이 아니라, 문서 안의 정보를 시스템으로 옮기는 과정을 줄여주기 때문입니다.

영수증 자동 처리

직원이 제출한 영수증에서 결제일, 금액, 상호명, 세금 정보를 자동으로 추출할 수 있습니다. 추출된 데이터는 비용 정산 시스템에 바로 연결할 수 있습니다.

계약서 주요 정보 추출

계약서에서 계약 당사자, 계약일, 계약 기간, 금액, 주요 조항을 추출할 수 있습니다. 모든 조항을 자동으로 법률 판단하는 것은 어렵지만, 문서 검토 시간을 줄이는 보조 도구로 활용할 수 있습니다.

명함 데이터화

명함 이미지에서 이름, 회사명, 직책, 전화번호, 이메일 주소를 추출해 CRM 시스템에 저장할 수 있습니다.

신청서 처리 자동화

종이 신청서나 PDF 신청서에서 이름, 주소, 연락처, 신청 항목을 추출해 내부 업무 시스템으로 넘길 수 있습니다.

청구서와 송장 처리

Invoice 모델을 이용하면 공급자 정보, 청구 금액, 품목, 세금 정보를 추출할 수 있습니다. 회계나 구매 업무에서 반복 입력을 줄이는 데 도움이 됩니다.

주의
Document Intelligence 결과를 무조건 정답으로 사용하면 안 됩니다. 문서 품질, 스캔 상태, 글자 크기, 양식 차이에 따라 결과가 틀릴 수 있습니다. 중요한 업무에서는 사람이 검수하는 단계나 confidence score 기준을 함께 설계하는 것이 좋습니다.

10. 정리

Azure AI Document Intelligence는 문서를 데이터로 바꾸는 서비스입니다. PDF, 이미지, 스캔 문서에서 텍스트와 구조를 추출하고, 필요한 정보를 JSON 같은 형태로 반환합니다.

단순 OCR이 글자를 읽는 데 초점을 둔다면, Document Intelligence는 문서 안의 구조와 의미 있는 필드를 함께 분석합니다. 그래서 영수증, 청구서, 신분증, 명함, 계약서, 신청서처럼 반복적으로 처리해야 하는 문서 업무에 적합합니다.

처음에는 Read, Layout, General Documents 같은 기본 문서 분석 모델을 이해하고, 그 다음에 Prebuilt Model과 Custom Model을 구분하면 전체 구조가 훨씬 명확해집니다. 일반적인 문서 유형은 사전 제작 모델을 먼저 사용하고, 회사 내부 양식처럼 특수한 문서는 맞춤형 모델을 고려하는 흐름이 좋습니다.

11. 전체 흐름 한 번에 정리

문서 입력
→ Document Intelligence로 분석
→ Read 모델로 텍스트 추출
→ Layout 모델로 구조와 표 분석
→ Prebuilt Model로 특정 문서 유형 분석
→ 필요하면 Custom Model 학습
→ 필드 값과 결과를 JSON으로 반환
→ 데이터베이스, 검수 화면, 업무 시스템에 활용

실무 관점에서 Document Intelligence는 문서를 읽는 기능이라기보다, 문서 기반 업무를 자동화하기 위한 데이터 추출 계층에 가깝습니다. 문서 안에 갇혀 있던 정보를 꺼내서 시스템이 처리할 수 있는 형태로 바꾸는 것이 핵심입니다.

12. 핵심 키워드 정리

키워드 의미
Document Intelligence 문서에서 텍스트, 구조, 필드 정보를 추출하는 Azure 문서 AI 서비스
Form Recognizer Document Intelligence의 이전 이름
OCR 이미지나 스캔 문서에서 글자를 인식하는 기술
Read 문서에서 텍스트를 추출하는 분석 모델
Layout 문서의 배치, 표, 문단 구조를 분석하는 모델
General Documents 일반 문서에서 텍스트, 표, 키-값 쌍을 추출하는 모델
Prebuilt Model 영수증, 청구서, 신분증 등 특정 문서 유형에 맞게 미리 만들어진 모델
Custom Model 사용자 문서와 레이블 데이터를 바탕으로 학습하는 맞춤형 모델
Custom Extraction 문서에서 필요한 필드 값을 추출하는 맞춤형 모델
Custom Classifier 문서가 어떤 유형인지 분류하는 맞춤형 모델
Structured Data 시스템이 항목별로 처리하기 쉬운 구조화된 데이터
JSON 분석 결과를 프로그램에서 활용하기 쉬운 key-value 형태로 표현하는 데이터 형식

13. 다음 글 예고

이번 글에서는 Azure AI Document Intelligence가 무엇이고, OCR과 어떤 차이가 있으며, Read, Layout, Prebuilt Model, Custom Model이 어떤 역할을 하는지 정리했습니다. 다음 글에서는 Document Intelligence Studio 실습을 다뤄보겠습니다. 실제로 Studio에서 문서를 업로드하고, Read와 Layout 모델을 사용해 분석 결과를 확인하는 흐름을 살펴보겠습니다.