본문 바로가기
Azure AI Services Engineering

[ Azure AI Services #1 ] Azure AI Services란? 문서·언어·음성·비전 AI 전체 지도 그리기

by yunalee-dev 2026. 6. 18.

Azure를 공부하다 보면 비슷한 이름의 서비스가 계속 등장합니다.

Azure AI Services, Azure OpenAI, Azure AI Studio, Microsoft Foundry, Cognitive Services, Document Intelligence, AI Language, AI Speech, AI Vision까지 이름만 봐도 조금 헷갈립니다.

 

이 글에서는 각각의 서비스를 깊게 파고들기 전에, 먼저 전체 지도를 그려보려고 합니다.

처음부터 세부 기능으로 들어가면 길을 잃기 쉽기 때문에, 이번 글에서는 Azure AI Services가 무엇이고, 어떤 종류의 AI 기능을 제공하며, 실제 개발에서는 어떤 구조로 사용하는지를 중심으로 정리하겠습니다.

이 글의 핵심 질문
Azure AI Services는 문서, 언어, 음성, 비전 같은 AI 기능을 직접 모델부터 만들지 않고도 API 형태로 가져다 쓸 수 있게 해주는 Azure의 AI 서비스 묶음입니다.

1. Azure AI Services란?

Azure AI Services는 Microsoft Azure에서 제공하는 AI 기능 모음입니다.

조금 쉽게 말하면, 내가 직접 AI 모델을 처음부터 학습시키지 않아도 문서 분석, 텍스트 분석, 음성 인식, 이미지 분석 같은 기능을 API로 가져다 쓸 수 있게 해주는 서비스입니다.

예를 들어 영수증 이미지를 보고 금액과 날짜를 뽑고 싶다고 해보겠습니다.

직접 OCR 모델을 만들고, 문서 구조를 분석하고, 날짜와 금액을 구분하는 모델까지 학습하려면 꽤 복잡합니다.

하지만 Azure AI Services를 사용하면 이미 준비된 문서 분석 기능을 호출해서 결과를 받을 수 있습니다.

이때 중요한 점은 Azure AI Services가 하나의 단일 기능이 아니라는 것입니다. 문서, 언어, 음성, 비전, 번역, 콘텐츠 안전 등 여러 AI 기능을 묶어서 부르는 큰 이름에 가깝습니다.

비유해서 이해하기
Azure AI Services는 AI 기능이 모여 있는 도구 상자라고 볼 수 있습니다.
문서를 읽는 도구, 말을 텍스트로 바꾸는 도구, 이미지를 분석하는 도구, 텍스트를 번역하는 도구가 각각 들어 있고, 개발자는 필요한 도구를 꺼내 API로 사용합니다.

2. Azure에서 제공하는 AI 서비스 종류

Azure AI Services 안에는 다양한 서비스가 포함됩니다. 대표적으로 많이 다루는 서비스는 다음과 같습니다.

서비스 주요 기능 예시
Document Intelligence 문서에서 텍스트, 표, 필드, 구조화된 데이터 추출 영수증, 계약서, 청구서 분석
AI Language 텍스트 이해, 감정 분석, 엔티티 추출, 요약 리뷰 감정 분석, 개인정보 탐지
AI Speech 음성 인식, 음성 합성, 발음 평가, 음성 번역 회의록 자동 작성, TTS 음성 생성
AI Vision 이미지 분석, OCR, 객체 감지, 얼굴 감지 이미지 설명 생성, CCTV 객체 탐지
Translator 텍스트와 문서 번역 다국어 고객지원
Content Safety 유해 콘텐츠 탐지 댓글, 이미지, 생성형 AI 출력 검수

여기서 중요한 흐름은 입력 데이터의 종류입니다.

문서가 들어오면 Document Intelligence, 텍스트가 들어오면 AI Language, 음성이 들어오면 AI Speech, 이미지나 비디오가 들어오면 AI Vision을 떠올리면 됩니다.

3. Document / Language / Speech / Vision으로 나누어 보기

Azure AI Services를 처음 공부할 때는 서비스 이름을 하나씩 외우기보다, 데이터 형태별로 나누어 보는 것이 훨씬 쉽습니다.

AI 서비스는 결국 어떤 입력을 받아서 어떤 결과를 내는지가 핵심이기 때문입니다.

Document Intelligence: 문서를 데이터로 바꾸는 서비스

Document Intelligence는 PDF, 이미지, 스캔 문서처럼 사람이 보기에는 문서지만 컴퓨터가 바로 다루기 어려운 자료를 분석합니다.

예를 들어 영수증에서 날짜, 상호명, 금액을 뽑거나 계약서에서 주요 항목을 추출할 수 있습니다.

단순히 글자를 읽는 OCR에서 한 단계 더 나아가, 문서 안의 구조를 파악하고 필요한 정보를 필드 형태로 정리하는 데 초점이 있습니다.

AI Language: 텍스트의 의미를 이해하는 서비스

AI Language는 텍스트를 분석합니다. 예를 들어 고객 리뷰가 긍정인지 부정인지 판단하거나, 문장 안에서 사람 이름, 장소, 날짜, 이메일 주소 같은 정보를 찾아낼 수 있습니다.

텍스트를 그냥 문자열로 보는 것이 아니라, 그 안에 들어 있는 의미와 구조를 뽑아내는 서비스라고 보면 됩니다.

AI Speech: 음성을 텍스트와 음성으로 변환하는 서비스

AI Speech는 음성과 관련된 기능을 제공합니다. 사람의 말을 텍스트로 바꾸는 Speech to Text(STT), 텍스트를 사람처럼 들리는 음성으로 바꾸는 Text to Speech(TTS), 발음 평가, 화자 인식, 음성 번역 등이 여기에 포함됩니다.

회의 녹음 파일을 텍스트로 변환하거나, 교육 앱에서 발음 점수를 제공하거나, 안내 음성을 자동 생성하는 상황에서 사용할 수 있습니다.

AI Vision: 이미지와 비디오를 이해하는 서비스

AI Vision은 이미지나 비디오에서 정보를 추출합니다. 이미지 안의 객체를 찾고, 이미지 설명을 만들고, 이미지 속 텍스트를 읽고, 얼굴이나 장면을 분석할 수 있습니다.

예를 들어 제조 현장에서 불량품을 탐지하거나, 사진 속 텍스트를 추출하거나, 이미지 검색 서비스를 만들 때 활용할 수 있습니다.

구분 입력 출력 대표 활용
Document Intelligence PDF, 이미지 문서 텍스트, 표, 필드, JSON 문서 자동화
AI Language 텍스트 감정, 엔티티, 요약, 분류 텍스트 분석
AI Speech 음성, 텍스트 텍스트, 음성, 번역 결과 음성 인식과 합성
AI Vision 이미지, 비디오 객체, 텍스트, 캡션, 얼굴 정보 이미지 분석

4. Studio, Foundry, REST API, SDK의 사용 방식의 차이

Azure AI Services를 사용하다 보면 기능 이름만큼이나 사용 방식도 여러 가지로 나옵니다.

대표적으로 Studio, Foundry, REST API, SDK가 있습니다.

이 네 가지는 서로 경쟁하는 개념이라기보다, 같은 AI 기능을 사용하는 서로 다른 입구라고 이해하면 좋습니다.

Studio: 웹 화면에서 바로 실습하는 방식

Studio는 웹 브라우저에서 클릭하면서 AI 기능을 테스트할 수 있는 환경입니다.

코드를 작성하기 전에 “이 기능이 어떤 결과를 내는지” 빠르게 확인하기 좋습니다.

예를 들어 Document Intelligence Studio에서는 문서를 업로드하고, 분석 결과를 화면에서 바로 확인할 수 있습니다.

Language Studio에서는 텍스트를 넣고 NER, 감정 분석, 요약 결과를 확인할 수 있습니다.

Microsoft Foundry: AI 프로젝트를 만들고 관리하는 통합 환경

Microsoft Foundry는 여러 AI 기능을 프로젝트 단위로 구성하고 실습할 수 있는 통합 플랫폼에 가깝습니다.

특히 최근 Azure AI 관련 실습에서는 Foundry를 통해 허브와 프로젝트를 만들고, 필요한 AI 서비스를 연결하는 흐름이 자주 등장합니다.

Studio가 개별 기능을 바로 테스트하는 느낌이라면, Foundry는 AI 기능을 프로젝트 안에 묶어서 관리하는 느낌에 가깝습니다.

REST API: HTTP 요청으로 AI 기능을 호출하는 방식

REST API는 개발자가 직접 HTTP 요청을 보내 Azure AI 기능을 사용하는 방식입니다.

프론트엔드, 백엔드, 데이터 파이프라인, 자동화 스크립트 어디서든 호출할 수 있다는 장점이 있습니다.

API 호출은 대략 다음 흐름으로 이루어집니다.

사용자 입력 데이터
→ Azure AI Service Endpoint로 요청 전송
→ API Key로 인증
→ Azure AI 모델이 분석 수행
→ JSON 형태의 결과 반환
→ 애플리케이션에서 결과 활용

SDK: Python, JavaScript 같은 언어에서 쉽게 쓰도록 만든 도구

SDK는 REST API를 더 편하게 사용할 수 있도록 만든 라이브러리입니다.

REST API를 직접 호출하려면 헤더, 인증, 요청 형식, 응답 파싱을 직접 관리해야 합니다.

SDK를 사용하면 이런 부분을 코드 라이브러리가 대신 처리해줍니다.

구분 특징 언제 쓰면 좋은가
Studio 웹 화면에서 기능 테스트 처음 기능을 이해할 때
Foundry 허브와 프로젝트 기반 AI 개발 환경 여러 AI 서비스를 프로젝트로 관리할 때
REST API HTTP 요청으로 직접 호출 서비스나 앱에 연결할 때
SDK 프로그래밍 언어별 라이브러리 코드에서 더 편하게 사용할 때

5. Azure 리소스 구조: 구독, 리소스 그룹, 리소스

Azure AI Services를 실제로 사용하려면 Azure 안에서 리소스를 만들어야 합니다. 이때 자주 나오는 구조가 구독, 리소스 그룹, 리소스입니다.

처음에는 이 구조가 낯설 수 있지만, 폴더 구조처럼 생각하면 이해하기 쉽습니다.

Azure 구독
└── 리소스 그룹
    ├── Document Intelligence 리소스
    ├── Language 리소스
    ├── Speech 리소스
    └── Vision 리소스

구독은 Azure 서비스를 사용할 수 있는 큰 계정 단위입니다. 리소스 그룹은 관련된 리소스를 묶어 관리하는 폴더 같은 역할을 합니다. 리소스는 실제로 생성한 하나의 서비스 단위입니다.

예를 들어 문서 분석 실습을 한다면 Document Intelligence 리소스를 만들고, 음성 인식 실습을 한다면 Speech 리소스를 만드는 식입니다.

리소스 그룹이 필요한 이유
리소스 그룹을 사용하면 관련된 서비스들을 한 곳에서 관리할 수 있습니다. 실습이 끝난 뒤 비용이 계속 발생하지 않도록 리소스 그룹 단위로 정리하기도 쉽습니다.

6. Endpoint와 API Key

Azure AI Services를 코드에서 사용하려면 대부분 EndpointAPI Key가 필요합니다.

Endpoint는 요청을 보낼 주소입니다. 즉, 내가 만든 Azure AI 서비스가 어디에 있는지 알려주는 URL입니다.

API Key는 이 서비스를 사용할 권한이 있는지 확인하는 비밀 키입니다. 쉽게 말하면 Endpoint가 “문 앞 주소”라면, API Key는 “문을 열 수 있는 열쇠”입니다.

개념 의미 비유
Endpoint API 요청을 보낼 서비스 주소 가게 주소
API Key 서비스 사용 권한을 확인하는 인증 키 출입 열쇠
Region 리소스가 배포된 지역 가게가 있는 도시

API Key는 절대 블로그, GitHub, 공개 코드에 그대로 올리면 안 됩니다. 키가 노출되면 다른 사람이 내 Azure 리소스를 사용할 수 있고, 그 비용이 내 계정에 청구될 수 있습니다.

주의
API Key는 비밀번호처럼 관리해야 합니다. 실습 코드에서는 환경 변수나 별도의 설정 파일을 사용하고, 공개 저장소에는 절대 올리지 않는 것이 좋습니다.

7. Region을 선택할 때 주의할 점

Azure에서 리소스를 만들 때는 Region, 즉 지역을 선택해야 합니다.

예를 들어 Korea Central, East US, East US2, West Europe 같은 지역을 고르게 됩니다.

Region은 단순히 서버 위치만 의미하지 않습니다. 어떤 지역을 선택하느냐에 따라 사용할 수 있는 AI 기능, API 버전, 모델 종류가 달라질 수 있습니다.

예를 들어 어떤 기능은 East US에서는 지원되지만 Korea Central에서는 아직 지원되지 않을 수 있습니다. 또 어떤 실습은 특정 Region에서만 오류 없이 진행되는 경우도 있습니다.

Region 선택 시 확인할 것

  • 내가 사용하려는 서비스가 해당 Region에서 지원되는지
  • 실습 자료에서 권장하는 Region이 있는지
  • API 버전이 Region별로 다른지
  • 무료 계층을 사용할 수 있는지
  • 데이터가 저장되는 위치에 민감한 서비스인지
실습에서 자주 생기는 문제
리소스를 만들었는데 Studio에서 연결이 안 되거나, 특정 기능이 보이지 않는 경우가 있습니다. 이때는 코드보다 먼저 Region, 리소스 종류, API 버전, 권한 설정을 확인하는 것이 좋습니다.

8. 이번 시리즈에서 다룰 전체 흐름

이번 시리즈에서는 Azure AI Services를 기능별로 나누어 공부할 예정입니다. 이번 글이 전체 지도를 그리는 글이라면, 다음 글부터는 각 서비스가 실제로 어떤 문제를 해결하는지 하나씩 살펴봅니다.

전체 흐름은 다음과 같습니다.

순서 주제 핵심 질문
1 Azure AI Services 전체 구조 Azure AI Services는 무엇이고 어떻게 나뉘는가?
2 Gradio AI 실습 결과를 웹 화면으로 어떻게 보여줄까?
3 Document Intelligence 문서를 어떻게 구조화된 데이터로 바꿀까?
4 AI Language 텍스트에서 의미와 정보를 어떻게 추출할까?
5 AI Speech 음성을 텍스트와 음성으로 어떻게 변환할까?
6 AI Vision 이미지와 비디오에서 정보를 어떻게 읽을까?

9. 정리

Azure AI Services는 문서, 언어, 음성, 비전처럼 자주 필요한 AI 기능을 API 형태로 제공하는 서비스 묶음입니다. 개발자는 AI 모델을 처음부터 만들지 않아도, Azure에서 제공하는 사전 학습된 기능을 호출해 애플리케이션에 연결할 수 있습니다.

중요한 것은 서비스 이름을 외우는 것이 아니라, 어떤 입력 데이터를 어떤 결과로 바꾸는지 이해하는 것입니다. 문서는 Document Intelligence, 텍스트는 AI Language, 음성은 AI Speech, 이미지는 AI Vision으로 생각하면 전체 구조가 훨씬 명확해집니다.

10. 전체 흐름 한 번에 정리

Azure AI Services
→ 문서, 언어, 음성, 비전 AI 기능 제공
→ Azure Portal에서 리소스 생성
→ Endpoint와 API Key 확인
→ Studio 또는 Foundry에서 기능 테스트
→ REST API 또는 SDK로 애플리케이션에 연결
→ 결과를 JSON, 텍스트, 음성, 이미지 분석 결과 등으로 활용

실무 관점에서 보면 Azure AI Services는 “AI 모델을 직접 만드는 단계”보다 “이미 준비된 AI 기능을 내 서비스에 안정적으로 연결하는 단계”에 가깝습니다. 그래서 데이터 엔지니어링이나 백엔드 개발 관점에서도 API 호출, 리소스 관리, 데이터 흐름 설계가 중요해집니다.

11. 핵심 키워드 정리

키워드 의미
Azure AI Services 문서, 언어, 음성, 비전 등 AI 기능을 API로 제공하는 Azure 서비스 묶음
Cognitive Services Azure AI Services의 이전 또는 관련 명칭으로 자주 언급되는 인지 서비스 개념
Document Intelligence 문서에서 텍스트, 표, 필드 정보를 추출하는 문서 AI 서비스
AI Language 텍스트에서 감정, 엔티티, 핵심 구문, 요약 등을 추출하는 NLP 서비스
AI Speech 음성 인식, 음성 합성, 발음 평가, 음성 번역을 제공하는 서비스
AI Vision 이미지와 비디오에서 객체, 텍스트, 캡션, 얼굴 정보를 분석하는 서비스
Studio 웹 화면에서 AI 기능을 테스트할 수 있는 실습 환경
Microsoft Foundry AI 서비스를 프로젝트 단위로 만들고 실습할 수 있는 통합 환경
REST API HTTP 요청으로 Azure AI 기능을 호출하는 방식
SDK 프로그래밍 언어에서 Azure AI 기능을 쉽게 사용하도록 만든 라이브러리
Resource Group 관련 Azure 리소스를 묶어 관리하는 단위
Endpoint API 요청을 보낼 Azure AI 서비스 주소
API Key Azure AI 서비스를 사용할 권한을 확인하는 인증 키
Region Azure 리소스가 배포되는 지역으로, 기능 지원 여부에 영향을 줄 수 있음

12. 다음 글 예고

이번 글에서는 Azure AI Services의 전체 구조를 먼저 정리했습니다. 다음 글에서는 여러 AI 실습에서 반복적으로 사용되는 Gradio를 다뤄보겠습니다. CLI에서 결과를 확인하는 방식과 웹 GUI로 결과를 보여주는 방식이 어떻게 다른지, 그리고 Gradio를 사용하면 AI 실습 화면을 얼마나 쉽게 만들 수 있는지 알아보겠습니다.