본문 바로가기
Azure AI Services Engineering/Speech

[ Azure AI Serivces #10 ] Azure AI Speech란? 음성을 텍스트, 번역, 의도 인식으로 확장하기

by yunalee-dev 2026. 6. 20.

이전 글에서는 Azure AI Language를 사용해 텍스트를 분석하는 방법을 살펴봤습니다.

NER은 문장에서 사람이나 장소를 찾고, PII는 개인정보를 탐지하고, 감정 분석은 문장의 분위기를 판단했습니다.

 

이번 글에서는 입력 데이터가 텍스트가 아니라 음성일 때 사용하는 서비스인 Azure AI Speech를 정리해보겠습니다.

Azure AI Speech는 단순히 음성을 텍스트로 바꾸는 기능만 제공하는 것이 아닙니다.

음성을 번역하고, 발음을 평가하고, 사용자의 의도를 파악하고, 특정 화자를 인식하는 기능까지 포함합니다.

 

이번 글은 실습 코드로 바로 들어가기보다는, Azure AI Speech가 제공하는 기능을 전체 지도처럼 훑어보는 글입니다. Speech Studio 실습, REST API 호출, Gradio 앱 구현은 다음 글에서 따로 다루겠습니다.

이번 글의 핵심 질문
Azure AI Speech는 음성을 단순히 텍스트로 바꾸는 서비스일까요?
아니면 음성을 바탕으로 번역, 발음 평가, 의도 인식, 화자 인식까지 확장할 수 있는 서비스일까요?
이번 글에서는 Azure AI Speech의 주요 기능을 하나씩 연결해서 이해해보겠습니다.

1. Azure AI Speech란?

Azure AI Speech는 음성과 관련된 여러 AI 기능을 제공하는 Azure AI 서비스입니다.

가장 대표적인 기능은 음성을 텍스트로 바꾸는 Speech to Text입니다. 하지만 여기서 끝나지 않습니다!!!

 

예를 들어 콜센터 녹음 파일이 있다고 해보겠습니다. 단순히 녹음 파일을 글자로 바꾸는 것만으로도 유용하지만, 실무에서는 보통 그 다음 단계가 더 중요합니다. 누가 말했는지, 어떤 언어로 말했는지, 고객이 어떤 요청을 했는지, 불만인지 칭찬인지, 다른 언어로 번역해야 하는지까지 이어집니다.

 

Azure AI Speech는 이런 흐름을 하나의 음성 처리 파이프라인으로 확장할 수 있게 해줍니다.

그래서 음성 서비스는 단순히 “말을 글자로 바꾸는 기능”이라기보다, 음성을 업무에 활용 가능한 데이터로 바꾸는 서비스라고 이해하는 것이 좋습니다.

기능 무엇을 하는가 대표 활용
Speech to Text 음성을 텍스트로 변환 회의록, 상담 기록, 자막 생성
Text to Speech 텍스트를 음성으로 변환 AI 상담원, 안내 방송, 오디오 콘텐츠
Speech Translation 음성을 다른 언어로 번역 실시간 통역, 다국어 회의
Pronunciation Assessment 발음 정확도 평가 영어 학습 앱, 발음 훈련 서비스
Intent Recognition 사용자가 하려는 작업 파악 음성 명령, 챗봇, 콜센터 라우팅

한 줄로 정리하면
Azure AI Speech는 음성을 텍스트, 번역, 합성 음성, 발음 평가, 의도 인식 등으로 확장해주는 음성 AI 서비스입니다.

2. Speech to Text

Speech to Text, 줄여서 STT는 음성을 텍스트로 바꾸는 기능입니다.

마이크로 입력한 말이나 녹음된 오디오 파일을 글자로 변환합니다.

 

가장 쉽게 떠올릴 수 있는 예시는 회의록입니다. 회의 내용을 녹음한 뒤 사람이 직접 받아쓰면 시간이 오래 걸립니다. STT를 사용하면 녹음된 음성을 텍스트로 변환하고, 그 결과를 요약, 검색, 분석에 활용할 수 있습니다.

실시간 처리와 배치 처리의 차이

STT는 크게 실시간 처리배치 처리로 나눠볼 수 있습니다. 실시간 처리는 사용자가 말하는 동안 거의 즉시 텍스트를 보여주는 방식입니다. 반면 배치 처리는 이미 녹음된 파일을 나중에 한꺼번에 처리하는 방식입니다.

구분 실시간 Speech to Text 배치 Speech to Text
입력 마이크나 실시간 오디오 스트림 녹음된 오디오 파일
처리 방식 말하는 중에 바로 텍스트 변환 파일을 업로드한 뒤 한꺼번에 변환
적합한 상황 실시간 자막, 라이브 회의, 음성 명령 콜센터 녹취 분석, 강의 녹음 변환, 대량 파일 처리
중요한 기준 지연 시간 대량 처리 효율과 정확도

예시
온라인 회의에서 말하는 내용을 바로 자막으로 보여주려면 실시간 STT가 적합합니다. 반대로 하루치 상담 녹음 파일을 밤에 한꺼번에 텍스트로 바꾸려면 배치 STT가 더 적합합니다.

3. Text to Speech

Text to Speech, 줄여서 TTS는 텍스트를 음성으로 바꾸는 기능입니다.

 

STT가 “말을 글자로 바꾸는 기능”이라면, TTS는 반대로 “글자를 말로 바꾸는 기능”입니다.

예를 들어 고객센터 챗봇이 답변을 텍스트로만 보여주는 대신, 사람처럼 음성으로 안내해준다고 생각해보겠습니다.

이때 사용되는 기능이 TTS입니다. 내비게이션 안내 음성, 오디오북, AI 상담원, 키오스크 음성 안내에서도 TTS가 많이 사용됩니다.

Neural TTS와 일반 TTS의 차이

예전 TTS는 문장을 읽기는 하지만 억양이 어색하고 기계음처럼 들리는 경우가 많았습니다.

Neural TTS는 이런 부자연스러움을 줄이기 위해 신경망 기반으로 음성을 합성하는 방식입니다.

구분 일반 TTS Neural TTS
음성 느낌 상대적으로 기계적 사람 말투에 더 가까움
억양 처리 부자연스러울 수 있음 문맥에 맞는 억양 표현 가능
활용 단순 안내 음성 상담원, 오디오 콘텐츠, 브랜드 음성

TTS에서 중요한 것은 단순히 글자를 읽는 것이 아닙니다. 듣는 사람이 자연스럽게 이해할 수 있도록 말의 속도, 높낮이, 쉼, 강조를 조절하는 것이 중요합니다. 이때 SSML이라는 설정 언어가 함께 사용됩니다.

4. Speech Translation

Speech Translation은 음성을 다른 언어로 번역하는 기능입니다.

단순히 텍스트 번역만 하는 것이 아니라, 음성 입력을 받아 텍스트로 변환하고, 그 내용을 다른 언어로 바꾸는 흐름을 만들 수 있습니다.

 

예를 들어 영어 회의를 한국어 자막으로 보여주거나, 한국어 음성을 영어 텍스트로 변환하는 기능을 만들 수 있습니다. 더 확장하면 음성을 다른 언어의 음성으로 변환하는 구조도 생각해볼 수 있습니다.

방식 흐름 예시
음성 → 텍스트 번역 음성 인식 후 번역 텍스트 출력 영어 발표를 한국어 자막으로 표시
음성 → 음성 번역 음성 인식, 번역, 음성 합성 연결 한국어를 영어 음성으로 전달
다국어 음성 번역 하나의 입력을 여러 언어로 번역 국제 회의 실시간 통역

핵심 흐름
Speech Translation은 STT와 Translator가 연결된 구조로 이해하면 쉽습니다. 먼저 음성을 텍스트로 바꾸고, 그 텍스트를 목표 언어로 번역하는 흐름입니다.

5. Pronunciation Assessment

Pronunciation Assessment는 발음 평가 기능입니다.

사용자가 문장을 읽으면 AI가 발음이 얼마나 정확한지, 얼마나 자연스러운지 평가합니다.

 

이 기능은 언어 학습 서비스에서 특히 유용합니다. 예를 들어 영어 학습 앱에서 학습자가 “I would like to book a flight”라고 읽으면, AI가 발음 정확도, 유창성, 누락된 단어, 잘못 발음한 단어 등을 평가해줄 수 있습니다.

평가 항목 의미 활용 예시
정확도 단어와 발음이 얼마나 맞는지 잘못 발음한 단어 표시
유창성 말이 얼마나 자연스럽게 이어지는지 끊어 읽기, 속도 피드백
완성도 읽어야 할 문장을 빠뜨리지 않았는지 누락 단어 확인

발음 평가는 단순히 점수를 주는 기능이 아니라, 학습자가 어떤 부분을 다시 연습해야 하는지 알려주는 피드백 도구에 가깝습니다. 그래서 교육 서비스나 말하기 평가 서비스에 잘 맞습니다.

6. Intent Recognition

Intent Recognition 사용자가 하려는 작업을 파악하는 기능입니다. 여기서 Intent는 “의도”라는 뜻입니다. 예를 들어 사용자가 “내일 날씨 알려줘”라고 말하면 Intent는 날씨 조회입니다. “엄마에게 전화 걸어줘”라고 말하면 Intent는 전화 걸기입니다.

 

이 기능은 앞에서 다룬 CLU와도 연결됩니다. CLU는 텍스트 기반으로 사용자의 의도를 분류하는 기능입니다.

Speech의 Intent Recognition은 음성 입력에서 시작한다는 점이 다릅니다.

즉, 음성을 먼저 텍스트로 바꾼 뒤, 그 텍스트의 의도를 해석하는 구조로 이해할 수 있습니다.

사용자 음성 인식된 텍스트 Intent
“내일 날씨 알려줘” 내일 날씨 알려줘 날씨 조회
“회의실 예약해줘” 회의실 예약해줘 예약 생성
“고객센터 연결해줘” 고객센터 연결해줘 상담원 연결

겹침 방지 포인트
CLU 글에서는 텍스트 기반 의도 분류를 중심으로 설명했습니다. 이 글에서는 음성 입력에서 출발해 의도를 인식하는 흐름만 간단히 연결합니다. 자세한 Intent 설계와 Entity 추출은 CLU 글에서 다루는 것이 좋습니다.

7. Speaker Recognition

Speaker Recognition은 말하는 사람이 누구인지 식별하거나 확인하는 기능입니다. 여기서 헷갈리기 쉬운 점이 있습니다. 음성 인식과 화자 인식은 다릅니다.

음성 인식은 “무슨 말을 했는가”를 알아내는 기능입니다. 반면 화자 인식은 “누가 말했는가”를 알아내는 기능입니다.

구분 질문 예시
Speech Recognition 무슨 말을 했는가? “주문 취소하고 싶어요”를 텍스트로 변환
Speaker Recognition 누가 말했는가? 등록된 사용자 A의 목소리인지 확인

화자 인식은 보통 두 가지 흐름으로 나뉩니다. 하나는 “이 사람이 맞는지 확인하는 것”이고, 다른 하나는 “여러 사람 중 누구인지 식별하는 것”입니다.

구분 의미 예시
Speaker Verification 주장한 사용자가 맞는지 검증 “이 목소리가 민수인가?”
Speaker Identification 등록된 사람 중 누구인지 식별 “이 목소리는 등록된 사람 중 누구인가?”

8. Keyword Recognition

Keyword Recognition은 오디오에서 특정 단어나 짧은 문구를 감지하는 기능입니다. 다른 말로는 키워드 스팟팅이라고도 합니다.

가장 익숙한 예시는 호출어입니다. 스마트 스피커에서 “Hey Cortana”, “Alexa”, “시리야”처럼 특정 단어를 말하면 기기가 깨어납니다. 이때 필요한 것이 Keyword Recognition입니다.

예시
사용자가 “헤이 코타나, 오늘 일정 알려줘”라고 말하면, 먼저 “헤이 코타나”라는 키워드를 감지하고, 그다음 “오늘 일정 알려줘”라는 명령을 처리하는 흐름으로 이어질 수 있습니다.

이 기능은 항상 전체 음성을 서버로 보내 분석하는 구조보다 효율적일 수 있습니다. 먼저 기기에서 호출어를 감지하고, 필요할 때만 이후 음성 명령을 처리하는 방식으로 설계할 수 있기 때문입니다.

9. Language Identification

Language Identification은 오디오에서 어떤 언어가 사용되었는지 식별하는 기능입니다. 텍스트 분석에서도 언어 감지가 중요하듯이, 음성 분석에서도 먼저 사용 언어를 알아야 정확한 인식과 번역을 할 수 있습니다.

예를 들어 다국어 고객센터를 생각해보겠습니다. 고객이 한국어로 말하는지, 영어로 말하는지, 일본어로 말하는지 먼저 파악해야 적절한 STT 모델이나 번역 흐름으로 연결할 수 있습니다.

사용 상황 언어 식별이 필요한 이유 후속 처리
다국어 콜센터 고객이 어떤 언어로 말하는지 알아야 함 언어별 상담 라우팅
실시간 번역 입력 언어를 알아야 번역 가능 목표 언어로 번역
회의 기록 참석자들이 여러 언어를 사용할 수 있음 언어별 자막 생성

10. Whisper와 Azure Speech

음성 인식 이야기를 하면 Whisper도 자주 등장합니다.

Whisper는 OpenAI의 음성 인식 모델입니다. Azure에서는 기존 Azure Speech STT뿐 아니라 Whisper 모델도 사용할 수 있는 흐름이 제공됩니다.

그렇다면 Azure Speech STT와 Whisper는 어떻게 구분해서 보면 좋을까요? 아주 단순하게 말하면, Azure Speech STT는 Azure Speech 생태계 안에서 실시간 처리, 배치 처리, 커스텀 모델, 화자 관련 기능 등과 함께 쓰기 좋고, Whisper는 다양한 언어와 일반적인 음성 인식 품질 측면에서 강점이 있는 모델로 이해할 수 있습니다.

구분 Azure Speech STT Whisper
주요 목적 Azure Speech 기반 음성 인식 OpenAI 기반 범용 음성 인식
강점 실시간 처리, 배치 처리, 커스텀, Speech 생태계 연동 다국어 음성 인식과 일반 음성 전사에 강점
적합한 상황 엔터프라이즈 음성 서비스, 실시간 자막, 콜센터 다양한 언어의 오디오 전사, 범용 파일 변환

주의
Whisper와 Azure Speech STT는 무조건 하나가 더 좋다고 보기보다, 사용 시나리오에 맞게 선택해야 합니다. 실시간 서비스인지, 파일 전사인지, 화자 분리나 커스텀이 필요한지에 따라 선택이 달라질 수 있습니다.

11. SSML로 음성 제어하기

SSML은 Speech Synthesis Markup Language의 약자입니다. 텍스트를 음성으로 바꿀 때 발음, 속도, 억양, 볼륨, 쉼표 같은 요소를 세밀하게 조절하기 위한 마크업 언어입니다.

 

그냥 텍스트만 TTS에 넣으면 모델이 알아서 읽습니다. 하지만 실제 서비스에서는 “여기는 천천히 읽어야 한다”, “이 단어는 강조해야 한다”, “전화번호는 숫자 하나씩 읽어야 한다” 같은 요구가 생깁니다. 이때 SSML을 사용합니다.

<speak version="1.0" xml:lang="ko-KR">
  <voice name="ko-KR-SunHiNeural">
    안녕하세요.
    <break time="500ms"/>
    Azure AI Speech 실습을 시작합니다.
    <prosody rate="slow" pitch="+2st">
      이 문장은 조금 천천히 읽습니다.
    </prosody>
  </voice>
</speak>
SSML 요소 역할 사용 예시
voice 사용할 음성 선택 한국어 여성 음성 선택
break 잠시 멈춤 문장 사이 0.5초 쉬기
prosody 속도, 높낮이, 볼륨 조절 천천히 읽기, 높게 읽기
emphasis 특정 단어 강조 중요 안내 강조

SSML은 단순히 목소리를 예쁘게 만드는 도구가 아닙니다. 사용자가 정보를 더 잘 이해하도록 음성의 전달 방식을 설계하는 도구입니다. 안내 방송, 교육 콘텐츠, 상담 자동화에서는 SSML의 역할이 꽤 중요합니다.

12. Speech 기능 비교

지금까지 본 기능들을 한 번에 비교해보면 Azure AI Speech의 역할이 더 명확해집니다. 핵심은 입력과 출력이 무엇인지 보는 것입니다.

기능 입력 출력 대표 활용
Speech to Text 음성 텍스트 자막, 회의록, 상담 기록
Text to Speech 텍스트 음성 AI 안내, 오디오북, 음성 응답
Speech Translation 음성 번역 텍스트 또는 번역 음성 통역, 다국어 회의
Pronunciation Assessment 학습자 음성 발음 평가 결과 언어 학습 앱
Intent Recognition 음성 명령 사용자 의도 음성 비서, 챗봇
Speaker Recognition 화자 음성 화자 확인 또는 식별 본인 확인, 화자 구분
Keyword Recognition 오디오 스트림 특정 키워드 감지 호출어, 음성 명령 시작
Language Identification 음성 언어 정보 다국어 STT, 번역 전처리

13. 정리

이번 글에서는 Azure AI Speech의 전체 기능 지도를 정리했습니다. Azure AI Speech는 음성을 텍스트로 바꾸는 Speech to Text에서 시작하지만, 그 기능은 훨씬 넓게 확장됩니다.

Speech to Text는 회의록, 자막, 상담 기록에 활용할 수 있습니다. Text to Speech는 텍스트를 자연스러운 음성으로 바꿔 AI 상담원이나 안내 서비스에 사용할 수 있습니다. Speech Translation은 음성을 다른 언어로 번역해 다국어 회의나 통역 서비스에 활용할 수 있습니다.

Pronunciation Assessment는 언어 학습자의 발음을 평가하는 데 쓰이고, Intent Recognition은 음성 명령의 의도를 파악하는 데 사용됩니다. Speaker Recognition은 누가 말했는지를 확인하고, Keyword Recognition은 호출어를 감지하며, Language Identification은 어떤 언어로 말하는지를 식별합니다.

결국 Azure AI Speech는 음성을 단순한 오디오 파일로 두지 않고, 텍스트, 번역, 명령, 평가, 사용자 식별 같은 실무 데이터로 바꾸는 서비스라고 볼 수 있습니다.

14. 전체 흐름 한 번에 정리

음성 입력
→ Speech to Text로 텍스트 변환
→ 필요하면 Language Identification으로 언어 식별
→ 필요하면 Speech Translation으로 번역
→ 필요하면 Intent Recognition으로 사용자 의도 파악
→ 필요하면 Speaker Recognition으로 화자 확인
→ 필요하면 Pronunciation Assessment로 발음 평가
→ Text to Speech로 다시 음성 응답 생성
→ SSML로 속도, 억양, 쉼, 강조 제어

이 흐름을 이해하면 Speech 서비스가 단일 기능이 아니라는 것을 알 수 있습니다. 음성 입력을 받아 텍스트화하고, 번역하고, 이해하고, 다시 말로 응답하는 전체 음성 AI 파이프라인을 만들 수 있습니다.

15. 핵심 키워드 정리

키워드 의미
Azure AI Speech 음성 인식, 음성 합성, 번역, 발음 평가 등을 제공하는 Azure AI 서비스
Speech to Text 음성을 텍스트로 변환하는 기능
Text to Speech 텍스트를 음성으로 변환하는 기능
Speech Translation 음성을 다른 언어의 텍스트나 음성으로 번역하는 기능
Pronunciation Assessment 학습자의 발음을 평가하고 피드백을 제공하는 기능
Intent Recognition 사용자의 음성 명령에서 의도를 파악하는 기능
Speaker Recognition 말하는 사람이 누구인지 확인하거나 식별하는 기능
Keyword Recognition 오디오에서 특정 호출어나 키워드를 감지하는 기능
Language Identification 음성에서 사용된 언어를 식별하는 기능
Whisper OpenAI의 음성 인식 모델
Neural TTS 신경망 기반으로 자연스러운 음성을 합성하는 방식
SSML 음성 합성 시 발음, 속도, 억양, 쉼 등을 제어하는 마크업 언어

16. 다음 글 예고

이번 글에서는 Azure AI Speech가 제공하는 주요 기능을 전체 지도처럼 살펴봤습니다. 다음 글에서는 Speech Studio에서 Speech to Text를 직접 실습하는 방법을 알아보겠습니다.

특히 다음 글에서는 Speech Studio에 오디오 파일을 업로드하고, 실시간 음성 텍스트 변환 결과를 확인한 뒤, 나중에 REST API와 Gradio 앱으로 확장할 수 있는 흐름까지 연결해보겠습니다.