본문 바로가기
Databricks/Azure Databricks로 배우는 Lakehouse 데이터 엔지니어

[ Databricks #2 ] Azure Databricks란 무엇인가? Spark를 쉽게 쓰게 해주는 Lakehouse 플랫폼

by yunalee-dev 2026. 6. 21.

이전 글에서는 Apache Spark가 왜 필요한지 살펴봤습니다.

데이터가 너무 커지면 한 대의 컴퓨터로 처리하기 어렵고, 그래서 데이터를 여러 조각으로 나누어 동시에 처리하는 분산 병렬처리 엔진이 필요하다는 내용이었습니다.

 

그런데 여기서 한 가지 질문이 생깁니다.

“Spark가 그렇게 좋은 엔진이라면, 그냥 Spark만 쓰면 되는 것 아닌가?”

 

결론부터 말하면, 작은 실험에서는 Spark만으로도 충분할 수 있습니다. 하지만 실제 회사나 프로젝트에서는 Spark 엔진만 있다고 끝나지 않습니다. 데이터를 저장할 곳, 코드를 작성할 공간, 여러 사람이 협업할 방법, 클러스터 관리, 권한 관리, 자동 실행, 모니터링, BI 도구 연동까지 필요합니다.

핵심만 먼저 말하면
Azure Databricks는 Apache Spark를 기반으로 대량 데이터를 분석하고 처리할 수 있게 해주는 클라우드 분석 플랫폼입니다.
Spark 실행 환경뿐 아니라 협업 공간, 데이터 관리, 보안, 워크플로우, 머신러닝, Azure 서비스 연동까지 함께 제공합니다.

1. Spark만으로 부족한 점

Spark는 강력한 데이터 처리 엔진입니다.

하지만 엔진만 있다고 바로 실무 시스템이 되는 것은 아닙니다. 자동차 엔진이 아무리 좋아도 운전석, 바퀴, 연료 시스템, 계기판, 정비 시스템이 없으면 실제로 달리기 어렵습니다. Spark도 비슷합니다.

Spark 자체는 데이터를 빠르게 처리하는 핵심 엔진 역할을 합니다. 하지만 실무에서는 다음과 같은 고민이 따라옵니다.

  • Spark 클러스터를 어떻게 만들고 관리할 것인가?
  • 데이터 엔지니어, 데이터 과학자, 분석가가 어디서 함께 작업할 것인가?
  • Python, SQL, Scala 코드를 어디에 작성하고 실행할 것인가?
  • 데이터 접근 권한은 어떻게 관리할 것인가?
  • Azure Data Lake, Blob Storage, Power BI 같은 서비스와 어떻게 연결할 것인가?
  • 반복되는 데이터 파이프라인을 어떻게 자동 실행할 것인가?

Spark는 데이터 처리 엔진이고, 실제 운영 환경에서는 그 엔진을 둘러싼 작업 환경이 필요합니다. 이 역할을 해주는 대표적인 플랫폼이 Databricks입니다.

구분 Spark만 사용할 때 Databricks를 사용할 때
실행 환경 직접 클러스터 구성 필요 GUI에서 Compute 생성 및 관리 가능
협업 별도 도구 필요 Workspace와 Notebook 기반 협업 가능
운영 스케줄링, 로그, 알림을 직접 구성해야 함 Job, Workflow, Logs 기능 활용 가능
보안 권한 체계를 직접 설계해야 함 Azure 보안 기능과 통합 가능
주의할 점
Databricks는 Spark를 대체하는 완전히 다른 기술이 아닙니다. Spark를 더 쉽게 사용하고, 협업하고, 운영할 수 있도록 감싸주는 플랫폼에 가깝습니다.

2. Azure Databricks의 정의

Azure Databricks는 Microsoft Azure에서 제공되는 Databricks 서비스입니다.

Apache Spark 기반의 분석 플랫폼이며, 대량 데이터 처리, 데이터 분석, 머신러닝, 실시간 분석을 하나의 환경에서 수행할 수 있도록 도와줍니다.

조금 더 쉽게 말하면, Azure Databricks는 Azure 위에서 Spark를 편하게 쓰게 해주는 작업장입니다. Spark 클러스터를 직접 복잡하게 구성하지 않고도, 화면에서 Compute를 만들고 Notebook을 연결해 데이터 처리 작업을 실행할 수 있습니다.

Azure Databricks를 한 문장으로 정리하면
Azure Databricks는 Apache Spark 기반의 데이터 분석 플랫폼으로, Spark 실행 환경, 협업 Workspace, Azure 보안, 클라우드 서비스 연동을 함께 제공하는 Lakehouse 플랫폼입니다.

여기서 Lakehouse라는 말이 나옵니다. Lakehouse는 Data Lake와 Data Warehouse의 장점을 결합한 구조입니다.

  • Data Lake: 다양한 형태의 원천 데이터를 유연하게 저장하는 공간
  • Data Warehouse: 정리된 데이터를 빠르게 조회하고 분석하는 공간
  • Lakehouse: Data Lake의 유연성과 Data Warehouse의 관리성, 분석 성능을 함께 가져가려는 구조

Azure Databricks는 이 Lakehouse 구조를 만들 때 중심 역할을 합니다. 데이터를 수집하고, 정제하고, 분석하고, 머신러닝에 연결하는 흐름을 하나의 플랫폼 안에서 구성할 수 있기 때문입니다.

3. Databricks가 제공하는 것

Databricks를 단순히 “Spark 실행하는 곳”으로만 보면 기능을 너무 좁게 이해하게 됩니다.

실제로 Databricks는 데이터 프로젝트에 필요한 여러 기능을 하나의 플랫폼으로 묶어 제공합니다.

여기서 Workspace, Notebook, Compute, Job 같은 구성요소는 다음 글에서 따로 자세히 다룰 예정입니다.

이번 글에서는 Databricks가 “Spark를 편하게 실행하는 도구”를 넘어 데이터 작업 전체를 연결하는 플랫폼이라는 점만 잡고 가면 됩니다.

협업 플랫폼으로서의 Databricks

Databricks의 중요한 특징 중 하나는 여러 직군이 같은 공간에서 일할 수 있다는 점입니다.

데이터 엔지니어는 데이터를 수집하고 정제하고, 데이터 과학자는 모델을 만들고, 비즈니스 분석가는 SQL과 Dashboard를 통해 결과를 확인할 수 있습니다.

즉 Databricks는 개발자만 쓰는 도구가 아니라, 데이터 엔지니어, 데이터 과학자, 비즈니스 분석가가 함께 사용하는 협업 플랫폼입니다.

사용자 주요 작업 Databricks에서 사용하는 기능
Data Engineer 데이터 수집, 정제, 파이프라인 구성 Spark, Notebook, Job, Delta Lake
Data Scientist 머신러닝 모델 학습, 실험 관리 ML Runtime, MLflow, Feature Store
Business Analyst SQL 분석, 리포트, 대시보드 확인 Databricks SQL, Dashboard, Power BI 연동

4. Azure 서비스와의 연결

Azure Databricks의 강점은 Azure 서비스와 자연스럽게 연결된다는 점입니다.

데이터 프로젝트는 Databricks 하나만으로 끝나지 않는 경우가 많습니다.

데이터는 Storage에 있고, 수집은 Data Factory가 담당하고, 결과는 Power BI에서 시각화될 수 있습니다.

Azure Databricks는 이런 Azure 데이터 생태계 중간에서 데이터를 처리하고 분석하는 역할을 합니다.

Azure 서비스 역할 Databricks와 연결되는 방식
Azure Data Lake Storage 대량 데이터 저장 원천 데이터 저장소로 사용
Azure Blob Storage 파일 및 비정형 데이터 저장 CSV, JSON, 이미지, 로그 파일 저장소로 사용
Azure Data Factory 데이터 이동과 파이프라인 오케스트레이션 Databricks Notebook 또는 Job 실행과 연결 가능
Azure Cosmos DB NoSQL 데이터 저장 애플리케이션 데이터 분석에 활용
Power BI 시각화와 리포트 Databricks에서 만든 분석 테이블을 대시보드로 연결
Azure Security / Entra ID 사용자 인증과 권한 관리 조직 계정 기반 접근 제어에 활용

예를 들어 쇼핑몰 데이터를 분석한다고 해보겠습니다.

사용자 클릭 로그와 주문 데이터는 Azure Data Lake나 Blob Storage에 저장됩니다.

그 데이터를 Azure Databricks가 읽어서 정제하고, 상품별 매출이나 고객 세그먼트 같은 분석 테이블을 만듭니다. 이후 결과 테이블은 Power BI에서 대시보드로 보여줄 수 있습니다.

원천 데이터
  → Azure Data Lake / Blob Storage

데이터 처리
  → Azure Databricks에서 Spark로 정제, 집계, 변환

결과 저장
  → Delta Lake 또는 분석용 테이블

시각화
  → Power BI 대시보드

이 흐름에서 Databricks는 데이터를 단순히 저장하는 곳이 아니라, 원천 데이터를 분석 가능한 형태로 바꾸는 핵심 처리 구간을 담당합니다.

5. Databricks가 사용되는 대표 시나리오

Azure Databricks는 다양한 데이터 시나리오에 사용할 수 있습니다.

강의자료에서도 Modern Big Data Warehouse, Advanced Analytics, Real-time Analytics 같은 흐름이 등장합니다. 처음에는 이름이 조금 어렵게 느껴질 수 있지만, 실제로는 다음 세 가지로 이해하면 됩니다.

1) Modern Big Data Warehouse

Modern Big Data Warehouse는 여러 곳에 흩어진 대량 데이터를 모아 분석 가능한 구조로 만드는 시나리오입니다.

예를 들어 매출, 고객, 상품, 로그 데이터를 모아 BI 리포트나 대시보드에 사용할 테이블을 만드는 방식입니다.

이때 Databricks는 원천 데이터를 읽고, 정제하고, 집계하여 분석용 테이블을 만드는 역할을 합니다.

2) Advanced Analytics on Big Data

Advanced Analytics는 단순 집계를 넘어 예측, 분류, 추천 같은 분석을 수행하는 시나리오입니다.

예를 들어 고객 이탈 예측, 상품 추천, 수요 예측, 이상 탐지 같은 작업이 여기에 들어갑니다.

Databricks에서는 Spark 기반으로 대량 데이터를 처리한 뒤, 머신러닝 모델 학습이나 실험 관리로 자연스럽게 연결할 수 있습니다.

3) Real-time Analytics on Big Data

Real-time Analytics는 계속 들어오는 데이터를 빠르게 분석하는 시나리오입니다.

IoT 센서 데이터, 실시간 주문, 앱 클릭 로그, 이벤트 스트림 등을 처리할 때 필요합니다.

이 경우 Databricks는 스트리밍 데이터를 받아 정제하고, 필요한 결과를 테이블이나 대시보드로 연결하는 역할을 할 수 있습니다.

시나리오 무엇을 하는가 예시
Modern Big Data Warehouse 대량 데이터를 정리해 분석용 테이블 구성 매출 대시보드, 고객 분석 리포트
Advanced Analytics 대량 데이터 기반 예측과 머신러닝 이탈 예측, 추천 시스템, 이상 탐지
Real-time Analytics 실시간으로 들어오는 데이터 처리 IoT 모니터링, 실시간 주문 분석

6. 정리: Databricks는 Spark 기반 Lakehouse 플랫폼

여기까지의 내용을 연결해보면 Databricks의 역할이 조금 더 명확해집니다.

Spark는 대량 데이터를 빠르게 처리하는 엔진입니다. Azure Databricks는 그 Spark를 클라우드 환경에서 더 쉽게 실행하고, 팀이 함께 작업하고, Azure 서비스와 연결하고, 운영 환경까지 가져갈 수 있게 해주는 플랫폼입니다.

그래서 Databricks를 단순히 “Spark Notebook 쓰는 곳”으로만 보면 부족합니다. 더 정확히는 다음과 같이 이해하는 것이 좋습니다.

Databricks의 핵심 역할
Databricks는 Spark 기반 데이터 처리, 협업 Workspace, 데이터 저장 및 관리, 워크플로우 자동화, 머신러닝, BI 연동을 하나로 묶어 Lakehouse 구조를 만들 수 있게 해주는 플랫폼입니다.

7. 정리

Azure Databricks는 Apache Spark 기반의 클라우드 분석 플랫폼입니다. Spark가 대량 데이터를 빠르게 처리하는 엔진이라면, Azure Databricks는 그 엔진을 실제 프로젝트와 운영 환경에서 편하게 사용할 수 있도록 감싸주는 플랫폼입니다.

Databricks는 Spark 클러스터의 프로비저닝과 구성을 간소화하고, Notebook과 Workspace를 통해 협업 가능한 환경을 제공합니다. 또한 Azure Data Lake, Blob Storage, Data Factory, Cosmos DB, Power BI, Azure 보안 기능과 연결되어 데이터 수집부터 분석, 시각화, 머신러닝까지 이어지는 흐름을 만들 수 있습니다.

결국 Azure Databricks는 단순한 Spark 실행 도구가 아니라, 데이터 엔지니어링, 분석, 머신러닝, BI를 하나의 흐름으로 연결하는 Spark 기반 Lakehouse 플랫폼이라고 볼 수 있습니다.

8. 전체 흐름 한 번에 정리

흐름 핵심 질문
1 Spark만으로 충분하지 않은 이유는? 실무에서는 클러스터 관리, 협업, 보안, 자동화, 서비스 연동이 함께 필요하기 때문이다.
2 Azure Databricks는 무엇인가? Azure에서 제공되는 Apache Spark 기반 클라우드 분석 플랫폼이다.
3 Databricks는 무엇을 제공하는가? Spark 실행 환경, Workspace, Notebook, Workflow, Runtime, 보안 기능을 제공한다.
4 Azure와 어떻게 연결되는가? Data Lake, Blob Storage, Data Factory, Cosmos DB, Power BI, 보안 서비스와 연동된다.
5 어디에 쓰이는가? 데이터 웨어하우스, 고급 분석, 실시간 분석, 머신러닝 파이프라인에 활용된다.

9. 핵심 키워드 정리

키워드 의미
Azure Databricks Azure에서 제공되는 Spark 기반 데이터 분석 플랫폼
Apache Spark 대량 데이터를 분산 병렬처리하는 오픈소스 데이터 처리 엔진
Lakehouse Data Lake의 유연성과 Data Warehouse의 관리성을 결합한 데이터 아키텍처
Workspace Notebook, Library, Dashboard 등을 관리하고 공유하는 작업 공간
Collaboration 데이터 엔지니어, 데이터 과학자, 분석가가 함께 작업하는 협업 방식
Azure Integration Azure Data Lake, Blob Storage, Data Factory, Power BI 등과 연결되는 구조
Power BI 분석 결과를 리포트와 대시보드로 시각화하는 BI 도구
Data Factory 데이터 이동과 파이프라인 실행을 오케스트레이션하는 Azure 서비스
Data Lake 원천 데이터를 유연하게 저장하는 대규모 데이터 저장소
Blob Storage 파일, 로그, 이미지 등 다양한 데이터를 저장할 수 있는 Azure 객체 저장소
Security 사용자 인증, 권한 관리, 조직 보안 정책과 연결되는 기능

10. 다음 글 예고

이번 글에서는 Azure Databricks가 무엇인지, 그리고 왜 Spark만 쓰는 것보다 Databricks를 함께 사용하는지 살펴보았습니다. 다음 글에서는 Databricks를 처음 사용할 때 가장 헷갈리는 핵심 구성요소인 Workspace, Notebook, Compute, Job의 관계를 알아보겠습니다.