본문 바로가기

Databricks2

[ Databricks #3 ] Databricks의 핵심 구성요소 이해하기: Workspace, Notebook, Compute, Job 목차1. Databricks에서 코드는 어디에 쓰는가?2. Workspace의 역할3. Notebook의 역할4. Compute/Cluster의 역할5. Job의 역할6. Library와 Runtime의 역할7. Driver Node와 Worker Node의 관계8. 전체 실행 흐름 예시9. 정리10. 전체 흐름 한 번에 정리11. 핵심 키워드 정리12. 다음 글 예고이전 글에서는 Azure Databricks가 Apache Spark를 더 쉽게 사용할 수 있게 해주는 클라우드 분석 플랫폼이라는 점을 정리했습니다.이번 글에서는 Databricks를 처음 열었을 때 가장 헷갈리는 구성요소들을 한 번에 연결해보겠습니다.Databricks를 처음 보면 Workspace, Notebook, Compute, Cl.. 2026. 6. 22.
[ Databricks #2 ] Azure Databricks란 무엇인가? Spark를 쉽게 쓰게 해주는 Lakehouse 플랫폼 목차1. Spark만으로 부족한 점2. Azure Databricks의 정의3. Databricks가 제공하는 것4. Azure 서비스와의 연결5. Databricks가 사용되는 대표 시나리오6. 정리: Databricks는 Spark 기반 Lakehouse 플랫폼7. 정리8. 전체 흐름 한 번에 정리9. 핵심 키워드 정리10. 다음 글 예고이전 글에서는 Apache Spark가 왜 필요한지 살펴봤습니다.데이터가 너무 커지면 한 대의 컴퓨터로 처리하기 어렵고, 그래서 데이터를 여러 조각으로 나누어 동시에 처리하는 분산 병렬처리 엔진이 필요하다는 내용이었습니다. 그런데 여기서 한 가지 질문이 생깁니다.“Spark가 그렇게 좋은 엔진이라면, 그냥 Spark만 쓰면 되는 것 아닌가?” 결론부터 말하면, 작은 .. 2026. 6. 21.