databricks2 [ Databricks #2 ] Azure Databricks란 무엇인가? Spark를 쉽게 쓰게 해주는 Lakehouse 플랫폼 목차1. Spark만으로 부족한 점2. Azure Databricks의 정의3. Databricks가 제공하는 것4. Azure 서비스와의 연결5. Databricks가 사용되는 대표 시나리오6. 정리: Databricks는 Spark 기반 Lakehouse 플랫폼7. 정리8. 전체 흐름 한 번에 정리9. 핵심 키워드 정리10. 다음 글 예고이전 글에서는 Apache Spark가 왜 필요한지 살펴봤습니다.데이터가 너무 커지면 한 대의 컴퓨터로 처리하기 어렵고, 그래서 데이터를 여러 조각으로 나누어 동시에 처리하는 분산 병렬처리 엔진이 필요하다는 내용이었습니다. 그런데 여기서 한 가지 질문이 생깁니다.“Spark가 그렇게 좋은 엔진이라면, 그냥 Spark만 쓰면 되는 것 아닌가?” 결론부터 말하면, 작은 .. 2026. 6. 21. [ Databricks #1 ] Apache Spark는 왜 필요한가? 빅데이터 병렬처리의 시작 목차1. 데이터가 많아지면 왜 처리 속도가 느려질까?2. 병렬처리란 무엇인가?3. Spark가 등장한 이유4. Spark의 핵심 특징5. Spark SQL, Structured Streaming, MLlib, GraphX 간단 정리6. Spark와 Databricks의 관계 예고7. 정리8. 전체 흐름 한 번에 정리9. 핵심 키워드 정리10. 다음 글 예고데이터 분석을 처음 배울 때는 보통 작은 CSV 파일 하나를 열고, 필터링하고, 평균을 구하는 정도에서 시작합니다.이때는 굳이 복잡한 도구가 필요하지 않습니다. 노트북 한 대에서 Python과 pandas만으로도 충분히 처리할 수 있습니다. 그런데 데이터가 점점 커지면 이야기가 달라집니다.수백 MB였던 파일이 수십 GB, 수백 GB, 더 나아가 TB 단.. 2026. 6. 21. 이전 1 다음