블로그

PEOPLE

흩어진 데이터를 AI 경쟁력으로, Azure Databricks

2026.08.07.

 

 

기업의 데이터는 ERP와 데이터베이스, 문서, 로그 등 여러 시스템에 흩어져 있고, 이를 분석과 AI에 활용하려면 수집부터 정제, 보안, 운영까지 탄탄한 기반을 먼저 갖춰야 합니다.

Azure Databricks는 기업의 분산된 데이터를 하나로 연결하고, 분석과 머신러닝, AI에 활용할 수 있도록 지원하는 통합 데이터·AI 플랫폼입니다. 웅진은 ERP와 클라우드 사업에서 축적한 경험을 바탕으로 Microsoft Fabric에 이어 Azure Databricks까지 데이터·AI 사업 영역을 넓혀가고 있는데요.

이번 웅진 PEOPLE에서는 MS서비스팀의 이세우 팀장을 만나 기업이 데이터·AI 프로젝트에서 겪는 현실적인 어려움부터 데이터·AI 활용에 필요한 준비사항, 그리고 웅진이 제공하는 데이터 솔루션에 대해 소개합니다.

 

 
Part 1. Azure Databricks 이해하기

 


[사진1] 웅진 클라우드사업본부 이세우 팀장

 

Q1. 안녕하세요, 먼저 자기소개 부탁드립니다.

안녕하세요. 클라우드사업본부 MS서비스팀을 맡고 있는 이세우 팀장입니다.
웅진그룹 가상화 구축 및 그룹사 네트워크 관리업무를 거쳐 현재는 MS 클라우드 사업을 담당하고 있습니다. 

 

Q2. MS서비스팀에서는 현재 어떤 사업들을 수행하고 있는지 궁금합니다.

MS서비스팀은 마이크로소프트에서 제공하는 클라우드 인프라 구축 및 운영부터 라이선스 판매까지 다양한 사업을 담당하고 있습니다. 최근에는 데이터 & AI 사업 및 M365 구축 등 클라우드 데이터 플랫폼사업으로 사업을 확장하고 있습니다.

 

Q3. 진행 중이신 사업 중 “Azure Databricks”에 대해 쉽게 설명해 주실 수 있을까요?

기업의 데이터는 ERP와 같은 운영 시스템부터 데이터베이스, 로그, 실시간 스트리밍 데이터까지 다양한 형태로 여러 곳에 흩어져 있습니다. 이러한 데이터를 분석이나 AI에 활용하려면 먼저 한곳에 연결하고, 목적에 맞게 정리하는 과정이 필요합니다.

Azure Databricks는 이렇게 분산된 데이터를 수집·정제하고, 분석과 AI에 활용할 수 있도록 지원하는 통합 데이터·AI 플랫폼입니다.
Databricks는 대규모 데이터를 빠르게 처리하기 위해 개발된 오픈소스 기술인 Apache Spark의 개발자들이 개발한 통합 데이터·AI 플랫폼인데요. Microsoft는 자체 데이터 분석 플랫폼인 Microsoft Fabric을 제공하는 동시에, Databricks와의 협력을 통해 해당 플랫폼의 기능을 Microsoft Azure 환경에서도 사용할 수 있도록 Azure Databricks를 제공하고 있습니다.

Azure Databricks를 활용하면 분산된 정형·비정형 데이터를 연결하고, 분석과 AI에 활용할 수 있는 형태로 정리할 수 있습니다. 예를 들어 Azure Data Factory를 통해 여러 시스템의 데이터를 수집·이동하고, Azure Data Lake Storage에 저장한 다음, Azure Databricks에서 필요한 데이터를 전처리하고 변환할 수 있습니다.
이 과정에서는 데이터를 일반적으로 브론즈(Bronze), 실버(Silver), 골드(Gold) 단계로 나누어 관리합니다. 원본 데이터를 보존하고, 오류와 중복을 정리한 뒤, 최종적으로 업무에서 활용할 수 있는 데이터로 가공하는 과정입니다.

이렇게 정리된 데이터는 Power BI를 활용한 비즈니스 지표 분석과 시각화뿐 아니라 수요예측, 이상 탐지, 머신러닝 모델링과 같은 다양한 업무에 활용할 수 있습니다. 최근에는 Azure AI Search, Microsoft Foundry의 에이전트 기능, Azure Databricks의 AI/BI Genie 등을 연계해 사용자가 자연어로 질문하면 데이터를 분석하고 원인을 파악하거나 보고서를 생성하는 환경으로도 확장할 수 있습니다.


 
Part 2. 기업의 데이터와 AI를 연결하다
 


[사진2] 웅진 클라우드사업본부 이세우 팀장

 

Q4. 기업들이 데이터를 분석과 AI에 활용하려 할 때, 실제 현장에서는 주로 어떤 어려움을 겪고 있나요?

AI에 대한 관심이 높아지면서 많은 기업이 도입을 검토하고 있지만, 실제 현장에서는 “AI로 무엇을 해야 하는지”, “어떤 업무에 어떻게 활용해야 하는지”를 구체적으로 정의하지 못하는 경우가 많습니다.

기술적인 장벽도 있습니다. 기업의 분산된 데이터를 한곳에 모으는 것뿐 아니라, 분석에 적합한 형태로 전처리하고 그 결과가 실제 업무와 일치하는지 검증하는 과정에도 어려움이 있습니다.

최근 한 고객사에서도 ERP 데이터와 내부 기간계 데이터를 통합하는 데이터 프로젝트를 추진하고자 웅진에 제안을 요청한 사례가 있었습니다. 그러나 사전 논의 과정에서 구체적인 업무 시나리오와 데이터 활용 기준이 충분히 정리되지 않은 점이 확인됐습니다. 이에 먼저 고객사 내부에서 적용 업무와 요구사항을 구체화한 뒤 프로젝트를 다시 진행하기로 했습니다.

데이터·AI 프로젝트에서는 솔루션을 먼저 도입하기보다, 해결하려는 업무 문제와 활용할 데이터, 기대하는 결과를 명확하게 정의하는 과정이 선행되어야 합니다.

 

Q5. 이러한 문제를 해결하기 위해서는 기업의 데이터 환경과 목적에 맞는 플랫폼 선택이 중요할 텐데요. Microsoft의 다양한 데이터 서비스 가운데 Azure Databricks는 어떤 역할을 하며, 특히 어떤 상황에서 활용 가치가 높을까요?

Azure Databricks는 개방형 기술을 기반으로 대규모·복합 데이터를 처리하고, 데이터 엔지니어링부터 머신러닝과 생성형 AI 개발·운영까지 유연하게 구성할 수 있는 플랫폼입니다. 특히 데이터 엔지니어와 데이터 사이언티스트, AI 개발자가 함께 복잡한 데이터 파이프라인이나 분석 모델을 구축해야 하는 환경에서 활용 가치가 높습니다.

반면 Microsoft Azure 환경에서 활용할 수 있는 대표적인 데이터 플랫폼 Microsoft Fabric은 데이터 수집과 엔지니어링, 데이터 웨어하우스, 실시간 분석, Power BI 기반 시각화 등을 하나의 SaaS 환경에서 제공합니다. OneLake를 중심으로 여러 분석 기능이 통합되어 있어 서비스 간 연계와 인프라 관리의 부담을 줄일 수 있고, Power BI와 Microsoft 365를 사용하고 있는 기업이 기존 업무 환경과 데이터를 연결해 활용하기에도 편리합니다.

두 플랫폼은 어느 하나가 일방적으로 우수하다기보다 데이터의 규모와 복잡성, 기존 Microsoft 환경, 분석 목적, 운영인력과 비용 등을 종합적으로 검토해 선택해야 합니다. 필요한 경우 Microsoft Fabric과 Azure Databricks를 연계해 각각의 강점을 함께 활용할 수도 있습니다.

 

Q6. AI 도입을 준비하는 기업에 데이터 플랫폼이 중요한 이유는 무엇인가요?

AI가 유의미한 결과를 만들어내기 위해서는 먼저 신뢰할 수 있는 데이터가 준비되어야 합니다. 그러나 기업 내부에는 정형데이터뿐 아니라 문서, 이미지, 로그와 같은 비정형데이터도 여러 시스템에 파편화되어 있습니다. 같은 고객이나 제품을 나타내는 데이터도 시스템마다 명칭과 기준이 다를 수 있습니다.

데이터 플랫폼은 이렇게 흩어진 데이터를 한곳에 연결하고, 일관된 기준에 따라 정리하고 관리할 수 있는 기반을 제공합니다. 어떤 데이터가 어디에서 생성됐는지, 최신 데이터인지, 누가 접근할 수 있는지까지 관리해야 AI가 정확하고 신뢰할 수 있는 결과를 제시할 수 있습니다.

결국 데이터 플랫폼은 데이터를 단순히 저장하는 공간이 아니라, 기업의 데이터를 분석과 AI가 활용할 수 있는 자산으로 전환하는 기반이라고 할 수 있습니다.

 

Q7. 기업의 데이터가 하나의 플랫폼에 연결되면 보안이나 접근 권한에 대한 우려도 커질 수 있을 것 같습니다. 이 부분은 어떻게 관리해야 하나요?

데이터의 중요도와 업무 역할에 따라 접근 범위를 세분화하고, 네트워크부터 사용자 계정과 개별 데이터까지 여러 단계로 보호해야 합니다.

먼저 온프레미스 환경과 Microsoft Azure를 연결할 때는 VPN이나 방화벽 등을 통해 외부 접근을 통제합니다. 기업이 기존에 운영하는 정보보안 및 접근제어 솔루션도 함께 적용할 수 있습니다.

Microsoft Azure 환경에서는 Azure Firewall과 네트워크 보안 설정을 활용해 접근 경로를 제한하고, Microsoft Entra ID를 통해 사용자와 조직별 인증 및 권한을 관리할 수 있습니다. 필요에 따라 다단계 인증과 디바이스 관리 정책도 적용할 수 있습니다.

Azure Databricks에서는 Microsoft Entra ID와 연계해 사용자와 그룹을 관리하고, Unity Catalog를 활용해 카탈로그·스키마·테이블 등 데이터 단위로 접근 권한을 설정할 수 있습니다. 이와 함께 누가 어떤 데이터에 접근하고 변경했는지 확인할 수 있도록 접근 및 감사 이력을 관리해야 합니다. 
중요한 것은 특정 보안 기능 하나에 의존하는 것이 아니라, 네트워크·사용자·디바이스·데이터별 통제와 운영 절차를 함께 설계하는 것입니다.

 

Q8. Azure Databricks 도입을 결정한 기업이 구축에 앞서 점검해야 할 데이터와 운영 환경은 무엇인가요?

가장 먼저 현재 보유한 데이터와 시스템 환경을 정확히 파악해야 합니다. 

데이터가 온프레미스와 Microsoft Azure, Amazon Web Services 등 어디에 저장되어 있는지, ERP·데이터베이스·파일·로그·미디어 등 어떤 형태로 관리되고 있는지 확인해야 합니다. 이를 바탕으로 대상 데이터의 위치와 품질, 시스템 간 연계 가능 여부를 진단하는 사전 평가(Assessment)가 필요합니다.

다음으로는 Azure Databricks를 통해 해결하려는 업무 문제를 구체적으로 정의해야 합니다. AI를 적용한다면, 현업 인터뷰를 통해 반복적으로 발생하거나 생산성 저하가 명확한 업무를 찾아야 합니다. 필요한 정보를 검색하는 업무, 긴 문서나 업무 이력을 요약하는 업무, 문서와 메시지의 초안을 작성하는 업무, 외부 시스템에 정보를 등록·수정·요청하는 업무 등이 검토 대상이 될 수 있습니다.

답변의 정확성과 근거를 어떤 기준으로 판단할 것인지도 사전에 정해야 합니다. 기술적으로 구현할 수 있더라도 결과를 검증할 업무 담당자와 운영조직이 준비되지 않으면 실제 현장에 안정적으로 적용하기 어렵기 때문입니다.

최근 수주한 한 고객사의 경우, 프로젝트에 앞서 데이터와 시스템 환경을 분석하고 현업 인터뷰를 통해 적용 과제를 구체화했습니다. 고객사가 이러한 검토 결과를 바탕으로 의사결정을 내리면서 본 프로젝트로 이어질 수 있었습니다.

따라서 구축 전에는 다음 세 가지를 중점적으로 점검해야 합니다.

- 어떤 데이터를 보유하고 있으며 실제로 연결·활용할 수 있는가
- 어떤 업무 문제를 해결하고 어떤 기준으로 성과를 판단할 것인가
- 보안과 운영인력, 비용을 포함해 구축 이후에도 지속적으로 운영할 수 있는가

이러한 준비가 선행되어야 불필요한 중복투자를 줄이고, 실제 업무 효율 향상으로 이어질 수 있습니다.

 


Part 3. 웅진 Azure Databricks

 

 
[사진3] 웅진 클라우드사업본부 이세우 팀장

 

Q9. Azure Databricks 프로젝트를 성공적으로 수행하기 위해서는 구축 파트너에게 어떤 역량이 필요할까요?

Azure Databricks 프로젝트는 데이터를 다루는 사업인 만큼 데이터 엔지니어의 기술력이 중요합니다. 다양한 원천데이터를 수집하고 처리하는 과정에서 Python·Java·SQL 등의 언어를 활용할 수 있어야 하며, 데이터베이스와 데이터 파이프라인, 워크플로 자동화, 대규모 분산처리 등에 대한 전문성도 필요합니다.

하지만 기술력만으로 프로젝트를 성공시키기는 어렵습니다. 고객의 업무 프로세스와 데이터가 생성되는 구조를 이해하고, 그 가운데 실제로 분석과 AI를 적용할 과제를 설계할 수 있어야 합니다. 기술적으로 가능한 것과 현업에 필요한 것을 연결하는 컨설팅 역량이 필요한 이유입니다.

또한 프로젝트에는 데이터 엔지니어뿐 아니라 클라우드 인프라 엔지니어, 데이터베이스 전문가, 비즈니스 기획자, 고객사의 현업 담당자 등 여러 직무가 함께 참여하기 때문에 각 참여자의 요구사항을 조율하고 기술적인 내용을 이해하기 쉽게 전달하는 커뮤니케이션 능력도 중요한 역량입니다.

구축 이후에는 데이터 품질과 보안, 시스템 성능과 비용을 지속적으로 관리해야 하므로, 구축부터 운영까지 전체 과정을 지원할 수 있는 역량을 갖춘 파트너를 선택하는 것이 중요합니다. 

 

Q10. 이러한 관점에서 웅진이 Azure Databricks 사업에서 발휘할 수 있는 강점은 무엇인가요?

웅진은 ERP부터 클라우드 인프라, 데이터 플랫폼, 시스템 운영에 이르는 넓고 깊은 이해를 바탕으로 고객의 전체 IT 환경을 지원하는 역량을 갖추고 있습니다.

데이터 플랫폼을 구축하려면 데이터를 처리하는 기술뿐 아니라, 데이터가 어떤 업무에서 생성되고 어떻게 활용되는지를 이해해야 합니다. 웅진은 오랜 ERP 구축·운영 경험을 바탕으로 기업의 핵심 업무 프로세스와 데이터 구조를 함께 이해할 수 있다는 강점이 있습니다.

뿐만 아니라 Microsoft Azure를 포함한 멀티클라우드 기술 역량과 MSP 운영 경험을 갖추고 있으며, 필요할 경우 데이터베이스 전문가 지원도 가능합니다. 데이터 플랫폼만 개별적으로 구축하는 것이 아니라 기존 인프라와 데이터베이스, 보안, 구축 이후의 운영 환경까지 종합적으로 고려할 수 있는 것이죠.

웅진이 수행해 온 수많은 구축·운영 프로젝트와 성공적인 고객사 PoC 사례를 통해 데이터 수집·가공·분석 환경에 대한 역량을 증명할 수 있습니다. 
현재도 Azure Databricks 프로젝트를 수행 중에 있는데요. 이를 통해 고객의 데이터를 실제 분석과 AI 업무로 연결하는 역량을 더욱 강화하고 있습니다.

 

-

 

AI가 제대로 일하려면, 먼저 기업의 데이터가 제대로 준비되어 있어야 합니다. 흩어진 데이터를 연결하고 일관된 기준으로 관리하는 데이터 플랫폼은 이제 단순한 분석 환경을 넘어, 기업의 AI 경쟁력을 결정하는 기반이 되고 있습니다.

웅진은 오랜 ERP 경험을 통해 기업의 비즈니스와 그 속의 데이터 구조를 이해하고, 멀티클라우드 구축과 MSP 운영을 통해 이를 안정적으로 뒷받침할 수 있는 역량을 쌓아왔습니다. 여기에 Microsoft Fabric과 Azure Databricks 구축·운영 경험을 쌓아가며, 기업의 데이터를 분석과 AI 활용으로 연결하는 여정을 본격화하고 있습니다.

데이터 환경 진단부터 플랫폼 구축, 보안과 운영까지. 웅진은 기업의 데이터를 실질적인 비즈니스 인사이트와 성과로 연결하는 데이터·AI 파트너로 함께하겠습니다.

 

 

[웅진 Databricks 사업 더 알아보기]
 
 

 

목록보기