7.1

View in English

7.1 데이터 전략과 거버넌스

개요와 동기

데이터 전략은 데이터를 자산으로 다루기 위한 의도적 계획입니다. 데이터가 어떻게 생산되고, 기술되고, 소유되고, 보호되고, 공유되고, 소비되어 가치를 만드는지입니다. 데이터 거버넌스는 전략을 현실로 만드는 운영 체제입니다. 데이터가 시간에 걸쳐 신뢰할 수 있고 컴플라이언스를 지키게 하는 역할, 정책, 표준, 통제입니다. 작은 팀에서는 이런 관심사가 암묵적이며 소수 엔지니어의 머릿속에 있는 경우가 많습니다. 대규모 개발 조직, 기업, 정부 기관의 규모에서는 그 비공식성이 무너집니다. 수백 개 팀이 수천 개 테이블을 만듭니다. 수십 개 시스템이 “진짜” 고객 기록을 가졌다고 주장합니다. 그리고 이사회 자료나 공개 보고서에서 어느 숫자가 맞는지 확신을 갖고 말할 수 있는 사람이 없습니다.

큰 팀에게 부실한 데이터 거버넌스의 비용은 추상적이지 않습니다. 규제 기관은 GDPR(EU의 일반 데이터 보호 규정), HIPAA(미국 건강보험 이동성 및 책임에 관한 법), 분야별 규칙 같은 체제 아래 개인, 금융, 건강 데이터에 대한 입증 가능한 계보와 통제를 기대합니다. 기업은 잘못 보고된 지표, 실패한 감사, 중복된 데이터 플랫폼에서 직접적인 재정적 노출에 직면합니다. 정부 기관은 기록 보존, 정보 공개 접근, 공적 책임, 시민의 공평한 대우에 대한 추가 의무를 집니다. 이 모든 환경에서 신뢰할 수 없는 데이터는 없는 데이터보다 나쁩니다. 확신에 차 있지만 틀린 결정을 이끌기 때문입니다.

규모에서 진전을 이끄는 생각은 단순합니다. 데이터를 제품으로 다루십시오. 데이터가 애플리케이션의 배기가스 같은 부산물이 되는 대신, 각 중요한 데이터셋에 소유자, 문서화된 인터페이스, 품질 보장, 고객으로 대우받는 소비자가 있습니다. 이 장은 그 제품 사고방식을 고전적 거버넌스 규율, 곧 스튜어드십, 카탈로그화, 마스터 데이터 관리, 품질과 나란히 다룹니다. 또한 어느 모델이 여러분의 팀에 맞는지 정하는 조직적 선택도 다룹니다. 데이터 메시(제품으로 게시되는 분산되고 도메인이 소유하는 데이터), 데이터 레이크하우스(유연한 데이터 레이크 위에 층층이 얹은 웨어하우스 방식의 관리와 거버넌스), 데이터 웨어하우스(모델링되어 질의할 준비가 된 데이터의 거버넌스가 적용되는 중앙 저장소)입니다.

함께 보기: 4.5장(프라이버시와 데이터 보호), 7.2장(데이터 엔지니어링), 4.6장(컴플라이언스와 거버넌스).

핵심 원칙

  • 데이터는 애플리케이션의 버려지는 부산물이 아니라 소유자가 있는 지속되는 자산입니다.
  • 모든 중요한 데이터셋에는 지명된 책임 있는 소유자와 문서화된 계약이 있습니다.
  • 거버넌스는 신뢰할 수 있는 사용을 가능하게 합니다. 거절만 하는 관료적 관문이 아닙니다.
  • 각 핵심 비즈니스 엔터티에 대해 하나의 권위 있는 원천이 있어야 합니다.
  • 품질, 프라이버시, 계보는 나중에 검사해서 넣는 것이 아니라 설계에 넣습니다.
  • 데이터의 소비자는 제품을 형성하는 요구를 가진 고객입니다.
  • 정책은 호의에 맡기지 않고 가능한 곳마다 코드로 만들어 자동으로 시행합니다.
  • 조직이 커질수록 연합된 소유권이 단일 중앙 팀보다 더 잘 확장됩니다.

권장 사항

데이터를 제품으로 다룬다

각 중요한 데이터셋에 사용 적합성에 책임지는 제품 소유자를 두십시오. 데이터 제품에는 이름, 문서화된 스키마, 의미와 출처의 설명, 정의된 갱신 주기, 공표된 품질 기대가 있습니다. 소비자는 생산 팀에게 단 하나의 질문도 하지 않고 그것을 발견하고, 이해하고, 의존할 수 있어야 합니다. 소프트웨어 API에 적용하는 것과 같은 규율을 적용하십시오. 버전 관리, 폐기 예고, 변경 이력, 하위 호환성입니다.

데이터 계약과 SLA를 확립한다

데이터 계약은 생산자와 소비자 사이의 명시적이고 기계로 검사 가능한 합의입니다. 스키마, 의미론, 최신성, 양, 허용되는 변경을 덮습니다. 호환성을 깨는 상류의 변경이 몇 주 뒤 하류 보고서를 조용히 오염시키는 대신 원천에서 빠르게 실패하도록 파이프라인에서 계약을 시행하십시오. 계약을 서비스 수준 협약과 목표와 짝지우십시오. 예컨대 “고객 차원은 매일 06:00까지 갱신되며, 99.5퍼센트의 날에, 비즈니스 키의 널이 0.1퍼센트 미만.” 이를 공표하고 위반 시 알리십시오.

스튜어드십과 거버넌스 운영 모델을 구축한다

책무를 실행과 분리해 두십시오. 데이터 소유자(흔히 비즈니스 리더)는 한 도메인에 책임집니다. 데이터 스튜어드(주제 전문가)는 정의를 유지하고, 품질 문제를 해결하고, 접근을 승인합니다. 가벼운 데이터 거버넌스 위원회가 횡단적 표준을 정하고 분쟁을 해결합니다. 모델을 연합적으로 유지하십시오. 중앙 이네이블링 팀이 도구, 표준, 코칭을 제공하고, 도메인 팀이 자기 데이터를 소유합니다. 이는 완전한 중앙화의 병목과 거버넌스가 전혀 없는 혼돈을 모두 피합니다.

데이터 카탈로그와 계보에 투자한다

검색 가능한 카탈로그는 데이터 영역의 정문입니다. 비즈니스 용어집, 기술 스키마, 소유권, 민감도 분류, 품질 점수, 원천 시스템에서 변환을 거쳐 대시보드까지의 끝에서 끝까지 계보를 담아야 합니다. 금방 썩는 수작업 문서에 기대지 말고 메타데이터 수집을 자동화하십시오. 계보는 영향 분석, 사고 대응, 감사, 정보 주체 접근 및 삭제 같은 규제 요청에 필수입니다.

마스터 데이터 관리와 단일 진실 원천

핵심 엔터티(고객, 시민, 제품, 공급자, 직원)에 대해서는 마스터 데이터 관리를 써서 중복과 상충하는 기록을 하나의 골든 레코드로 조정하십시오. 허브가 얼마나 권위 있어야 하는지에 따라 아키텍처(레지스트리, 통합, 공존, 중앙화)를 고르십시오. 매칭과 생존 규칙을 명시적으로 정의하고 감사 가능하게 만드십시오. 단일 진실 원천은 재무, 영업, 운영이 각기 다른 매출을 보고하는 고전적 실패를 막습니다.

차원에 걸쳐 데이터 품질을 측정한다

이름 붙은 차원을 따라 품질을 관리하십시오. 정확성, 완전성, 일관성, 적시성, 유효성, 고유성입니다. 소비자가 영향받기 전에 이상을 잡도록 자동화된 테스트와 지속적 데이터 관측 가능성(최신성, 양, 스키마 드리프트, 분포 검사)으로 파이프라인을 계측하십시오. 데이터 사고를 탐지, 분류, 근본 원인 분석, 사후 검토가 있는 프로덕션 장애처럼 다루십시오.

분류하고, 보호하고, 접근을 통제한다

민감도로 데이터를 분류하고 비례하는 통제를 적용하십시오. 암호화, 마스킹, 토큰화, 행 및 열 수준 보안, 정기적으로 리뷰하는 최소 권한 접근입니다. 최소화 요건과 기록 보존법을 모두 충족하는 보존 및 삭제 일정을 유지하십시오. 정부 맥락에서는 투명성 의무와 프라이버시 보호를 사안별이 아니라 의도적으로 조화시키십시오.

장단점

접근장점단점가장 적합한 곳
중앙화된 거버넌스 팀일관된 표준. 분명한 책무병목. 도메인과 단절작거나 규제가 심한 조직
연합된 거버넌스확장됨. 도메인 전문성. 소유권강한 도구와 문화 필요큰 다중 도메인 기업
데이터 웨어하우스성숙하고 거버넌스가 적용되며 성능 좋은 SQL경직됨. 비정형 데이터에 비쌈안정적이고 BI 중심인 워크로드
데이터 레이크하우스유연하고 통합되며 모든 데이터 유형을 처리더 어린 도구. 거버넌스 노력혼합된 분석과 ML
데이터 메시도메인 소유권. 조직적으로 확장높은 성숙도 기준. 조율 비용매우 크고 분산된 조직

거버넌스는 항상 속도를 신뢰와 맞바꿉니다. 가벼운 거버넌스는 팀이 빨리 움직이게 하다가, 감사, 침해, 난처한 오보가 비싼 청산을 강제합니다. 무거운 거버넌스는 신뢰를 지키지만 실험을 질식시키고 팀을 그림자 시스템 쪽으로 밀 수 있습니다. 지속되는 답은 거버넌스를 자동화된 셀프서비스 가드레일로 코드화해, 컴플라이언스를 지키는 길이 쉬운 길이기도 하게 하는 것입니다. 아키텍처적으로 웨어하우스는 거버넌스가 적용된 단순함을, 메시는 조직적 규모를 선호하고, 레이크하우스는 둘을 절충합니다. 올바른 선택은 어떤 기술적 벤치마크보다 조직의 구조를 훨씬 더 따릅니다.

팀과 논의할 질문

  1. 어떤 데이터 아키텍처(웨어하우스, 레이크하우스, 메시)가 조직이 구조화된 방식에 실제로 맞으며, 각각이 요구하는 성숙도 기준에 대해 정직합니까? 장단점 표는 이 선택이 벤치마크가 아니라 조직 구조를 따른다는 점을 짚습니다. 웨어하우스는 안정적이고 BI 중심의 워크로드에 보상하고, 레이크하우스는 혼합된 분석과 ML을 처리하고, 메시는 많은 자율적 도메인에 걸쳐 확장하지만 높은 성숙도와 강한 도구를 요구합니다. 수십 개의 도메인이 있는 대기업이나 정부 기관에서 셀프서비스 플랫폼과 거버넌스 문화를 갖추기 전에 메시로 뛰어드는 것은 분산화로 포장된 혼돈을 낳습니다. 구체적인 신호를 가져오십시오. 몇 개의 도메인이 데이터를 만드는지, 중앙 팀이 이미 병목인지, 도메인 팀에 제품을 소유할 기술과 유인이 있는지입니다. 오늘 연합된 도구가 없다면 정직한 답은 지금은 거버넌스가 적용되는 웨어하우스나 레이크하우스, 나중에 메시일 수 있습니다. 사람들이 실제로 운영할 수 있는 모델을 고르고, 다음 모델이 필요로 하는 성숙도에 투자하십시오.

  2. 오늘 삭제 요청을 끝에서 끝까지 이행할 수 있으며, 계보가 개인 기록의 모든 사본이 어디로 갔는지 증명합니까? GDPR과 비슷한 체제에서 정보 주체의 삭제나 접근 요청은 엄격한 기한이 있는 법적 의무이며, 계보 없이 데이터를 넓게 복사하면 이를 충족하는 것이 불가능해집니다. 큰 팀은 데이터를 마트, 추출물, 캐시, 스프레드시트로 으레 퍼뜨리므로, 진짜 질문은 원본을 삭제할 수 있는지가 아니라 모든 사본을 추적하고 닿을 수 있는지입니다. 증거를 가져오십시오. 실제 고객이나 시민 한 명을 골라 그들의 데이터가 사는 모든 자리를 열거해 보십시오. 그럴 수 없다면 그 간극은 컴플라이언스 위험이자 침해의 피해 범위 문제입니다. 답은 자동화된 계보와 통제되지 않는 복사에 대한 더 엄격한 통제에 대한 투자를 이끌어야 합니다. 컴플라이언스를 지키는 길은 요청이 도착하기 전에 구축되어야 하기 때문입니다.

  3. 거버넌스는 쉬운 길입니까, 사람들이 우회하는 관문입니까? 그것을 증명하는 그림자 시스템은 어디에 있습니까? 이 장의 지속되는 답은 거버넌스를 자동화된 셀프서비스 가드레일로 코드화해 컴플라이언스를 지키는 길이 가장 빠른 길이기도 하게 하는 것입니다. 무거운 수작업 거버넌스는 팀을 그림자 스프레드시트와 거버넌스 없는 사본 쪽으로 밀기 때문입니다. 기업과 기관에서 그림자 시스템은 침해, 틀린 숫자, 실패한 감사가 태어나는 곳입니다. 아무도 지켜보지 않기 때문입니다. 구체적인 목록을 가져오십시오. 어느 팀이 자기 사본을 유지하는지, 어느 보고서가 카탈로그를 우회하는지, 사람들이 공식 절차가 너무 느리다고 말하는 곳이 어디인지입니다. 각 그림자 시스템은 거버넌스가 적용되는 길이 우회보다 비용이 더 든다는 신호입니다. 또 하나의 정책을 내놓는 대신 마찰을 고쳐, 인증된 데이터와 계약을 쓰는 것이 우회하는 것보다 진정으로 쉽게 하십시오.

  4. 어떤 핵심 비즈니스 엔터티가 단일 권위 있는 원천을 가장 필요로 하며, 오늘 그 골든 레코드에 책임지는 사람은 이름으로 누구입니까? 마스터 데이터 관리는 재무, 영업, 운영이 각기 다른 고객이나 다른 매출 수치를 보고하는 것을 막기 위해 존재하며, 규모에서 하나의 권위 있는 원천이 없으면 모든 도메인 간 숫자가 논쟁이 됩니다. 경쟁하는 고려는 허브가 얼마나 권위 있어야 하는지(레지스트리, 통합, 공존, 완전 중앙화)와 얼마나 많은 매칭 및 생존 로직을 만들고 감사할 의향이 있는지입니다. 더 무거운 허브는 비용이 더 들지만 더 많은 충돌을 해결하기 때문입니다. 가장 많은 보고서에 나오는 엔터티(고객, 시민, 제품, 공급자, 직원), 각각에 대해 진짜 기록을 가졌다고 주장하는 시스템의 수, 오늘 쓰는 매칭 규칙(있다면)을 가져오십시오. 은행이나 국가 기관에서는 책임 있는 소유자와 생존 규칙의 이름을 명시적으로 정하십시오. 공개 보고서에서 원천까지 수치를 추적하는 규제 기관은 어떤 중복이 이겼는지 누가 결정했는지 물을 것이고, “아무도”는 감사를 견디는 답이 아니기 때문입니다.

  5. 소비자가 깨졌음을 발견하기 전에, 핵심 데이터셋이 사용에 적합하다는 것을 어떻게 압니까? 미성숙한 환경에서 품질은 대시보드가 깨진 분석가나 이사회 숫자가 틀린 임원이 발견하며, 이는 가장 비싼 탐지 지점입니다. 긴장은 품질을 계측하는 비용(정확성, 완전성, 유효성 같은 이름 붙은 차원에 걸친 테스트, 최신성 및 양 검사, 분포 및 스키마 드리프트 모니터링)과 막는 사고의 비용 사이에 있으며, 팀은 실패가 파국적이 될 때까지 보이지 않기 때문에 으레 과소 투자합니다. 최근 세 건의 데이터 사고, 그것이 어떻게 탐지되었는지, 누군가 알아채기까지 얼마나 오래 돌았는지, 오늘 실제로 공표하고 알림을 거는 품질 SLA를 가져오십시오. 기업과 정부 보고에서는 각 핵심 데이터 제품을 명시적 품질 임계값에 묶고 위반을 분류와 사후 검토가 있는 프로덕션 장애처럼 다루십시오. 규제 제출물의 틀린 수치나 공개 통계는 모니터링 청구서를 압도하는 법적, 평판적 비용을 지니기 때문입니다.

  6. 거버넌스는 도메인 소유권으로 진정으로 연합되어 있습니까, 아니면 이해하지 못하는 데이터에 대해 책임지는 중앙 팀입니까? 이 장은 중앙의 이네이블링이 있는 연합된 소유권이 순수 중앙화가 병목이 되고 순수 분산화가 혼돈으로 전락하는 곳에서 확장된다고 주장하지만, 많은 조직이 연합을 주장하면서 소수의 중앙 팀이 도메인 지식이 전혀 없는 수천 개 테이블에 명목상 책임을 집니다. 경쟁하는 끌림은 실제입니다. 중앙 팀은 일관성과 책임을 물을 단일 창구를 주고, 도메인 소유권은 전문성과 책무를 주지만 비즈니스 소유자가 원하지 않을 수 있는 책임을 받아들이도록 요구합니다. 주요 도메인에 대해 누가 책임지는지와 실제로 누가 정의를 유지하고 품질 문제를 해결하는지의 정직한 지도, 스튜어드에게 역할이 요구하는 권한과 시간이 있는지를 가져오십시오. 대기업이나 기관에서는 소유권이 도메인 지식과 거절할 권한을 모두 가진 사람에게 있는지 확인하십시오. 권한 없는 중앙 팀에 배정된 거버넌스는 아무도 따르지 않는 정책과 아무것도 해결하지 못하는 위원회를 낳기 때문입니다.

분야별 관점

스타트업. 속도와 생존이 프로세스를 이깁니다. 각 핵심 데이터셋에 소유자 한 명을 지정하고, “활성 고객” 같은 엔터티의 단일 진실 원천으로 저장소 하나를 삼으며, 카탈로그, 위원회, 메시는 전부 건너뛰십시오. 소수의 핵심 테이블에 대한 한 페이지짜리 계약(스키마, 갱신 시간, 단일 품질 기대)이 “누구의 숫자가 맞는가” 논쟁을 오후 한나절에 끝냅니다. 감당할 수 없는 기능에 인력을 두는 대신 웨어하우스에 이미 내장된 거버넌스에 기대십시오.

소기업. 전담 데이터 전문가도 빠듯한 예산도 없으니, 거버넌스를 플랫폼 프로젝트가 아니라 데이터 위생으로 다루십시오. 어떤 개인 데이터를 보유하는지, 어디에 있는지, 누가 만질 수 있는지 아십시오. 계보, 접근 통제, 보존을 기본 제공하는 관리형 웨어하우스나 BI 도구를 선호해, 거버넌스를 직접 만드는 대신 이미 운영하는 도구에 내장된 것으로 사십시오. 맞춤 파이프라인은 사업을 진정으로 이끄는 단 하나의 데이터셋에 남겨 두십시오.

대기업. 많은 팀에 걸친 규모에서 일은 중앙 이네이블링이 있는 연합된 소유권입니다. 자동화된 계보가 있는 공유 카탈로그, 시행되는 데이터 계약, 핵심 엔터티의 마스터 데이터, 기준선에 대해 측정되는 품질 SLA입니다. 컴플라이언스를 지키는 길이 빠른 길이기도 하도록 거버넌스를 셀프서비스 가드레일로 코드화하고, 데이터를 지명된 소유자가 있는 제품 포트폴리오로 관리하십시오. 그렇게 하면 감사자가 어떤 수치든 보고서에서 원천까지 추적할 수 있고, 그룹들이 같은 파이프라인과 정의를 다시 발명하기를 멈춥니다.

정부. 조달 규칙, 투명성, 공적 책임이 모든 선택을 형성합니다. 공표된 지표를 문서화된 방법론, 버전 관리되는 릴리스, 품질 관문이 있는 데이터 제품으로 다루고, 정보 공개 및 공개 데이터 의무를 프라이버시와 최소화에 사안별이 아니라 의도적으로 조화시키십시오. 종속을 피하도록 벤더 계약에 데이터 이식성과 계보 공개를 요구하고, 방어 가능한 보존 및 삭제 일정을 유지하고, 스튜어드십 위원회가 공유 정의를 쥐게 해 “가구”나 “실업”이 모든 부처에서 같은 뜻이 되게 하십시오.

사례

스타트업. 시드 단계의 한 SaaS 회사는 청구 스프레드시트, 영업 도구, 제품 데이터베이스가 각기 다른 고객 수를 보고하고, 투자자 업데이트에 어느 것이 맞는지 아무도 말할 수 없음을 발견했습니다. 네 명의 팀은 각 핵심 데이터셋에 소유자 한 명을 지정하고, 웨어하우스를 “활성 고객”의 단일 원천으로 삼고, 스키마와 일일 갱신 시간을 기술한 한 페이지짜리 계약을 썼습니다. 오후 한나절이 걸렸고, 누구의 숫자를 믿을지에 대한 주간 논쟁을 끝냈습니다.

기업. 한 다국적 은행이 소매, 대출, 자산 관리 부문에 걸친 수십 개의 상충하는 고객 기록을 생존 규칙과 골든 레코드가 있는 마스터 데이터 관리 허브로 통합했습니다. 각 도메인은 계약과 최신성 SLA가 있는 데이터 제품을 게시했고, 계보와 함께 중앙 카탈로그에 노출되었습니다. 감사자가 이제 어떤 수치든 보고서에서 원천까지 추적할 수 있었기 때문에 규제 보고 시간이 크게 줄었습니다. 은행은 중복된 보고 플랫폼 몇 개도 폐기했습니다.

정부. 한 국가 통계 기관은 공표된 지표를 문서화된 방법론, 버전 관리되는 릴리스, 엄격한 품질 관문이 있는 데이터 제품으로 다룹니다. 스튜어드십 위원회가 부처 간 정의를 조정해 “실업”이나 “가구”가 어디서나 같은 뜻이 되게 합니다. 분류와 통제된 접근이 응답자의 기밀을 보호하고, 공개 카탈로그가 투명성과 정보 공개 의무를 뒷받침합니다.

비즈니스 사례: 동기, ROI, TCO

데이터 거버넌스의 동기는 대략 같은 정도의 위험 감소와 가치 창출입니다. 위험 측면에서 피한 비용에는 규제 과징금, 침해 책임, 실패한 감사, 틀린 숫자를 공표한 평판 손상이 있습니다. 가치 측면에서 신뢰할 수 있고 발견 가능한 데이터는 모든 하류의 분석과 머신러닝 노력의 속도를 높이고, 중복된 파이프라인을 줄이고, 질문에서 답까지의 시간을 단축합니다.

도입 비용은 실제입니다. 카탈로그와 품질 도구, 스튜어드와 소유자의 시간, 소유권이 자리 잡게 하는 조직적 변화입니다. TCO(총소유비용)를 도입하지 않는 비용에 견주어 저울질하십시오. 이는 보통 더 크지만 숨어 있습니다. 측정하지 않으면 그 비용은 분석가들이 대부분의 시간을 데이터를 찾고 정제하는 데 쓰고, 팀들이 같은 파이프라인을 다시 만들고, 임원들이 아무도 방어할 수 없는 수치로 결정을 내리는 것으로 나타납니다. 리더십에는 그들의 언어로 설득하십시오. 거버넌스는 데이터를 하방이 무한한 부채에서 복리로 수익이 쌓이는 자산으로 바꾸며, 신뢰할 수 있는 AI의 전제 조건입니다. 가치를 빨리 보이도록 고통과 규제 노출이 가장 높은 곳에서 시작하십시오.

안티패턴과 함정

  • 자동화 없는 위원회식 거버넌스로 아무도 따르지 않는 정책을 낳는 것.
  • 실제로 중요한 데이터셋 대신 한꺼번에 모든 것을 카탈로그화하는 것.
  • 바다를 끓이려다 골든 레코드를 한 번도 출하하지 못하는 마스터 데이터 프로젝트.
  • 데이터 품질을 지속적 관측 가능성이 아니라 일회성 정리로 다루는 것.
  • 도메인 지식이나 권한이 없는 중앙 팀에 배정된 소유권.
  • 위키에 문서화되었지만 파이프라인에서 시행되지 않는 계약.
  • 계보 없이 데이터를 넓게 복사해 삭제 요청을 이행할 수 없게 만드는 것.
  • 도구를 사고 전략이라 부르는 것. 운영 모델 없는 도구는 실패합니다.

성숙도 모델

  1. 시작: 데이터가 문서화되지 않고 소유자도 없이 즉흥적이고 반응적으로 다뤄집니다. 정의가 팀 사이에서 충돌합니다. 품질은 보고서가 깨질 때 소비자가 발견합니다. 카탈로그도 계보도 없습니다.
  2. 발전: 기본 실천이 나타나지만 팀마다 일관되지 않습니다. 일부 데이터셋에 소유자와 문서가 있고 부분적 카탈로그가 존재합니다. 품질 검사는 수동적이고 반응적입니다. 거버넌스 정책이 쓰였지만 약하고 고르지 않게 시행됩니다.
  3. 표준화: 소유권, 계약, SLA가 문서화되어 조직 전체에서 시행됩니다. 핵심 데이터 제품에는 지명된 소유자가 있고, 자동화된 계보가 있는 카탈로그가 주요 도메인을 덮고, 핵심 엔터티에 마스터 데이터가 있으며, 거버넌스는 중앙 이네이블링과 함께 연합되어 팀마다가 아니라 일관되게 적용됩니다.
  4. 관리: 영역이 기준선에 대해 측정되고 통제됩니다. 품질 차원(정확성, 완전성, 적시성, 유효성, 고유성)이 공표된 SLA 목표에 대해 추적되고, 계약 위반율, 계보와 카탈로그 커버리지, 최신성, 삭제 요청 이행 시간이 대시보드에 보고되며, 관측 가능성이 스키마 드리프트와 양의 이상에 알림을 주고, 사고는 분류, 근본 원인 분석, 사후 검토를 받으며, 접근과 진행/중단 결정은 의견이 아니라 기준선에 대한 지표에 근거합니다.
  5. 오케스트레이션: 거버넌스가 조직 전체에서 지속적으로 개선되고 통합됩니다. 제품으로서의 데이터가 도메인 전반의 규범이고, 계약은 자동으로 시행되어 호환성을 깨는 변경이 빠르게 실패하며, 셀프서비스 가드레일이 정책을 코드화하고, 품질과 계보가 사전적 위험 관리에 공급되며, 정의는 조직 전체에서 신뢰받아 규제 보고와 AI를 뒷받침합니다. 조직은 소유권을 일상적으로 재균형하고, 중복된 플랫폼을 퇴역시키고, 사업과 규제가 이동함에 따라 거버넌스를 적응시킵니다.

논의를 위한 아이디어

  • 어떤 비즈니스 엔터티가 단일 진실 원천을 가장 시급히 필요로 하며, 오늘 왜 파편화되어 있습니까?
  • 시행되는 데이터 계약이 최근 사고를 어디서 막았을까요?
  • 조직이 연합된 소유권을 위해 구조화되어 있습니까, 아니면 지금은 중앙화가 더 맞습니까?
  • 정부의 투명성 의무를 프라이버시와 최소화와 어떻게 조화시킵니까?
  • 분석가의 시간 중 데이터를 찾고 정제하는 데 쓰이는 비율은 얼마이며, 그것을 절반으로 줄이면 얼마의 가치가 있습니까?
  • 가장 중요한 데이터셋에 이름으로 누가 책임지며, 그들은 그 사실을 압니까?

핵심 요점

  • 데이터를 애플리케이션의 배기가스가 아니라 소유자, 계약, SLA가 있는 제품으로 다루십시오.
  • 중앙 이네이블링이 있는 연합된 거버넌스가 순수 중앙화보다 더 잘 확장됩니다.
  • 자동화된 계보가 있는 카탈로그는 신뢰할 수 있는 데이터 영역의 정문입니다.
  • 마스터 데이터 관리로 핵심 엔터티의 단일 진실 원천을 확립하십시오.
  • 관측 가능성과 사고 대응으로 이름 붙은 차원에 걸쳐 품질을 지속적으로 관리하십시오.
  • 컴플라이언스를 지키는 길이 쉬운 길이 되도록 거버넌스를 자동화된 가드레일로 코드화하십시오.
  • 과대 광고가 아니라 조직에 맞게 웨어하우스, 레이크하우스, 메시를 고르십시오.

참고 문헌과 더 읽을거리

  • DAMA International, “DAMA-DMBOK: Data Management Body of Knowledge.”
  • Zhamak Dehghani, “Data Mesh: Delivering Data-Driven Value at Scale.”
  • Ralph Kimball and Margy Ross, “The Data Warehouse Toolkit.”
  • Piethein Strengholt, “Data Management at Scale.”
  • David Loshin, “Master Data Management.”
  • Chad Sanderson and colleagues, writings on data contracts.
  • ISO/IEC 38505, “Governance of data.”
  • ISO 8000, “Data quality” standard series.