7.0 7부 소개: 데이터, 분석, 통찰
데이터는 대규모 조직이 가진 가장 가치 있는 자산의 하나입니다. 가장 잘못 관리되는 자산의 하나이기도 합니다. 거의 모든 팀이 데이터를 만들고, 그것에 의존하고, 그것으로 결정을 내립니다. 그러나 소수의 엔지니어에게 통하는 비공식적 습관은 대규모 개발 조직, 기업, 정부 기관의 규모에서 무너집니다. 수백 개 팀이 수천 개 데이터셋을 만들어 냅니다. 여러 시스템이 각자 “진짜” 기록을 가졌다고 주장합니다. 그리고 이사회 자료나 공개 보고서에 어느 숫자가 들어가야 하는지 확신을 갖고 말할 수 있는 사람이 없습니다. 이 부는 그 난립을 믿을 만한 이해로 바꾸고, 이해를 더 나은 결정으로 바꾸는 일에 관한 것입니다.
판돈은 구체적입니다. 규제 기관은 개인, 금융, 건강 데이터에 대한 입증 가능한 계보와 통제를 기대합니다. 기업은 잘못 보고된 지표, 실패한 감사, 중복된 플랫폼에서 직접적인 노출에 직면합니다. 정부 기관은 기록 보존, 공적 책임, 시민의 공평한 대우에 대한 추가 의무를 집니다. 이 모든 환경에서 신뢰할 수 없는 데이터는 없는 데이터보다 나쁩니다. 확신에 차 있지만 틀린 결정을 이끌기 때문입니다. 그러므로 데이터를 제대로 하는 것은 백오피스의 관심사가 아닙니다. 재정적 노출, 법적 컴플라이언스, 공적 신뢰의 문제입니다.
7부는 데이터가 가치가 되어 가는 전체 여정을 따라갑니다. 조직이 데이터를 자산으로 다루기로 결정하는 방식에서 시작합니다. 그다음에는 데이터를 옮기고 빚는 엔지니어링, 의미를 추출하는 분석과 실험, 마지막으로 통찰이 사람들의 행동을 실제로 바꾸게 하는 문화가 옵니다. 내내 강조점은 단일한 진실의 버전을 포기하지 않고 규모에서 이를 해내는 것입니다.
이 부의 장
7.1 데이터 전략과 거버넌스: 명확한 소유자, 인터페이스, 품질 보장을 갖춘 제품으로 데이터를 다루고, 데이터가 시간에 걸쳐 신뢰할 수 있고 컴플라이언스를 지키게 하는 거버넌스 규율, 곧 스튜어드십, 카탈로그화, 마스터 데이터 관리(상충하는 기록을 하나의 권위 있는 버전으로 조정하는 것), 품질로 뒷받침합니다.
7.2 데이터 엔지니어링: 데이터가 생성되는 곳에서 가치를 만드는 곳으로 옮기는 수집, 변환, 저장, 오케스트레이션 파이프라인을 만들고 운영하되, 멱등하고, 테스트 가능하고, 관찰 가능하며, 규모에서 감당할 수 있게 유지합니다.
7.3 분석과 비즈니스 인텔리전스: 보고, 대시보드, 셀프서비스 도구를 통해 거버넌스가 적용되고 엔지니어링된 데이터를 이해와 행동으로 바꾸되, 모든 지표가 어디서나 합의된 하나의 방식으로 정의되고 계산되도록 시맨틱 계층에 닻을 둡니다.
7.4 제품 분석과 실험: 행동 계측을 통해 사람들이 제품을 실제로 어떻게 쓰는지 이해하고, 엄격한 통제 실험으로 인과를 확립하여, 제품 결정이 “우리는 생각한다”에서 “우리는 측정했다”로 옮겨 가게 하되, 프라이버시를 존중하고 동의를 의식하는 방식으로 합니다.
7.5 의사결정 과학과 데이터 기반 문화: 통계, 행동 과학, 판단을 써서 데이터를 실제 결정에 연결하고, 인과를 정직하게 추론하고, 불확실성을 충실히 전달하고, 데이터 연극과 침해적 감시를 모두 피하는 문화를 만듭니다.
7.6 실시간 및 스트리밍 데이터: 지연이 정말로 중요할 때 도착하는 대로 무한한 데이터를 처리하고, 윈도우와 워터마크로 이벤트 시간과 늦거나 순서가 어긋난 데이터를 다루고, 처리 보장과 멱등 싱크를 고르고, 변경 데이터 캡처로 운영 데이터베이스에서 스트리밍합니다.
7.7 데이터 모델링과 시맨틱 계층: 데이터가 어디에 사는지 정하기 전에 데이터가 무엇을 뜻하는지 정하되, 개념, 논리, 물리 모델, 분석을 위한 차원 모델링, 모든 비즈니스 지표가 어디서나 하나의 정의를 갖도록 하는 거버넌스가 적용되는 시맨틱 계층으로 합니다.
7.8 데이터 품질과 관측 가능성: 품질의 차원을 정의하고, 파이프라인을 검증하고 데이터 계약을 시행하고, 최신성, 양, 스키마, 계보를 모니터링하여 데이터 사고가 프로덕션 사고처럼 잡히고 해결되게 함으로써, 데이터를 보장이 있는 제품으로 다룹니다.
7.9 마스터 데이터와 참조 데이터 관리: 매칭, 생존 규칙, 스튜어드십을 통해 고객, 제품, 공급자 같은 핵심 엔터티에 대해 하나의 믿을 만한 골든 레코드를 만들고, 공유 참조 데이터를 통제되고 버전 관리되는 어휘로 다스립니다.
이 장들이 서로 맞물리는 방식
이 장들은 각 계층이 앞의 계층 위에 서는 의도적인 순서를 이룹니다. 전략과 거버넌스(7.1)는 어떤 데이터가 존재해야 하는지, 누가 소유하는지, “신뢰할 수 있다”가 무엇을 뜻하는지 정합니다. 데이터 엔지니어링(7.2)은 거버넌스가 적용된 데이터가 원천에서 소비자까지 믿을 만하게 흐르게 하는 배관입니다. 분석과 비즈니스 인텔리전스(7.3)는 그 파이프라인 바로 하류에 앉아, 모델링된 데이터를 공유 지표와 대시보드로 바꾸며, 이는 상류의 정의가 거버넌스를 받을 때만 안전합니다. 제품 분석과 실험(7.4)은 그 기초 위에 행동 증거와 인과의 엄밀함을 더합니다. 마지막으로 의사결정 과학과 데이터 문화(7.5)가 정점입니다. 그 앞에 오는 모든 전략, 엔지니어링, 분석, 실험은 결정을 더 낫게 바꾸지 못하면 가치가 없습니다. 관통선은 거버넌스에서 엔지니어링, BI, 실험, 의사결정 문화로 이어지며, 어느 단계의 약점도 하류의 모든 것을 훼손합니다.
이 부는 바깥으로도 이어집니다. 개인 데이터의 거버넌스는 이 부가 충족해야 하는 법적 제약을 정하는 프라이버시와 데이터 보호(4.5장) 및 컴플라이언스(4.6장)에 크게 기댑니다. 데이터 파이프라인은 소프트웨어 시스템이므로, 6.2장의 운영 모니터링을 포함해 가이드북의 다른 곳에 있는 신뢰성, 테스트, 관측 가능성 실천이 여기에도 직접 적용됩니다. 그리고 통찰은 궁극적으로 조직을 이끌기 위한 것이므로, 여기의 의사결정과 측정 실천은 11.1장 같은 11부의 리더십과 관리 주제를 강화합니다. 함께 읽으면 이 장들은 대규모 조직이 스스로를 명확히 보고 본 것에 따라 행동하는 방법을 기술합니다.