7.0 भाग 7 का परिचय: डेटा, एनालिटिक्स, और इनसाइट
डेटा एक बड़े संगठन के पास मौजूद सबसे मूल्यवान संपत्तियों में से एक है। यह सबसे बुरी तरह कुप्रबंधित संपत्तियों में से भी एक है। लगभग हर टीम इसे उत्पन्न करती है, इस पर निर्भर करती है, और इसके साथ निर्णय लेती है। फिर भी वे अनौपचारिक आदतें जो मुट्ठी भर इंजीनियरों के लिए काम करती हैं, बड़े डेवलपर संगठनों, एंटरप्राइज़, और सरकारी एजेंसियों के स्केल पर बिखर जाती हैं। सैकड़ों टीमें हज़ारों डेटासेट उत्पन्न करती हैं। कई प्रणालियाँ हरेक “वास्तविक” रिकॉर्ड होने का दावा करती हैं। और कोई भी विश्वास के साथ यह नहीं बता सकता कि बोर्ड डेक या सार्वजनिक रिपोर्ट में कौन-सी संख्या डाली जानी चाहिए। यह भाग इस फैलाव (sprawl) को विश्वसनीय समझ में बदलने, और समझ को बेहतर निर्णयों में बदलने के बारे में है।
दाँव ठोस हैं। नियामक व्यक्तिगत, वित्तीय, और स्वास्थ्य डेटा पर प्रदर्शन-योग्य वंशावली (lineage) और नियंत्रण की अपेक्षा करते हैं। एंटरप्राइज़ गलत रिपोर्ट किए गए मेट्रिक्स, विफल ऑडिट, और दोहराए गए प्लेटफ़ॉर्म से सीधे एक्सपोज़र का सामना करते हैं। सरकारी एजेंसियाँ रिकॉर्ड प्रतिधारण (retention), सार्वजनिक जवाबदेही, और नागरिकों के समान व्यवहार के इर्द-गिर्द अतिरिक्त दायित्व वहन करती हैं। इन सभी परिवेशों में, ऐसा डेटा जिस पर आप भरोसा नहीं कर सकते, कोई डेटा न होने से भी बदतर है, क्योंकि यह आत्मविश्वासी लेकिन गलत निर्णयों को गति देता है। इसलिए डेटा को सही करना कोई बैक-ऑफ़िस चिंता नहीं है। यह वित्तीय एक्सपोज़र, कानूनी अनुपालन, और सार्वजनिक भरोसे का मामला है।
भाग 7 डेटा की मूल्य बनने तक की पूरी यात्रा का अनुसरण करता है। यह इससे शुरू होता है कि एक संगठन डेटा को एक संपत्ति के रूप में मानने का निर्णय कैसे लेता है। फिर आती है वह इंजीनियरिंग जो इसे स्थानांतरित और आकार देती है, वे एनालिटिक्स और प्रयोग जो अर्थ निकालते हैं, और अंत में वह संस्कृति जो इनसाइट को वास्तव में लोगों के कार्यों को बदलने देती है। पूरे दौरान, ज़ोर इस बात पर है कि यह स्केल पर एक ही सत्य के संस्करण को खोए बिना कैसे किया जाए।
इस भाग के अध्याय
7.1 डेटा रणनीति और गवर्नेंस: डेटा को स्पष्ट स्वामियों, इंटरफ़ेस, और गुणवत्ता गारंटी वाले एक उत्पाद के रूप में मानना, उन गवर्नेंस अनुशासनों द्वारा समर्थित जो डेटा को समय के साथ विश्वसनीय और अनुपालनशील बनाए रखते हैं: स्टीवर्डशिप, कैटलॉगिंग, मास्टर डेटा प्रबंधन (परस्पर विरोधी रिकॉर्ड को एक प्राधिकृत संस्करण में समेटना), और गुणवत्ता।
7.2 डेटा इंजीनियरिंग: उन इनजेशन, ट्रांसफ़ॉर्मेशन, स्टोरेज, और ऑर्केस्ट्रेशन पाइपलाइनों का निर्माण और संचालन करना जो डेटा को उस जगह से जहाँ वह उत्पन्न होता है, उस जगह तक स्थानांतरित करती हैं जहाँ वह मूल्य बनाता है, जिन्हें इडेम्पोटेंट, परीक्षण-योग्य, अवलोकन-योग्य, और स्केल पर किफ़ायती रखा जाता है।
7.3 एनालिटिक्स और बिज़नेस इंटेलिजेंस: रिपोर्टिंग, डैशबोर्ड, और सेल्फ़-सर्विस टूल के माध्यम से गवर्न किए गए, इंजीनियर किए गए डेटा को समझ और कार्रवाई में बदलना, एक सिमैंटिक लेयर द्वारा आधारित ताकि हर मेट्रिक हर जगह एक सहमत तरीके से परिभाषित और गणना की जाए।
7.4 उत्पाद एनालिटिक्स और प्रयोग: व्यवहारगत इंस्ट्रुमेंटेशन के माध्यम से यह समझना कि लोग वास्तव में किसी उत्पाद का उपयोग कैसे करते हैं, और कठोर नियंत्रित प्रयोगों से कारण व प्रभाव स्थापित करना, ताकि उत्पाद निर्णय “हम सोचते हैं” से “हमने मापा” की ओर बढ़ें, यह सब गोपनीयता-सम्मानजनक, सहमति-जागरूक तरीके से।
7.5 निर्णय विज्ञान और डेटा-सूचित संस्कृति: सांख्यिकी, व्यवहार विज्ञान, और निर्णय-क्षमता का उपयोग करके डेटा को वास्तविक निर्णयों से जोड़ना, एक ऐसी संस्कृति बनाना जो कारण और प्रभाव के बारे में ईमानदारी से तर्क करती है, अनिश्चितता को वफ़ादारी से संप्रेषित करती है, और डेटा नाटक (data theatre) व घुसपैठिया निगरानी दोनों से बचती है।
7.6 रीयल-टाइम और स्ट्रीमिंग डेटा: जब लेटेंसी वास्तव में मायने रखती है तब असीमित (unbounded) डेटा को आने के साथ ही संसाधित करना, विंडो और वॉटरमार्क के साथ इवेंट टाइम और देर से आने वाले या क्रम-से-बाहर डेटा को संभालना, प्रोसेसिंग गारंटी और इडेम्पोटेंट सिंक चुनना, और चेंज डेटा कैप्चर के साथ ऑपरेशनल डेटाबेस से स्ट्रीम करना।
7.7 डेटा मॉडलिंग और सिमैंटिक लेयर: यह तय करने से पहले कि डेटा कहाँ रहता है, यह तय करना कि उसका अर्थ क्या है, कॉन्सेप्चुअल, लॉजिकल, और फ़िज़िकल मॉडल, एनालिटिक्स के लिए डायमेंशनल मॉडलिंग, और एक गवर्न किए गए सिमैंटिक लेयर के माध्यम से ताकि हर बिज़नेस मेट्रिक की हर जगह एक ही परिभाषा हो।
7.8 डेटा गुणवत्ता और ऑब्ज़र्वेबिलिटी: गुणवत्ता के आयामों को परिभाषित करके, पाइपलाइनों को सत्यापित करके और डेटा कॉन्ट्रैक्ट लागू करके, और ताज़गी (freshness), वॉल्यूम, स्कीमा, और वंशावली की निगरानी करके डेटा को गारंटी वाले एक उत्पाद के रूप में मानना, ताकि डेटा घटनाओं को प्रोडक्शन घटनाओं की तरह पकड़ा और हल किया जाए।
7.9 मास्टर डेटा और संदर्भ डेटा प्रबंधन: मिलान (matching), सर्वाइवरशिप, और स्टीवर्डशिप के माध्यम से ग्राहक, उत्पाद, और आपूर्तिकर्ता जैसी मूल संस्थाओं के लिए एक एकल विश्वसनीय गोल्डन रिकॉर्ड बनाना, और साझा संदर्भ डेटा को एक नियंत्रित, वर्ज़न-प्राप्त शब्दावली के रूप में गवर्न करना।
ये अध्याय एक-दूसरे से कैसे जुड़े हैं
ये अध्याय एक जानबूझकर बनाया गया क्रम बनाते हैं, जिसमें हर परत पिछली पर टिकी है। रणनीति और गवर्नेंस (7.1) तय करते हैं कि कौन-सा डेटा मौजूद होना चाहिए, इसका स्वामी कौन है, और “विश्वसनीय” का क्या अर्थ है। डेटा इंजीनियरिंग (7.2) वह प्लंबिंग है जो गवर्न किए गए डेटा को स्रोत से उपभोक्ता तक विश्वसनीय रूप से प्रवाहित करती है। एनालिटिक्स और बिज़नेस इंटेलिजेंस (7.3) सीधे उन पाइपलाइनों के डाउनस्ट्रीम में बैठते हैं, मॉडल किए गए डेटा को साझा मेट्रिक्स और डैशबोर्ड में बदलते हुए, जो तभी सुरक्षित है जब अपस्ट्रीम परिभाषाएँ गवर्न की गई हों। उत्पाद एनालिटिक्स और प्रयोग (7.4) उस नींव के ऊपर व्यवहारगत प्रमाण और कारणात्मक कठोरता (causal rigor) जोड़ते हैं। अंत में, निर्णय विज्ञान और डेटा संस्कृति (7.5) शिखर-बिंदु (capstone) है: इससे पहले आने वाली सारी रणनीति, इंजीनियरिंग, एनालिटिक्स, और प्रयोग बेकार हैं यदि वे निर्णयों को बेहतर के लिए नहीं बदलते। सूत्र गवर्नेंस से इंजीनियरिंग से BI से प्रयोग से निर्णय संस्कृति तक चलता है, और किसी भी चरण में कमज़ोरी डाउनस्ट्रीम की हर चीज़ को कमज़ोर करती है।
यह भाग बाहर की ओर भी जुड़ता है। व्यक्तिगत डेटा का गवर्नेंस गोपनीयता और डेटा संरक्षण (अध्याय 4.5) और अनुपालन (अध्याय 4.6) पर भारी रूप से निर्भर करता है, जो वे कानूनी बाधाएँ तय करते हैं जिन्हें इस भाग को पूरा करना होता है। डेटा पाइपलाइनें सॉफ़्टवेयर प्रणालियाँ हैं, इसलिए गाइडबुक में कहीं और पाई जाने वाली विश्वसनीयता, टेस्टिंग, और ऑब्ज़र्वेबिलिटी की प्रथाएँ यहाँ भी सीधे लागू होती हैं, जिसमें अध्याय 6.2 की परिचालन निगरानी शामिल है। और चूँकि इनसाइट का अंतिम उद्देश्य संगठनों का मार्गदर्शन करना है, यहाँ की निर्णय-निर्माण और मापन प्रथाएँ भाग 11 के नेतृत्व और प्रबंधन विषयों को मज़बूत करती हैं, जैसे अध्याय 11.1। साथ में पढ़ने पर, ये अध्याय बताते हैं कि एक बड़ा संगठन स्वयं को स्पष्ट रूप से कैसे देख सकता है और जो वह देखता है उस पर कार्य कैसे कर सकता है।