7.7 ডেটা মডেলিং ও শব্দার্থিক স্তর
পরিচিতি ও প্রেরণা
একটি ডেটা মডেল হলো আপনার ডেটার অর্থ কী সে বিষয়ে একটি সিদ্ধান্ত, ডেটা কোথায় থাকবে তা ঠিক করার আগে নেওয়া। এটি আপনার ব্যবসা যে জিনিসগুলো নিয়ে ভাবে, সেগুলো বর্ণনাকারী বৈশিষ্ট্য এবং তাদের মধ্যকার সম্পর্কের নাম দেয়। সংরক্ষণ, ইনডেক্স, ফাইল ফরম্যাট ও কোয়েরি ইঞ্জিন সবই পরে আসে। এই ক্রম গুরুত্বপূর্ণ কারণ আপনার ডেটার অর্থ তাকে ধরে রাখতে আপনি যে প্রতিটি প্রযুক্তি ব্যবহার করেন তার চেয়ে দীর্ঘজীবী। ওয়্যারহাউস প্রতিস্থাপিত হয়, টেবিল ফরম্যাট বদলায়, কোয়েরি ইঞ্জিন আসে-যায়, কিন্তু “গ্রাহক,” “অর্ডার” ও “সক্রিয় ব্যবহারকারী” সবগুলোতে বছরের পর বছর একই অর্থ বহন করতে হবে।
একটি ছোট দলের জন্য মডেলিং প্রায়ই অন্তর্নিহিত। একজন ইঞ্জিনিয়ার পুরো স্কিমা মাথায় রাখেন, এবং “রাজস্ব” সম্পর্কে একটি ভাগ করা বোঝাপড়া টিকে থাকে কারণ ভিন্নমত করার মাত্র তিনজন মানুষ। বড় ডেভেলপার প্রতিষ্ঠান, এন্টারপ্রাইজ ও সরকারি সংস্থার পরিসরে সেই অনানুষ্ঠানিকতা ঠিক সেভাবে ভেঙে পড়ে যেভাবে অধ্যায় 7.1 (ডেটা কৌশল ও শাসন)-এ বর্ণিত। ডজন ডজন দল শত শত টেবিল গড়ে, প্রত্যেকের নিজস্ব ধারণা একটি “সেশন” কী বা একজন ব্যবহারকারী কখন “সক্রিয়” গণ্য। দুটি ড্যাশবোর্ড একই সপ্তাহের জন্য দুটি ভিন্ন সংখ্যা দেখায়, এবং একটি নেতৃত্ব বৈঠক পরবর্তী করণীয়র বদলে কার কোয়েরি সঠিক তা নিয়ে তর্কে পরিণত হয়। খারাপ মডেলিং নিজের ঘোষণা দেয় না। এটি মাস পরে মেলানোর কাজ, ব্যর্থ নিরীক্ষা এবং কেউ রক্ষা করতে পারে না এমন সংখ্যার ওপর নেওয়া সিদ্ধান্ত হিসেবে দেখা দেয়।
এই অধ্যায় সেই কাজ সুচিন্তিতভাবে করার বিষয়ে। এটি ধারণাগত, যৌক্তিক ও ভৌত মডেল; সত্তা-সম্পর্ক মডেলিং; কখন স্বাভাবিকীকরণ ও কখন অ-স্বাভাবিকীকরণ করবেন; লেনদেনমূলক বনাম বিশ্লেষণমূলক ওয়ার্কলোডে মডেলিং কীভাবে আলাদা; ফ্যাক্ট ও মাত্রাসহ মাত্রিক মডেলিং; এবং প্রতিটি ব্যবসায়িক মেট্রিকের একমাত্র শাসিত সংজ্ঞা ধরা শব্দার্থিক স্তর কভার করে। প্রতিদান নিজের স্বার্থে সৌন্দর্য নয়। এটি হলো “সক্রিয় ব্যবহারকারী” ও “রাজস্ব” সর্বত্র একটি জিনিস বোঝায়, তাই আপনার দলগুলো সংখ্যা বিশ্বাস করতে পারে এবং সেজন্য দ্রুত চলে।
আরও দেখুন: অধ্যায় 3.4 (ডেটা স্থাপত্য ও সংরক্ষণ), অধ্যায় 7.3 (বিশ্লেষণ ও বিজনেস ইন্টেলিজেন্স), এবং অধ্যায় 11.5 (মূল কার্যসম্পাদন সূচক)।
মূল নীতিসমূহ
- ডেটা কোথায় থাকবে ঠিক করার আগে ঠিক করুন তার অর্থ কী।
- তিন স্তরে মডেল করুন: ধারণাগত (ব্যবসা), যৌক্তিক (কাঠামো), ভৌত (বাস্তবায়ন)।
- লেনদেনমূলক সিস্টেমে সঠিকতা রক্ষায় স্বাভাবিকীকরণ করুন; বিশ্লেষণের গতির জন্য সুচিন্তিতভাবে অ-স্বাভাবিকীকরণ করুন।
- মডেল ওয়ার্কলোডের সঙ্গে মেলান: লেনদেন ও বিশ্লেষণের প্রয়োজন বিপরীত।
- প্রতিটি ব্যবসায়িক মেট্রিকের ঠিক একটি শাসিত সংজ্ঞা থাকে, এবং তা শব্দার্থিক স্তরে থাকে।
- মেলানো মাত্রা স্বাধীন দলগুলোকে নিরাপদে ডেটা জুড়তে ও তুলনা করতে দেয়।
- গ্রেইন একটি নকশা সিদ্ধান্ত যা আপনি ইচ্ছাকৃতভাবে নেন, একটি কোয়েরির দুর্ঘটনা নয়।
- মডেল জীবন্ত সম্পদ: ভালো নাম দিন, নথিবদ্ধ করুন, এবং বিবর্তনযোগ্য রাখুন।
সুপারিশ
ক্রমানুসারে তিন স্তরে মডেল করুন
অর্থ থেকে বাইরের দিকে কাজ করুন। একটি ধারণাগত মডেল দিয়ে শুরু করুন: আপনার ব্যবসা যে সত্তা নিয়ে ভাবে এবং তারা কীভাবে সম্পর্কিত, একজন ডোমেইন বিশেষজ্ঞ যাচাই করতে পারেন এমন সহজ ভাষায় লেখা। “একজন গ্রাহক অনেক অর্ডার দেন; একটি অর্ডারে অনেক লাইন আইটেম থাকে; প্রতিটি লাইন আইটেম একটি পণ্যকে নির্দেশ করে।” এখনো কোনো কী, টাইপ বা টেবিল নয়। তারপর একটি যৌক্তিক মডেল গড়ুন যা কাঠামো যোগ করে: বৈশিষ্ট্য, প্রাইমারি ও ফরেন কী, কার্ডিনালিটি এবং সীমাবদ্ধতা, তখনো কোনো নির্দিষ্ট ডেটাবেস থেকে স্বাধীন। সত্তা-সম্পর্ক মডেলিং এখানে মানক নোটেশন, এবং একটি সত্তা-সম্পর্ক ডায়াগ্রাম সেই নিদর্শন যা আপনি ইঞ্জিনিয়ার ও ব্যবসায়িক অংশীদার দুজনের সঙ্গে পর্যালোচনা করেন। তারপরই কেবল ভৌত মডেল তৈরি করুন: আপনার বাছা ইঞ্জিনের জন্য প্রকৃত টেবিল, কলাম, ডেটা টাইপ, ইনডেক্স, পার্টিশন এবং সংরক্ষণ বিন্যাস। ভৌত নকশায় লাফ দেওয়া সবচেয়ে সাধারণ মডেলিং ভুল, কারণ এটি আজকের প্রযুক্তি বাছাই এমন সিদ্ধান্তে গেঁথে দেয় যা তাদের ছাড়িয়ে টেকা উচিত।
লেনদেনমূলক সিস্টেম স্বাভাবিকীকরণ করুন, বিশ্লেষণমূলকগুলো সুচিন্তিতভাবে অ-স্বাভাবিকীকরণ করুন
যে সিস্টেম লেনদেন রেকর্ড করে তার জন্য ডেটাবেস স্বাভাবিকীকরণ পছন্দ করুন। স্বাভাবিক ফর্ম অতিরিক্ততা সরায় যাতে প্রতিটি ফ্যাক্ট একবার সংরক্ষিত হয়, যা হালনাগাদ অসঙ্গতি ঠেকায় এবং অনেক ব্যবহারকারী একযোগে ডেটা বদলালে লেখা সঠিক রাখে। এটি অনলাইন লেনদেন প্রক্রিয়াকরণ (OLTP)-এর সঠিক ডিফল্ট, যেখানে একযোগ লেখার অধীনে সঠিকতা যেকোনো একক বিশ্লেষণমূলক কোয়েরির গতির চেয়ে বেশি গুরুত্বপূর্ণ। বিশ্লেষণমূলক সিস্টেমের অগ্রাধিকার বিপরীত। তারা পড়া-ভারী, বিশাল পরিসর স্ক্যান ও সমষ্টি করে, এবং কোয়েরির সময় ডজন ডজন স্বাভাবিকীকৃত টেবিল জোড়া ধীর ও যুক্তি করা কঠিন। সেখানে আপনি ইচ্ছাকৃতভাবে অ-স্বাভাবিকীকরণ করেন, সম্পর্কিত বৈশিষ্ট্য একসঙ্গে ভেঙে দিয়ে যাতে কোয়েরি সরলতর ও দ্রুততর হয়। শৃঙ্খলা হলো অতিরিক্ততা দুর্ঘটনাক্রমে ঢুকে পড়তে দেওয়ার বদলে একটি নথিবদ্ধ কারণসহ সুচিন্তিতভাবে অ-স্বাভাবিকীকরণ করা। অধ্যায় 3.4 (ডেটা স্থাপত্য ও সংরক্ষণ) সেই ইঞ্জিন কভার করে যা প্রতিটি প্যাটার্নকে কার্যকর করে।
বিশ্লেষণের জন্য মাত্রিক মডেলিং ব্যবহার করুন
বিশ্লেষণমূলক ওয়ার্কলোডের জন্য মাত্রিক মডেলিং গ্রহণ করুন, Ralph Kimball-এর জনপ্রিয় করা পদ্ধতি। আপনি বিশ্বকে ফ্যাক্ট ও মাত্রায় ভাগ করেন। একটি ফ্যাক্ট টেবিল একটি ব্যবসায়িক প্রক্রিয়ার পরিমাপ ধরে: একটি বিক্রয়ের পরিমাণ, একটি কলের সময়কাল, পাঠানো পরিমাণ। মাত্রা টেবিল সেই বর্ণনামূলক প্রসঙ্গ ধরে যা দিয়ে আপনি ফিল্টার ও গ্রুপ করেন: গ্রাহক, পণ্য, দোকান, তারিখ। একটি ফ্যাক্ট টেবিল তার মাত্রা দিয়ে ঘেরা সাজালে আপনার একটি স্টার স্কিমা হয়, যা বিশ্লেষকদের বোঝা সহজ এবং ইঞ্জিনের কোয়েরি দ্রুত। সেই মাত্রাগুলো উপ-টেবিলে স্বাভাবিকীকরণ করলে আপনি একটি স্নোফ্লেক স্কিমা পান, যা বেশি জোড়া ও বেশি জটিলতার বিনিময়ে কিছু সংরক্ষণ বাঁচায়; সুনির্দিষ্ট কারণ না থাকলে স্টার পছন্দ করুন। নিরীক্ষণযোগ্যতা ও উৎস ট্র্যাকিং প্রাধান্য পাওয়া খুব বড়, অত্যন্ত নিয়ন্ত্রিত পরিবেশে একটি ডেটা ভল্ট পদ্ধতি ইতিহাস ও বংশধারা আক্রমণাত্মকভাবে ধরতে হাব, লিংক ও স্যাটেলাইট মডেল করে, বেশি টেবিল ও খাড়াতর শেখার বক্ররেখার বিনিময়ে। বেশিরভাগ দলের Kimball-ধাঁচের স্টার দিয়ে শুরু করা এবং নিরীক্ষা প্রয়োজন যথার্থ করলে কেবল তখন ডেটা ভল্টে হাত বাড়ানো উচিত।
গ্রেইন স্থির করুন এবং পরিবর্তনশীল মাত্রা সুস্পষ্টভাবে সামলান
একটি ফ্যাক্ট টেবিলে একটি কলাম যোগ করার আগে তার গ্রেইন বলুন: ঠিক একটি সারি কী প্রতিনিধিত্ব করে। “প্রতি অর্ডার লাইন আইটেমে একটি সারি।” “প্রতি ব্যবহারকারী প্রতি দিনে একটি সারি।” গ্রেইন একটি সঠিক মডেলের ভিত্তি, কারণ প্রতিটি পরিমাপ ও প্রতিটি মাত্রা হয় সেই গ্রেইনে মেলে নয়তো টেবিলে মানায় না। গ্রেইন মেশানোই দ্বিগুণ-গণনা করা রাজস্ব পাওয়ার উপায়। তারপর ঠিক করুন মাত্রা সময়ের সঙ্গে কীভাবে বদলায়। একজন গ্রাহক নতুন শহরে যান; আপনি কি পুরনো মান ওভাররাইট করেন, পূর্ণ ইতিহাস রাখেন, নাকি কেবল বর্তমান ও আগের মান ট্র্যাক করেন? এগুলো মানক ধীরে পরিবর্তনশীল মাত্রা প্যাটার্ন, এবং ভুল বাছাই মানে আপনার ঐতিহাসিক প্রতিবেদন নীরবে অতীত পুনর্লিখন করে। গ্রেইন ও পরিবর্তন কৌশল আগে ঠিক করুন, মডেলের নথিতে লিখুন, এবং পর্যালোচনায় রেখা ধরে রাখুন।
প্রতিটি মেট্রিকের একক সংজ্ঞা হিসেবে একটি শব্দার্থিক স্তর গড়ুন
এটি সেই সুপারিশ যা পুরো অধ্যায়ের খরচ তোলে। একটি শব্দার্থিক স্তর আপনার ভৌত টেবিল এবং তাদের ভোগকারী প্রতিটি টুলের মাঝে বসে, এবং প্রতিটি ব্যবসায়িক মেট্রিকের একমাত্র শাসিত সংজ্ঞা ধরে। “সক্রিয় ব্যবহারকারী” একবার কোড হিসেবে তার সুনির্দিষ্ট যুক্তিসহ সংজ্ঞায়িত: কোন ইভেন্ট গণ্য, কোন জানালায়, কোন অভ্যন্তরীণ অ্যাকাউন্ট বাদ দিয়ে। “রাজস্ব” একবার সংজ্ঞায়িত, ফেরত, ছাড় ও মুদ্রা রূপান্তর কীভাবে সামলানো হয় সহ। প্রতিটি ড্যাশবোর্ড, নোটবুক, প্রতিবেদন ও রিভার্স-ETL কাজ একটি বিশেষায়িত কোয়েরিতে তা পুনঃবাস্তবায়ন না করে সেই সংজ্ঞা পড়ে। সংজ্ঞা বদলালে তা এক জায়গায় বদলায় এবং প্রতিটি ভোক্তা একসঙ্গে হালনাগাদ হয়। এটি সেই যন্ত্র যা শাসিত মেট্রিক সংজ্ঞাকে আকাঙ্ক্ষার বদলে বাস্তব করে, এবং অধ্যায় 11.5 (মূল কার্যসম্পাদন সূচক) যা চায় তার সরাসরি বাস্তবায়ন। অধ্যায় 7.1 যেভাবে ডেটাকে পণ্য গণ্য করতে বলে ঠিক সেভাবে মেট্রিক সংজ্ঞাকে মালিক, পর্যালোচনা ও টেস্টসহ সংস্করণ করা কোড গণ্য করুন।
রীতি, নামকরণ ও নথিকরণ স্থাপন করুন
সামঞ্জস্য একটি ফিচার। নামকরণ রীতি গ্রহণ ও প্রয়োগ করুন: টেবিলের নামের একটি রীতি, কীর একটি রীতি, তারিখ কলামের একটি মান, একটি ফ্যাক্ট বনাম মাত্রা চিহ্নিত করার একটি নিয়ম। একবার ঠিক করুন সত্তার নাম একবচন নাকি বহুবচন এবং কখনো মেশাবেন না। প্রতিটি মডেল সেখানে নথিবদ্ধ করুন যেখানে তার ব্যবহারকারীরা খুঁজবে: প্রতিটি টেবিলের অর্থ, প্রতিটি ফ্যাক্টের গ্রেইন, প্রতিটি মেট্রিকের সংজ্ঞা এবং প্রতিটির মালিক। ভালো নামকরণ ও নথিকরণই একজন নতুন বিশ্লেষককে দলকে বিরক্ত করার বদলে স্ব-সেবা করতে দেয়, এবং একজন নিরীক্ষককে একটি নির্দেশিত ভ্রমণ ছাড়াই একটি বোর্ড ডেকের সংখ্যা উৎসে ট্রেস করতে দেয়।
মডেল বিবর্তনযোগ্য রাখুন
আপনার মডেল বদলাবে, তাই পরিবর্তনের জন্য নকশা করুন। বিদ্যমান কলাম নতুন উদ্দেশ্যে ব্যবহারের বদলে কলাম যোগ করুন। সারোগেট কী ব্যবহার করুন যাতে একটি উৎস সিস্টেমের প্রাকৃতিক কী বদলালে তা আপনার ওয়্যারহাউস জুড়ে ঢেউ না তোলে। চলমান ড্যাশবোর্ডের নিচে নীরবে বদলানোর বদলে মেট্রিক সংজ্ঞা সংস্করণ করুন এবং নোটিশসহ অবচয় করুন। রূপান্তর সংস্করণ নিয়ন্ত্রণে, পরীক্ষিত ও পর্যালোচিত রাখুন, যাতে “সক্রিয় ব্যবহারকারী” কী বোঝায় তার একটি পরিবর্তন একটি BI টুলে নীরব সম্পাদনার বদলে একটি ডিফ ও একজন অনুমোদনকারীসহ পুল রিকোয়েস্ট হয়। যে মডেল আপনি নিরাপদে বিবর্তিত করতে পারেন না তা এমন মডেল হয় যা মানুষ এড়িয়ে যায়, এবং ছায়া সংজ্ঞাই সত্যের একক উৎস মারার উপায়।
ট্রেড-অফ: সুবিধা ও অসুবিধা
| পদ্ধতি | সুবিধা | অসুবিধা | সবচেয়ে ভালো মানায় |
|---|---|---|---|
| স্বাভাবিকীকৃত (3NF) | সঠিক লেখা, অতিরিক্ততা নেই, নমনীয় | ধীর বিশ্লেষণমূলক জোড়া, জটিল কোয়েরি | OLTP ও পরিচালনগত সিস্টেম |
| স্টার স্কিমা (Kimball) | দ্রুত, স্বজ্ঞাত, বিশ্লেষক-বান্ধব | কিছু অতিরিক্ততা, ETL রক্ষণাবেক্ষণ | বেশিরভাগ বিশ্লেষণ ও BI |
| স্নোফ্লেক স্কিমা | কম সংরক্ষণ, পরিষ্কার মাত্রা | বেশি জোড়া, বেশি জটিলতা | বড়, আঁটোভাবে শাসিত মাত্রা |
| ডেটা ভল্ট | পূর্ণ ইতিহাস, নিরীক্ষণযোগ্য, চটপটে লোড | অনেক টেবিল, খাড়া শেখার বক্ররেখা | অত্যন্ত নিয়ন্ত্রিত, নিরীক্ষা-ভারী |
| মডেলের ওপর শব্দার্থিক স্তর | সর্বত্র এক সংজ্ঞা, টুল-নিরপেক্ষ | অগ্রিম নির্মাণ, মালিকানা লাগে | বহু-দল, বহু-টুল প্রতিষ্ঠান |
কেন্দ্রীয় টানাপোড়েন একটি একক কোয়েরির গতি বনাম পুরো সম্পত্তি জুড়ে সঠিকতা ও নমনীয়তা। স্বাভাবিকীকরণ সঠিকতা রক্ষা করে এবং কোয়েরি জটিলতায় তার দাম দেয়; মাত্রিক মডেল কোয়েরির গতি ও স্পষ্টতা কেনে এবং ETL ও কিছু পরিচালিত অতিরিক্ততায় তার দাম দেয়। কোনো সর্বজনীন বিজয়ী নেই, তাই আপনি একটি প্রিয় বাছার বদলে মডেল ওয়ার্কলোডের সঙ্গে মেলান। শব্দার্থিক স্তর দ্বিতীয় টানাপোড়েন, অনেক দল ও অনেক টুলের মধ্যে, সমাধান করে মেট্রিক সংজ্ঞাকে তাদের কোনোটি থেকে স্বাধীন করে। ভুল হলো এগুলোকে আদর্শিক শিবির গণ্য করা। একটি সুস্থ প্রতিষ্ঠান স্বাভাবিকীকৃত OLTP সিস্টেম, সেগুলো থেকে জোগান পাওয়া মাত্রিক বিশ্লেষণমূলক মডেল, এবং ওপরে একটি শব্দার্থিক স্তর চালায়, প্রতিটি যে কাজে ভালো সেটি করে।
আপনার দলের সঙ্গে আলোচনার প্রশ্ন
দুটি ড্যাশবোর্ড একই মেট্রিকের ভিন্ন সংখ্যা দেখালে কার সংজ্ঞা জেতে, এবং সেই সংজ্ঞা ভৌতভাবে কোথায় থাকে? এই প্রশ্ন উন্মোচন করে আপনার আসলেই সত্যের একক উৎস আছে নাকি কেবল বিশ্বাস করেন যে আছে। বেশিরভাগ বড় দলে সৎ উত্তর হলো “সক্রিয় ব্যবহারকারী” ডজনখানেক ভিন্ন কোয়েরিতে পুনঃসংজ্ঞায়িত, এবং বিজয়ী সেই যে বৈঠকে সবচেয়ে জোরে তর্ক করে। প্রকৃত প্রমাণ আনুন: একটি মেট্রিক বাছুন, যেখানে যেখানে তা গণনা হয় সব খুঁজুন, এবং যুক্তি লাইন ধরে তুলনা করুন। আপনি প্রায় নিশ্চিতভাবে জানালা, বাদ এবং প্রান্ত কেসে নীরব ভিন্নমত পাবেন। উত্তর আপনাকে একটি শব্দার্থিক স্তর গড়ার সিদ্ধান্তে চালানো উচিত যেখানে প্রতিটি মেট্রিক একবার, পর্যালোচিত কোড হিসেবে সংজ্ঞায়িত, যাতে প্রশ্ন মানুষ নিয়ে থাকা বন্ধ করে একটি সংস্করণ করা নিদর্শন নিয়ে হয়। সেই সংজ্ঞার একক ভৌত ঘর না হওয়া পর্যন্ত প্রতিটি মেলানো অস্থায়ী।
আপনার সবচেয়ে গুরুত্বপূর্ণ ফ্যাক্ট টেবিলের গ্রেইন কী, এবং ঘরের প্রত্যেকে কি তা একইভাবে বলতে পারেন? গ্রেইন সেই নীরব ভিত্তি যেখানে বেশিরভাগ মডেলিং ব্যর্থতা ফিরে যায়। দলের অর্ধেক যদি বলে “প্রতি অর্ডারে একটি সারি” এবং বাকি অর্ধেক বলে “প্রতি লাইন আইটেমে একটি সারি,” তাহলে একটি রাজস্ব প্রতিবেদনে দেখা দেওয়ার অপেক্ষায় একটি দ্বিগুণ-গণনা বাগ আছে। প্রকৃত টেবিল আনুন এবং প্রত্যেককে একটি বাক্যে একটি সারি বর্ণনা করতে বলুন। এখানে ভিন্নমত মসৃণ করার মতো যোগাযোগ সমস্যা নয়; এটি আরও পরিমাপ স্তূপ হওয়ার আগে সারানোর নকশা ত্রুটি। উত্তর মডেলের নথিতে লেখা এবং পর্যালোচনায় প্রয়োগ করা উচিত, কারণ বিশ্লেষকরা একবার অস্পষ্ট গ্রেইনে কোয়েরি গড়লে অস্পষ্টতা আপনার সংশোধনের চেয়ে দ্রুত ছড়ায়।
এই মডেল পরিবর্তন কীভাবে শুষে নেবে, এবং একটি সংজ্ঞা সরলে গত বছরের প্রতিবেদনের কী হয়? প্রতিটি মডেল বদলানো উৎস সিস্টেম, বদলানো ব্যবসায়িক নিয়ম এবং বদলানো মেট্রিক সংজ্ঞার মুখোমুখি হয়, তাই প্রকৃত প্রশ্ন পরিবর্তন একটি নিয়ন্ত্রিত পুল রিকোয়েস্ট নাকি ইতিহাস পুনর্লিখন করা নীরব সম্পাদনা। একটি সাম্প্রতিক উদাহরণ আনুন: একটি মেট্রিক যার সংজ্ঞা বদলেছে, বা একটি উৎস কী যা নাম বদলেছে, এবং বিদ্যমান ড্যাশবোর্ডের কী হয়েছিল ট্রেস করুন। একটি ধীরে পরিবর্তনশীল মাত্রা ওভাররাইট করে সামলানো হলে আপনার ঐতিহাসিক প্রতিবেদন নীরবে তাদের অতীত মান বদলে থাকতে পারে, যা প্রবণতা বিশ্লেষণ বা নিয়ন্ত্রিত প্রতিবেদন করা যে কারও জন্য গুরুতর সমস্যা। উত্তর আপনাকে সারোগেট কী, সংস্করণ করা মেট্রিক সংজ্ঞা, সুস্পষ্ট পরিবর্তন কৌশল, এবং পর্যালোচনাসহ সংস্করণ নিয়ন্ত্রণে রাখা রূপান্তরের দিকে ঠেলা উচিত। যে মডেল কেউ নিরাপদে বদলাতে পারে না তা এমন মডেল হয় যা মানুষ ত্যাগ করে।
কোন মাত্রা প্রতিটি দল জুড়ে একই অর্থ বহন করতে হবে, এবং প্রতিটির মালিকানার জন্য কে জবাবদিহিযোগ্য? মেলানো মাত্রা বিপণন, অর্থ ও পরিচালনাকে ডেটা জুড়তে ও তুলনীয় উত্তর পেতে দেয়, কিন্তু কেবল যখন “গ্রাহক,” “পণ্য,” “অঞ্চল” ও “তারিখ” প্রতি দলের ব্যক্তিগত কপির বদলে একটি সম্মত সংজ্ঞা বহন করে। প্রতিদ্বন্দ্বী টান স্বায়ত্তশাসন: প্রতিটি দল নিজের বিশ্ব নিজের গতিতে মডেল করতে চায়, এবং একটি ভাগ করা মাত্রা চাপানো স্বল্পমেয়াদে তাদের ধীর করে অথচ সম্পত্তি জুড়ে ফল দেয়। সবচেয়ে বেশি আন্তঃ-দল প্রতিবেদনে দেখা দেওয়া দুই বা তিনটি মাত্রা আনুন, আজ বিদ্যমান প্রতিটির সব সংস্করণ তালিকাভুক্ত করুন, এবং দেখুন তাদের কী ও বৈশিষ্ট্য আসলে কতদূর ভিন্ন। প্রতিটি মেলানো মাত্রার একজন মালিকের নাম দিন, কারণ মালিকহীন ভাগ করা মাত্রা এক ত্রৈমাসিকের মধ্যে ব্যক্তিগত কপিতে ফিরে যায়। এন্টারপ্রাইজ ও সরকারি পরিবেশে, যেখানে এক বিভাগের সংখ্যা জনসম্মুখে অন্যটির সঙ্গে তুলনা করা হয়, একটি অমেলানো মাত্রা সৎ তুলনা ও দুর্ঘটনাজনিত মিথ্যার মধ্যে পার্থক্য, তাই আগে ঠিক করুন কোন মাত্রা কেন্দ্রীয়ভাবে শাসিত এবং কোনটি স্থানীয় থাকে।
আপনার স্বাভাবিকীকৃত লেনদেনমূলক সিস্টেম ও অ-স্বাভাবিকীকৃত বিশ্লেষণমূলক মডেলের মধ্যে সীমানা কোথায়, এবং প্রতিটি অ-স্বাভাবিকীকরণ কি একটি সুচিন্তিত সিদ্ধান্ত? মডেল ওয়ার্কলোডের সঙ্গে মেলানো মূল শৃঙ্খলা, তবু সীমানাই ঠিক সেই জায়গা যেখানে তা ঝাপসা হয়: একজন বিশ্লেষক গতির জন্য একটি ওয়্যারহাউস টেবিল অ-স্বাভাবিকীকরণ করেন, একজন ইঞ্জিনিয়ার অভ্যাসবশত একটি প্রতিবেদন টেবিল স্বাভাবিকীকরণ করেন, এবং কেউ লেখেনি প্রতিটি পছন্দ কোন পক্ষের। টানাপোড়েন একটি একক কোয়েরির গতি বনাম সবকিছু জুড়ে সঠিকতা ও নমনীয়তা, এবং যুক্তিসঙ্গত মানুষ ভিন্ন জায়গায় নামে নির্ভর করে তারা লেখা নাকি পড়ার মালিক তার ওপর। আপনার সবচেয়ে ধীর বিশ্লেষণমূলক কোয়েরি এবং সবচেয়ে প্রতিযোগিতাপূর্ণ লেনদেনমূলক টেবিল আনুন, এবং প্রতিটি অতিরিক্ত কলামের জন্য জিজ্ঞেস করুন তার অতিরিক্ততা একটি নথিবদ্ধ কারণে বাছা হয়েছিল নাকি দুর্ঘটনাক্রমে ঢুকেছিল। লক্ষ্য একটি বিশুদ্ধতার প্রতিযোগিতা নয়, কখন অ-স্বাভাবিকীকরণ অনুমোদিত এবং কে স্বাক্ষর করে তার একটি লিখিত নিয়ম। বড় বা নিয়ন্ত্রিত প্রতিষ্ঠানের জন্য এই সীমানা ব্যক্তিগত ডেটা কোথায় নকল হয় তাও ঠিক করে, তাই একটি অনথিবদ্ধ অ-স্বাভাবিকীকরণ একই সঙ্গে একটি কর্মক্ষমতা প্রশ্ন এবং একটি ডেটা-শাসন উন্মুক্ততা যা কাউকে শেষ পর্যন্ত একজন নিরীক্ষকের কাছে ব্যাখ্যা করতে হবে।
আপনার কি শব্দার্থিক স্তর গড়া উচিত নাকি কেনা, এবং এটি থাকলে প্রতিটি মেট্রিক সংজ্ঞা হালনাগাদ রাখার জন্য কে জবাবদিহিযোগ্য? একটি শব্দার্থিক স্তর কেবল তখনই সত্যের একক উৎস দেয় যখন এটি মালিকানাধীন ও রক্ষণাবেক্ষণ করা হয়, তাই টুল বাছাই কে “রাজস্ব” কী বোঝায় তার পরিবর্তন পর্যালোচনা করে এবং একটি সংজ্ঞা বাসি হলে কে দায়ী, সেই উত্তরের চেয়ে কম গুরুত্বপূর্ণ। প্রতিদ্বন্দ্বী বিবেচনা প্রকৃত: গড়া আপনাকে নিয়ন্ত্রণ দেয় ও আপনার স্ট্যাকে মানায় কিন্তু প্রকৌশল বোঝা যোগ করে, যখন একটি মেট্রিক টুল কেনা দ্রুততর কিন্তু লক-ইন এবং আপনি পুরোপুরি নিয়ন্ত্রণ করেন না এমন একটি সংজ্ঞা ভাষার ঝুঁকি আনে। আপনার মুষ্টিমেয় সর্বোচ্চ-ঝুঁকির মেট্রিক, আজ সেগুলো ভোগকারী টুল, এবং কেউ বর্তমানে সেই সংজ্ঞার মালিক নাকি সেগুলো কেবল আছে তার একটি সৎ পাঠ আনুন। আগে থেকে ঠিক করুন সংজ্ঞা নামকরা মালিক ও টেস্টসহ সংস্করণ করা কোড হিসেবে থাকবে কি না, কারণ কেউ রক্ষণাবেক্ষণ করে না এমন একটি শব্দার্থিক স্তর সেই ছড়ানো সংজ্ঞায় পচে যা সে প্রতিস্থাপন করার কথা ছিল। এন্টারপ্রাইজ ও সরকারি প্রতিবেদনে, যেখানে একটি জনসাধারণের ড্যাশবোর্ডের মেট্রিক একটি নথিবদ্ধ, পর্যালোচিত সংজ্ঞায় ট্রেসযোগ্য হতে হবে, সেই মালিকানা এবং একটি সংখ্যার বংশধারা প্রমাণ করার সামর্থ্যই শব্দার্থিক স্তরকে সুবিধা থেকে নিরীক্ষণযোগ্য নিয়ন্ত্রণে পরিণত করে।
খাতভেদে দৃষ্টিভঙ্গি
স্টার্টআপ। মডেলিং অপেক্ষা করতে পারে, কিন্তু সংজ্ঞা পারে না। দুজন ইঞ্জিনিয়ার আর ওয়্যারহাউস গড়ার রানওয়ে নেই, তাই আপনার রূপান্তর টুলে একটি ছোট শব্দার্থিক স্তর বসান এবং আপনার বোর্ড আসলে যে দুই-তিনটি মেট্রিক দেখে, “সক্রিয় ব্যবহারকারী” ও “রাজস্ব”, একবার পরীক্ষিত কোড হিসেবে সংজ্ঞায়িত করুন। ডেটা ভল্ট ও বিস্তৃত মাত্রিক স্কিমা এড়ান; একটি পাতলা স্টার ও মুষ্টিমেয় শাসিত সংজ্ঞা ডেলিভারি ধীর না করে সামঞ্জস্যপূর্ণ সংখ্যা কেনে। প্রতিদান হলো বোর্ড প্রস্তুতি আর কার কোয়েরি সঠিক তা নিয়ে তর্ক থাকে না।
ছোট ব্যবসা। আপনার কোনো ডেটা মডেলার নেই এবং মেট্রিক প্ল্যাটফর্মের বাজেট নেই, তাই আপনি ইতিমধ্যে চালানো টুলে গাঁথা সংজ্ঞার ওপর ঝুঁকুন এবং গুরুত্বপূর্ণ কয়েকটি এমন একটি ভাগ করা নথিতে লিখে রাখুন যা সবাই পড়ে। আপনি কর্মী দিতে পারেন না এমন ওয়্যারহাউস দাঁড় করানোর বদলে আপনার বিদ্যমান সফটওয়্যারে এমবেডেড বিশ্লেষণ কেনা পছন্দ করুন। যেখানে মডেল করেন সেখানে সরল রাখুন এবং সামঞ্জস্যপূর্ণভাবে নাম দিন, কারণ আগামী বছর রক্ষণাবেক্ষণ করা ব্যক্তি এমন হতে পারেন যিনি মনে করতে পারেন না কেন “গ্রাহক” দুটি জিনিস বোঝাত। সামঞ্জস্য মেলানোর চেয়ে সস্তা।
এন্টারপ্রাইজ। সমস্যা অনেক দল ও অনেক টুল ব্যক্তিগত সংজ্ঞায় সরে যাওয়া, তাই মেলানো মাত্রা, একটি শাসিত শব্দার্থিক স্তর, এবং মালিক ও পর্যালোচনাসহ সংস্করণ করা কোড হিসেবে রাখা মেট্রিক সংজ্ঞায় বিনিয়োগ করুন। সম্পত্তি জুড়ে নামকরণ, গ্রেইন ঘোষণা এবং ধীরে পরিবর্তনশীল মাত্রা কৌশল প্রমিত করুন যাতে এক টুলের সংখ্যা অন্যটির একই সংখ্যার সঙ্গে মেলে। শব্দার্থিক স্তরকে রোডম্যাপ ও মালিক দলসহ পণ্য গণ্য করুন, এবং এটি কত মেলানোর সময় সরায় তা মাপুন। প্রতিদান হলো ব্যবসা জুড়ে বিশ্বস্ত সংখ্যা এবং নিরীক্ষা যা একটি বোর্ড ডেক থেকে উৎসে পরিষ্কারভাবে ট্রেস করে।
সরকার। স্বচ্ছতা ও আন্তঃ-সংস্থা তুলনীয়তা কাজ আকার দেয়: ভূগোল ও জনতত্ত্বের জন্য আদর্শ রেফারেন্স ডেটা, মূল সূচকের শাসিত সংজ্ঞা, এবং সংস্করণ করা রিলিজসহ প্রকাশিত পদ্ধতি যাতে জনসাধারণ যেকোনো সংখ্যা একটি নথিবদ্ধ সংজ্ঞায় ট্রেস করতে পারে। ক্রয় নিয়ম দাবি করতে পারে আপনার মডেল ও সংজ্ঞা বহনযোগ্য ও বিক্রেতা-নিরপেক্ষ থাকবে, তাই একটি মালিকানাধীন টুলে আটকানো শব্দার্থিক স্তর এড়ান। যা জাতীয়ভাবে প্রতিবেদিত হয় তার জন্য ভাগ করা মাত্রা মেনে চলার সময় স্বতন্ত্র সংস্থাগুলোকে তাদের পরিচালনগত ডেটা মডেল করতে মুক্ত রাখুন। একটি সংস্করণ করা সংজ্ঞায় ট্রেস করা যায় না এমন একটি প্রকাশিত সূচক ডেটার ব্যর্থতার সমান জবাবদিহির ব্যর্থতা।
উদাহরণ
স্টার্টআপ। একটি সিরিজ A কোম্পানির “সক্রিয় ব্যবহারকারী”-র তিনটি সংজ্ঞা তিন জায়গায় ছিল: পণ্য বিশ্লেষণ টুল, অর্থ স্প্রেডশিট এবং বিনিয়োগকারী ডেক। সংখ্যা কখনো মেলেনি, এবং প্রতিটি বোর্ড প্রস্তুতি হুড়োহুড়ি হতো। দুজন ইঞ্জিনিয়ার তাদের রূপান্তর টুলে একটি ছোট শব্দার্থিক স্তর চালু করেন, “সক্রিয় ব্যবহারকারী” ও “মাসিক পুনরাবৃত্ত রাজস্ব” একবার পরীক্ষিত কোড হিসেবে সংজ্ঞায়িত করে, সুনির্দিষ্ট জানালা ও বাদ লিখে। প্রতিটি ড্যাশবোর্ড এখন সেই সংজ্ঞা পড়ে। বোর্ড-প্রস্তুতির তর্ক উধাও হয়, এবং একজন নতুন বিশ্লেষককে অন্তর্ভুক্ত করা এক সপ্তাহের গোষ্ঠীগত জ্ঞান থেকে একটি নথিবদ্ধ মডেল পড়ায় নেমে আসে। এটি অধ্যায় 7.4 (পণ্য বিশ্লেষণ ও পরীক্ষা)-য় বর্ণিত শৃঙ্খলার সঙ্গে সরাসরি যুক্ত, যেখানে “সক্রিয়”-র একটি স্থির সংজ্ঞাই পরীক্ষার ফল তুলনীয় করে।
এন্টারপ্রাইজ। একটি বৈশ্বিক খুচরা বিক্রেতা বিপণন, অর্থ, সরবরাহ শৃঙ্খল, পণ্য বিন্যাস ও দোকান জুড়ে পাঁচটি বিজনেস-ইন্টেলিজেন্স টুল চালাত, এবং প্রতিটি “মোট মার্জিন” সামান্য ভিন্নভাবে পুনরাবিষ্কার করেছিল। তারা মেলানো মাত্রাসহ একটি Kimball-ধাঁচের ওয়্যারহাউসের ওপর একটি শব্দার্থিক স্তর গড়ে, যাতে “পণ্য,” “দোকান” ও “তারিখ” প্রতিটি ফ্যাক্ট টেবিল ও প্রতিটি টুল জুড়ে একই অর্থ বহন করে। প্রতিটি মেট্রিক একবার সংজ্ঞায়িত এবং সর্বত্র ভোগ করা হয়। যে মেলানো বৈঠক ত্রৈমাসিকে দিন খেত তা বেশিরভাগ উধাও হয়, এবং অর্থ বিভাগ যখন ফেরত মার্জিনে কীভাবে প্রভাব ফেলে বদলায়, পরিবর্তন পাঁচটি টুলে একসঙ্গে প্রসারিত হয়। মেলানো মাত্রাই স্বাধীন দলগুলোকে সন্দেহের বদলে আত্মবিশ্বাসে ডেটা জুড়তে দিয়েছিল।
সরকার। একটি জাতীয় সরকারের স্বাস্থ্য, শ্রম ও শিক্ষা সংস্থা জুড়ে তুলনীয় প্রতিবেদন দরকার ছিল, যার প্রতিটি ঐতিহাসিকভাবে “পরিবার,” “অঞ্চল” ও “কর্মসংস্থান” নিজের মতো সংজ্ঞায়িত করেছিল। একটি আন্তঃ-সংস্থা সংস্থা ভাগ করা রেফারেন্স ডেটা ও মানক সংজ্ঞা প্রতিষ্ঠা করে: ভূগোল ও জনতত্ত্বের জন্য আদর্শ মাত্রা টেবিল, এবং মূল সূচকের শাসিত সংজ্ঞা, পদ্ধতি ও সংস্করণ করা রিলিজসহ প্রকাশিত। স্বতন্ত্র সংস্থাগুলো তাদের নিজস্ব পরিচালনগত ডেটা মডেল করে কিন্তু জাতীয়ভাবে যা প্রতিবেদিত হয় তার জন্য ভাগ করা মাত্রা ও সংজ্ঞা মেনে চলে। ফল হলো এক সংস্থার সংখ্যা অন্যটির সঙ্গে সততার সঙ্গে তুলনা করা যায়, এবং জনসাধারণ যেকোনো প্রকাশিত সূচক একটি নথিবদ্ধ সংজ্ঞায় ট্রেস করতে পারে, অধ্যায় 7.1-এ কভার করা স্বচ্ছতা বাধ্যবাধকতা সমর্থন করে।
ব্যবসায়িক যুক্তি: প্রেরণা, ROI ও TCO
ভালো মডেলিং ও একটি শব্দার্থিক স্তরের প্রতিদান বেশিরভাগ পুনরুদ্ধার করা সময় ও এড়ানো ত্রুটি। অনেক প্রতিষ্ঠানে বিশ্লেষকরা তাদের বেশিরভাগ সময় ডেটা খুঁজতে, পরস্পরবিরোধী সংখ্যা মেলাতে এবং অন্যরা ইতিমধ্যে লেখা সংজ্ঞা পুনর্নির্মাণে ব্যয় করেন। প্রতিটি মেট্রিকের একক শাসিত সংজ্ঞা সেই পুনরাবৃত্ত কাজকে এককালীন বিনিয়োগে পরিণত করে। এটি ব্যয়বহুল ব্যর্থতার পুরো একটি শ্রেণিও সরায়: বোর্ড ডেকে ভুল সংখ্যা, নিরীক্ষা পর্যবেক্ষণ ঘটানো ভুল প্রতিবেদিত সংখ্যা, ত্রৈমাসিক-দীর্ঘ মেলানো প্রকল্প যা কেবল আছে কারণ দুই দল “রাজস্ব” ভিন্নভাবে সংজ্ঞায়িত করেছিল। সংজ্ঞা যখন একটি পর্যালোচিত জায়গায় থাকে, সেই ব্যর্থতা বেশিরভাগ ঘটা বন্ধ করে।
খরচ প্রকৃত এবং নাম নেওয়ার যোগ্য। আপনি অগ্রিম ধারণাগত ও যৌক্তিক মডেলিংয়ে, শব্দার্থিক স্তর গড়া ও ভরায়, এবং সংজ্ঞা হালনাগাদ রাখা চলমান মালিকানায় বিনিয়োগ করেন। মালিকানার মোট খরচ (TCO)-তে টুলিং, মডেলিং ও বিশ্লেষণ-প্রকৌশল সময় এবং মডেলকে ড্রিফট থেকে রাখার শাসন আছে। এটি না করার খরচের বিপরীতে ওজন করুন, যা বড় কিন্তু লুকানো: এটি নকল পাইপলাইন, মানব মেলানো-ইঞ্জিন হিসেবে বিশ্লেষক, এবং কেউ রক্ষা করতে পারে না এমন সংখ্যায় আত্মবিশ্বাসী সিদ্ধান্ত নেওয়া নির্বাহীদের হিসেবে দেখা দেয়। নেতৃত্বের কাছে তাদের ভাষায় যুক্তি দিন। প্রতিটি মেট্রিকের একটি বিশ্বস্ত সংজ্ঞাই তাদের ব্যবসা জুড়ে তুলনা করতে, ড্যাশবোর্ড বিশ্বাস করতে এবং ফায়ার ড্রিল ছাড়া নিয়ন্ত্রকদের উত্তর দিতে দেয়। যেখানে মেলানোর ব্যথা সবচেয়ে খারাপ সেখানে শুরু করুন, সেই অল্প মেট্রিক একবার সংজ্ঞায়িত করুন, এবং পুনরুদ্ধার করা সময়কে বাকিটার অর্থায়ন করতে দিন।
অ্যান্টি-প্যাটার্ন ও ফাঁদ
- সরাসরি ভৌত টেবিলে লাফ দেওয়া, আজকের প্রযুক্তি এমন সিদ্ধান্তে গাঁথা যা তাকে ছাড়িয়ে টেকা উচিত।
- একই মেট্রিক প্রতিটি ড্যাশবোর্ডে স্বাধীনভাবে সংজ্ঞায়িত করা, ফলে দুটি সংখ্যা মেলে না।
- গ্রেইন অনুক্ত রাখা, তারপর রাজস্ব প্রতিবেদনে দ্বিগুণ-গণনা করা পরিমাপ আবিষ্কার করা।
- নথিবদ্ধ সিদ্ধান্তের বদলে দুর্ঘটনাক্রমে বিশ্লেষণমূলক টেবিল অ-স্বাভাবিকীকরণ।
- একটি বিশ্লেষণমূলক ওয়্যারহাউস এতটা স্বাভাবিকীকরণ যে প্রতিটি কোয়েরি কেউ না বোঝা বারো-টেবিল জোড়া।
- ধীরে পরিবর্তনশীল মাত্রা ওভাররাইট করে সামলানো, ফলে ঐতিহাসিক প্রতিবেদন নীরবে অতীত পুনর্লিখন করে।
- সর্বত্র প্রাকৃতিক কী ব্যবহার, ফলে একটি উৎস-সিস্টেম কী পরিবর্তন পুরো ওয়্যারহাউস জুড়ে ঢেউ তোলে।
- মালিকহীন একটি শব্দার্থিক স্তর গড়া, ফলে সংজ্ঞা ড্রিফট করে ও আস্থা ক্ষয় হয়।
- মডেলকে লঞ্চে সম্পন্ন গণ্য করা, বিবর্তনযোগ্য থাকতে হবে এমন জীবন্ত সম্পদের বদলে।
পরিপক্বতা মডেল
- স্তর 1, সূচনা: মডেলিং অন্তর্নিহিত ও প্রতিক্রিয়াশীল। টেবিল যার দরকার সে ভৌত-প্রথম নকশা করে। মেট্রিক প্রতিটি প্রতিবেদনে পুনঃসংজ্ঞায়িত, এবং সংখ্যা নিয়মিত সংঘর্ষ করে। গ্রেইন অনথিবদ্ধ, এবং সংজ্ঞার মালিক কেউ নন।
- স্তর 2, বিকাশ: কিছু বিশ্লেষণমূলক টেবিল মাত্রিক প্যাটার্ন অনুসরণ করে, এবং কয়েকটি মূল মেট্রিকের লিখিত সংজ্ঞা আছে, কিন্তু সেগুলো একটি উইকিতে থাকে এবং প্রয়োগ করা হয় না। নামকরণ রীতি কাগজে আছে। চর্চা দল-ধরে-দল ভিন্ন, এবং মেলানো এখনো ঘন ঘন ও ম্যানুয়াল।
- স্তর 3, মানসম্মতকরণ: ধারণাগত, যৌক্তিক ও ভৌত মডেল স্বতন্ত্র ও পর্যালোচিত। একটি শব্দার্থিক স্তর মূল মেট্রিক একবার, মালিকসহ সংস্করণ করা কোড হিসেবে সংজ্ঞায়িত করে। মেলানো মাত্রা দলকে নিরাপদে জুড়তে দেয়। গ্রেইন ও ধীরে পরিবর্তনশীল মাত্রা কৌশল প্রতিষ্ঠান জুড়ে নথিবদ্ধ ও পর্যালোচনায় প্রয়োগ করা।
- স্তর 4, ব্যবস্থাপনা: মডেল সম্পত্তি ভিত্তিরেখার বিপরীতে মাপা। আপনি অনুসরণ করেন মেট্রিক-সংজ্ঞা কভারেজ (শব্দার্থিক স্তরের সেবা পাওয়া প্রতিবেদিত মেট্রিকের অংশ), এখনো ব্যবহৃত নকল বা ছায়া সংজ্ঞার গণনা, প্রতি ত্রৈমাসিকে ব্যয় হওয়া মেলানোর ঘণ্টা, এবং প্রোডাকশনের বিপরীতে পর্যালোচনায় ধরা গ্রেইন ও বংশধারা ত্রুটির হার। সংজ্ঞা পরিবর্তন টেস্টসহ পর্যালোচিত পুল রিকোয়েস্টের মধ্য দিয়ে যায়, এবং সতেজতা, টেস্ট-পাস হার ও ড্রিফট ড্যাশবোর্ডে পর্যবেক্ষিত। একটি মেট্রিক ভিন্ন হলে বা একটি মাত্রা মেলা বন্ধ করলে, পরিমাপ একটি বোর্ড বৈঠকের আগেই তা তুলে ধরে।
- স্তর 5, সমন্বয়: প্রতিটি গুরুত্বপূর্ণ মেট্রিকের একটি শাসিত সংজ্ঞা আছে যা সব টুল ও দল ভোগ করে, এবং শব্দার্থিক স্তর বিশ্লেষণ, পরীক্ষা ও নিয়ন্ত্রিত প্রতিবেদনের সঙ্গে একীভূত। মডেল নকশায় বিবর্তনযোগ্য ও নিরন্তর পরিমার্জিত; সংজ্ঞা প্রতিষ্ঠান-ব্যাপী বিশ্বস্ত; মেলানোর কাজ বেশিরভাগ অদৃশ্য হয়েছে। ব্যবসা বদলালে প্রতিষ্ঠান নিয়মিত নতুন মাত্রা অবচয়, পুনঃপরিসর ও মেলায়, মডেল সম্পত্তিকে একটি অভিযোজিত সম্পদ হিসেবে পুনঃভারসাম্য করে।
আলোচনার ভাবনা
- আপনার তিনটি সবচেয়ে গুরুত্বপূর্ণ মেট্রিক বাছুন। আজ আপনার টুল জুড়ে প্রতিটির কয়টি স্বতন্ত্র সংজ্ঞা আছে, এবং সেগুলোকে একটিতে ভেঙে আনতে কী লাগবে?
- অনুক্ত গ্রেইন কোথায় একটি প্রকৃত প্রতিবেদন ত্রুটি ঘটিয়েছে, এবং লক্ষ করতে কত সময় লেগেছিল?
- আপনার কোন মাত্রা দল জুড়ে আগে মেলানো উচিত, এবং তাদের মালিক কে?
- আপনার মেট্রিক সংজ্ঞা কি পর্যালোচনাসহ সংস্করণ নিয়ন্ত্রণে আছে, নাকি একটি BI টুলের ভেতরে নীরবে সম্পাদনযোগ্য?
- শেষবার কখন একটি ধীরে পরিবর্তনশীল মাত্রা কেউ লক্ষ না করে আপনার ইতিহাস পুনর্লিখন করেছিল, এবং পরেরবার আপনি কীভাবে তা ধরবেন?
- আপনি আগামীকাল আপনার ওয়্যারহাউস ইঞ্জিন বদলালে আপনার মডেলের অর্থের কতটা সেই সরানো টিকবে?
প্রধান শিক্ষা
- ডেটা মডেলিং হলো ডেটার অর্থ কী ঠিক করা, এবং সেই অর্থ আপনার বাছা প্রতিটি সংরক্ষণ প্রযুক্তিকে ছাড়িয়ে টেকে।
- ক্রমানুসারে তিন স্তরে মডেল করুন: ধারণাগত, তারপর যৌক্তিক, তারপর ভৌত।
- সঠিকতার জন্য লেনদেনমূলক সিস্টেম স্বাভাবিকীকরণ করুন; গতির জন্য বিশ্লেষণমূলকগুলো সুচিন্তিতভাবে অ-স্বাভাবিকীকরণ করুন।
- বিশ্লেষণের জন্য ফ্যাক্ট, মাত্রা এবং একটি ঘোষিত গ্রেইনসহ মাত্রিক মডেলিং ব্যবহার করুন।
- একটি শব্দার্থিক স্তর গড়ুন যাতে প্রতিটি ব্যবসায়িক মেট্রিকের সর্বত্র একক শাসিত সংজ্ঞা থাকে।
- মেলানো মাত্রা স্বাধীন দলগুলোকে আত্মবিশ্বাসে তাদের ডেটা জুড়তে ও তুলনা করতে দেয়।
- মডেল বিবর্তনযোগ্য রাখতে ভালো নাম দিন, নথিবদ্ধ করুন, সারোগেট কী ব্যবহার করুন এবং সংজ্ঞা সংস্করণ করুন।
তথ্যসূত্র ও আরও পড়ার জন্য
- Ralph Kimball ও Margy Ross, The Data Warehouse Toolkit: The Definitive Guide to Dimensional Modelling.
- Bill Inmon, Building the Data Warehouse.
- Dan Linstedt ও Michael Olschimke, Building a Scalable Data Warehouse with Data Vault 2.0.
- Peter Chen, “The Entity-Relationship Model: Toward a Unified View of Data,” ACM Transactions on Database Systems.
- E. F. Codd, “A Relational Model of Data for Large Shared Data Banks,” Communications of the ACM.
- C. J. Date, An Introduction to Database Systems.
- Lars Rönnbäck and colleagues, writings on anchor modelling.
- DAMA International, DAMA-DMBOK: Data Management Body of Knowledge.