9.5

View in English

9.5 দুর্যোগ পুনরুদ্ধার ও ব্যবসা ধারাবাহিকতা

পরিচিতি ও প্রেরণা

আজ বা কাল, আপনি পরিকল্পনা করেননি এমন কিছু একটি সিস্টেম নামিয়ে দেবে: অঞ্চল-ব্যাপী ক্লাউড বিভ্রাট, ভুল আঙুলে লেখা DROP TABLE, ডেটা সেন্টারে বন্যা, র‍্যানসমওয়্যার বিস্ফোরণ, বা রাতারাতি উধাও হওয়া একজন সরবরাহকারী। প্রশ্ন কখনো বিঘ্ন আসবে কি না নয়, আপনি কত দ্রুত সেরে ওঠেন এবং প্রক্রিয়ায় কতটা হারান। এই অধ্যায় খারাপ দিন আসার আগেই তার জন্য প্রস্তুত থাকার বিষয়ে।

দুটি শৃঙ্খলা সেই প্রস্তুতির উত্তর দেয়, এবং তারা এক জিনিস নয়। ব্যবসা ধারাবাহিকতা পরিকল্পনা (BCP) একটি বিঘ্নের মধ্য দিয়ে পুরো প্রতিষ্ঠানকে সচল রাখে: মানুষ, অফিস, যোগাযোগ, বেতন এবং গ্রাহকদের নির্ভর করা জটিল ব্যবসায়িক প্রক্রিয়া। দুর্যোগ পুনরুদ্ধার (DR) সংকীর্ণতর, প্রযুক্তিগত কাজ: ব্যর্থ হওয়ার পর IT সিস্টেম ও ডেটা পুনরুদ্ধার। ধারাবাহিকতা লক্ষ্য; পুনরুদ্ধার উপায়গুলোর একটি। আপনি প্রতিটি সার্ভার পুনরুদ্ধার করেও গ্রাহকদের ব্যর্থ করতে পারেন যদি কেউ না জানে কে দুর্যোগ ঘোষণা করতে অনুমোদিত বা তাদের কাছে কীভাবে পৌঁছাবে। এই অধ্যায় DR-কে প্রকৌশল চর্চা এবং BCP-কে সেটি যে ব্যবসায়িক কাঠামোর সেবা করে তা গণ্য করে।

বড় দলের জন্য ঝুঁকি আপনার সঙ্গে স্কেল করে। একটি এন্টারপ্রাইজ নিয়ন্ত্রক পুনরুদ্ধার বাধ্যবাধকতা, বহু-অঞ্চল পদচিহ্ন এবং মুষ্টিমেয় সরবরাহকারীতে কেন্দ্রীভূত ঝুঁকি বহন করে। সরকার নাগরিকদের জন্য অপরিহার্য কার্যাবলি টিকিয়ে রাখার আইনি দায়িত্ব বহন করে, যা কার্যক্রম ধারাবাহিকতা হিসেবে কোডবদ্ধ। দুটিই যাচাইয়ের অধীনে কাজ করে যেখানে একটি অপরীক্ষিত পরিকল্পনা এমন দায় যা আপনি সবচেয়ে খারাপ সম্ভাব্য মুহূর্তে আবিষ্কার করবেন। পুনরুদ্ধার সেই জায়গা যেখানে নির্ভরযোগ্যতা (অধ্যায় 9.1) ও ঘটনা সাড়া (অধ্যায় 9.3) সেই কঠিনতর প্রশ্নের সঙ্গে মেলে যে আপনি নকশা করে এড়াতে পারেন না এমন ব্যর্থতা কীভাবে টিকবেন।

মূল নীতিসমূহ

  • ধারাবাহিকতা পুনরুদ্ধারের চেয়ে বিস্তৃত। সার্ভার পুনরুদ্ধার করা আর ব্যবসা চালু রাখা এক জিনিস নয়।
  • দুটি সংখ্যা সবকিছু চালায়। ব্যবসায়িক প্রভাব থেকে ঠিক করা পুনরুদ্ধার সময় উদ্দেশ্য (RTO) ও পুনরুদ্ধার বিন্দু উদ্দেশ্য (RPO) প্রতিটি সিদ্ধান্তের আকার দেয়।
  • একটি অপরীক্ষিত ব্যাকআপ ব্যাকআপ নয়। আপনি কখনো সম্পাদন না করা একটি পুনরুদ্ধার আশা, সামর্থ্য নয়।
  • ব্যাকআপকে লক্ষ্য ধরে নিন। র‍্যানসমওয়্যার আগে আপনার ব্যাকআপ শিকার করে, তাই কপি অপরিবর্তনীয় ও অফলাইন রাখুন।
  • স্মৃতি থেকে নয়, কোড থেকে পুনর্নির্মাণ করুন। সোর্স থেকে অবকাঠামো পুনঃসৃষ্টি করতে না পারলে আপনি নির্ভরযোগ্যভাবে পুনরুদ্ধার করতে পারবেন না।
  • আপনি যার ওপর নির্ভর করেন তা মানচিত্র করুন। আপনি আপনার সবচেয়ে ধীর উজান নির্ভরতার মতোই দ্রুত পুনরুদ্ধার করেন।
  • অন্য যেকোনো সিস্টেমের মতো পুনরুদ্ধার মাপুন। একটি স্লাইডে লেখা সংখ্যা নয়, প্রকৃত মহড়া থেকে প্রকৃত RTO ও RPO।

সুপারিশ

একটি ব্যবসায়িক প্রভাব বিশ্লেষণ থেকে RTO ও RPO ঠিক করুন

প্রতিটি পুনরুদ্ধার সিদ্ধান্ত দুটি সংখ্যা থেকে নামে, তাই আগে সেগুলো ঠিক করুন। পুনরুদ্ধার সময় উদ্দেশ্য (RTO) হলো ক্ষতি অগ্রহণযোগ্য হওয়ার আগে একটি সিস্টেম কতক্ষণ বন্ধ থাকতে পারে। পুনরুদ্ধার বিন্দু উদ্দেশ্য (RPO) হলো আপনি কতটা ডেটা হারাতে পারেন, যে সর্বশেষ ভালো কপিতে ফিরতে পারেন তার বয়স হিসেবে মাপা। একটি পেমেন্ট খতিয়ান মিনিটের RTO ও শূন্যের কাছাকাছি RPO দাবি করতে পারে; একটি অভ্যন্তরীণ বিশ্লেষণ ড্যাশবোর্ড প্রতিটির জন্য একদিন সহ্য করতে পারে। আপনি এগুলো প্রকৌশলে ঠিক করতে পারেন না। একটি ব্যবসায়িক প্রভাব বিশ্লেষণ (BIA) থেকে এগুলো আহরণ করুন যা ব্যবসায়িক প্রক্রিয়াকে তাদের বিঘ্নের খরচ অনুযায়ী র‍্যাঙ্ক করে এবং প্রতিটিকে তার দরকারি সিস্টেম ও ডেটায় ট্রেস করে। আঁটোতর উদ্দেশ্য বেশি খরচ করে, তাই BIA-ই আপনাকে একটি তুচ্ছ সেবায় সোনার প্রলেপ এবং একটি জটিলকে কম-সুরক্ষিত রাখা থেকে ঠেকায়।

ব্যাকআপ ঠিকমতো করুন: ৩-২-১ নিয়ম, অপরিবর্তনীয়তা ও টেস্টিং

ব্যাকআপ প্রতিটি পুনরুদ্ধার কৌশলের নিচের তল, এবং বেশিরভাগ প্রতিষ্ঠান ভাবার চেয়ে খারাপভাবে তা করে। ৩-২-১ নিয়ম নামে পরিচিত ব্যাকআপ শৃঙ্খলা অনুসরণ করুন: আপনার ডেটার অন্তত তিনটি কপি রাখুন, দুটি ভিন্ন মাধ্যম বা সিস্টেমে, একটি কপি সাইটের বাইরে। আধুনিক হুমকি আরও দুটি প্রয়োজন যোগ করে। অন্তত একটি কপি অপরিবর্তনীয় (একবার-লেখা, একটি ধারণ জানালা জুড়ে মুছে ফেলা অসম্ভব) এবং আদর্শভাবে অফলাইন বা এয়ার-গ্যাপড রাখুন, কারণ র‍্যানসমওয়্যার এখন নিজেকে ঘোষণা করার আগে ইচ্ছাকৃতভাবে নাগালযোগ্য ব্যাকআপ এনক্রিপ্ট বা মুছে ফেলে। সর্বোপরি, একটি সূচিতে পুনরুদ্ধার পরীক্ষা করুন। একটি অপরীক্ষিত ব্যাকআপ ব্যাকআপ নয়, এটি একটি অপরীক্ষিত ধারণা, এবং মহড়ায় আপনি যে ব্যর্থতা খুঁজে পান (দূষিত আর্কাইভ, অনুপস্থিত এনক্রিপশন কী, ভুল ভলিউমের ব্যাকআপ) ঠিক সেগুলোই একটি প্রকৃত ঘটনায় আপনাকে শেষ করত।

খরচ-বনাম-গতি বর্ণালী বরাবর একটি DR কৌশল বাছুন

DR কৌশল পুনরুদ্ধার গতির বিনিময়ে অর্থ দেয়, এবং আপনার প্রতিটির জন্য একটি স্তর কেনার বদলে প্রতি সিস্টেমে তার RTO ও RPO অনুযায়ী বাছা উচিত। চারটি প্যাটার্ন বর্ণালী নোঙর করে। ব্যাকআপ ও পুনরুদ্ধার সস্তাতম ও ধীরতম: দুর্যোগ আঘাত করলে আপনি ব্যাকআপ থেকে পুনর্নির্মাণ করেন, ঘণ্টা থেকে দিনের RTO সহ। পাইলট লাইট একটি ন্যূনতম কোর (ডেটাবেস প্রতিলিপি হচ্ছে, মূল কনফিগ জায়গায়) উষ্ণ কিন্তু ছোট করা রাখে, প্রসারণের জন্য প্রস্তুত। উষ্ণ স্ট্যান্ডবাই পুরো স্ট্যাকের একটি ছোট সর্বদা-চালু কপি চালায় যা আপনি ফেইলওভারে স্কেল আপ করেন, RTO মিনিটে নামিয়ে। বহু-সাইট সক্রিয়-সক্রিয় দুই বা ততোধিক স্থানে জীবন্ত ট্রাফিক সেবা দিয়ে পূর্ণ ক্ষমতা চালায়, সর্বোচ্চ খরচ ও জটিলতায় প্রায়-শূন্য RTO দেয়। ব্যবসা যে সংখ্যায় স্বাক্ষর করেছে তার সঙ্গে স্তর মেলান, এবং পাইলট লাইট সহ্য করা সিস্টেমের জন্য সক্রিয়-সক্রিয় দাম দেবেন না।

সামঞ্জস্য ট্রেড-অফ মনে রেখে ডেটা প্রতিলিপি করুন

পুনরুদ্ধারের গতি নির্ভর করে আপনার স্ট্যান্ডবাই ডেটা কতটা হালনাগাদ তার ওপর, এবং এখানে আপনি বিতরিত সিস্টেম (অধ্যায় 3.3)-এর কঠিন সমস্যা উত্তরাধিকার পান। সিঙ্ক্রোনাস প্রতিলিপি স্বীকার করার আগে প্রতিটি লেখা একটি দ্বিতীয় স্থানে নিশ্চিত করে, যোগ হওয়া লেখা বিলম্ব ও দূরত্বের একটি কঠিন সীমার খরচে শূন্যের কাছাকাছি RPO দেয়। অ্যাসিঙ্ক্রোনাস প্রতিলিপি স্থানীয়ভাবে স্বীকার করে এবং পরে পরিবর্তন পাঠায়, তাই এটি দ্রুত ও ভৌগোলিকভাবে নমনীয় কিন্তু একটি প্রতিলিপি-বিলম্ব জানালা রেখে যায় যা আপনি ফেইলওভারে হারাবেন। কোনো বিনামূল্যের পছন্দ নেই: শক্তিশালী সামঞ্জস্য বিলম্ব খরচ করে, দুর্বল সামঞ্জস্য ডেটা খরচ করে। প্রতিটি ডেটা স্টোরে তার RPO থেকে ঠিক করুন, এবং আপনার সাধারণ প্রতিলিপি বিলম্ব জানুন, কারণ সেই বিলম্বই একটি খারাপ দিনে আপনার প্রকৃত RPO, নকশা নথির সংখ্যা নয়।

কোড হিসেবে অবকাঠামো দিয়ে কোড থেকে পুনর্নির্মাণ করুন

আপনি হাতে প্রস্তুত করা একটি পরিবেশ নির্ভরযোগ্যভাবে পুনরুদ্ধার করতে পারেন না, কারণ প্রতিটি ক্লিক কারও মনে থাকে না। আপনার পরিবেশ কোড হিসেবে অবকাঠামো (অধ্যায় 8.2) হিসেবে সংজ্ঞায়িত করুন যাতে একটি পুরো স্ট্যাক সংস্করণ-নিয়ন্ত্রিত সোর্স থেকে একটি পরিচিত-ভালো অবস্থায় পুনঃসৃষ্টি করা যায়। এটি পুনরুদ্ধারকে প্রত্নতত্ত্ব প্রকল্প থেকে পুনরাবৃত্তিযোগ্য পাইপলাইন চালনায় পরিণত করে, আপনার স্ট্যান্ডবাই অঞ্চল সৎ রাখে (দুটি একই কোড থেকে গড়া হলে সে কম ড্রিফট করে), এবং আপোসের পরে একটি নতুন অ্যাকাউন্ট বা অঞ্চলে পুনরুদ্ধার অবকাঠামো দাঁড় করানোর একটি পরিষ্কার উপায় দেয়। কোড, সিক্রেট নির্দেশ এবং রানবুক এমন জায়গায় রাখুন যা আপনার প্রাথমিক পরিবেশ হারানো টিকে থাকে।

প্রয়োজনের আগে নির্ভরতা মানচিত্র করুন

সিস্টেম জালে ব্যর্থ হয়, বিচ্ছিন্নভাবে নয়, এবং আপনি যে নির্ভরতা ভুলে গেছেন তাতে পুনরুদ্ধার থমকে যায়। প্রতিটি জটিল সিস্টেমের কাজ করতে কী দরকার তা মানচিত্র করুন: উজান সেবা, DNS, পরিচয় ও প্রমাণীকরণ, সার্টিফিকেট কর্তৃপক্ষ, মেসেজ সারি, এবং তৃতীয়-পক্ষ API ও SaaS প্রদানকারী। পুনরুদ্ধার ক্রম নোট করুন, কারণ একটি অ্যাপ্লিকেশন তার ডেটাবেস বা পরিচয় প্রদানকারীর আগে চালু করা কেবল একটি দ্বিতীয় বিভ্রাট তৈরি করে। বাহ্যিক সরবরাহকারীদের প্রতি বিশেষ মনোযোগ দিন, কারণ আপনার পুনরুদ্ধার তাদের দ্বারা সীমিত এবং আপনার তাতে দৃশ্যমানতা নাও থাকতে পারে। এই মানচিত্র সরাসরি স্থিতিস্থাপকতা ও সুন্দর অবনমন (অধ্যায় 3.5)-এর সঙ্গে যুক্ত: একটি সিস্টেমের যত কম কঠিন নির্ভরতা, সে তত দ্রুত ফেরে।

পুনরুদ্ধার পরীক্ষা করুন চর্চা হিসেবে, ঘটনা হিসেবে নয়

আপনি অনুশীলন করেননি এমন একটি DR পরিকল্পনা কল্পকাহিনি। পরীক্ষার একটি সিঁড়ি গড়ুন। একটি টেবিলটপ অনুশীলন ভূমিকা, সিদ্ধান্ত ও যোগাযোগের ফাঁক খুঁজতে কাগজে একটি দৃশ্যকল্পের মধ্য দিয়ে দলকে হাঁটায়। একটি গেম ডে জীবন্ত-সদৃশ পরিবেশে একটি প্রকৃত নিয়ন্ত্রিত ব্যর্থতা ঢোকায়। একটি পূর্ণ ফেইলওভার মহড়া আসলে পুনরুদ্ধার সাইটে কাটওভার করে ও তাতে চলে। এগুলো একটি ছন্দে চালান, দৃশ্যকল্প ঘোরান (একজন মূল ব্যক্তি বা সরবরাহকারী হারানোসহ), এবং ফল মাপুন: আপনার অর্জিত প্রকৃত RTO ও RPO ধরুন এবং লক্ষ্যের সঙ্গে তুলনা করুন। মাপা ও প্রতিশ্রুত পুনরুদ্ধারের মধ্যকার ফাঁক আপনার মালিকানাধীন সবচেয়ে সৎ নির্ভরযোগ্যতা মেট্রিক, এবং তা বন্ধ করাই মহড়ার পুরো বিন্দু।

সাইবার-পুনরুদ্ধার নিজস্ব দৃশ্যকল্প হিসেবে পরিকল্পনা করুন

র‍্যানসমওয়্যার ও ধ্বংসাত্মক সাইবার আক্রমণ সাধারণ DR-এর ধারণা ভাঙে, তাই এদের আলাদাভাবে গণ্য করুন। একটি প্রাকৃতিক দুর্যোগে আপনার ডেটা অন্যত্র অক্ষত; একটি র‍্যানসমওয়্যার ঘটনায় আপনার ডেটা এবং প্রায়ই আপনার ব্যাকআপ অস্ত্র, এবং আপনার পুনরুদ্ধার পরিবেশ নিজেই আপোসকৃত হতে পারে। একটি ক্লিন-রুম পুনরুদ্ধার পরিকল্পনা করুন: একটি বিচ্ছিন্ন, বিশ্বস্ত পরিবেশ যেখানে আপনি অপরিবর্তনীয় কপি থেকে পুনরুদ্ধার করেন, অনুপ্রবেশের জন্য স্ক্যান করেন, এবং কিছু পুনঃসংযোগের আগে পরিচয় ও ক্রেডেনশিয়াল পুনর্নির্মাণ করেন। জানুন কোন ব্যাকআপ আপনার সর্বশেষ জানা-পরিষ্কার বিন্দু, এবং আশা করুন তা খুঁজতে ফরেনসিক সময় লাগবে যা আপনার সাধারণ RTO কখনো বাজেট করেনি। এখানেই অপরিবর্তনীয়, অফলাইন কপি তাদের খরচ অর্জন করে, এবং এটি ঘটনা ব্যবস্থাপনা (অধ্যায় 9.3) এবং ভাঙন সামলানোর সম্মতি ও শাসন বাধ্যবাধকতা (অধ্যায় 4.6)-র সঙ্গে আঁটোভাবে যুক্ত।

ট্রেড-অফ: সুবিধা ও অসুবিধা

DR কৌশলসুবিধাঅসুবিধা
ব্যাকআপ ও পুনরুদ্ধারসস্তাতম; সরল; কম চলমান খরচধীর RTO (ঘণ্টা থেকে দিন); বড় RPO
পাইলট লাইটকম খরচ; কোর ডেটা উষ্ণ ও প্রস্তুতম্যানুয়াল স্কেল-আপ; পুনরুদ্ধারে এখনো প্রকৃত সময় লাগে
উষ্ণ স্ট্যান্ডবাইদ্রুত RTO (মিনিট); পূর্ণ স্ট্যাক প্রমাণিতএকটি চলমান দ্বিতীয় পরিবেশের চলমান খরচ
বহু-সাইট সক্রিয়-সক্রিয়প্রায়-শূন্য RTO; একক-সাইট ব্যর্থতা নেইসর্বোচ্চ খরচ ও জটিলতা; সামঞ্জস্য কঠিন
সিঙ্ক্রোনাস প্রতিলিপিপ্রায়-শূন্য RPOলেখা বিলম্ব; দূরত্ব-সীমিত; আঁটোতর সংযোগ
অ্যাসিঙ্ক্রোনাস প্রতিলিপিদ্রুত, নমনীয়, ভৌগোলিকভাবে মুক্তপ্রতিলিপি বিলম্বের সমান ডেটা হারানোর জানালা

কেন্দ্রীয় টানাপোড়েন হলো পুনরুদ্ধার গতি ও ডেটা সতেজতা দুটিই অর্থ ও জটিলতা খরচ করে, এবং কোনো স্তরে কোনোটিই বিনামূল্যের নয়। এটি প্রতিষ্ঠান-ধরে নয়, সিস্টেম-ধরে সমাধান করুন: ব্যবসায়িক প্রভাব বিশ্লেষণকে প্রতিটি জটিল সিস্টেমকে একটি RTO ও RPO দিতে দিন, তারপর ঠিক সেটি মেটানো কৌশল কিনুন। একটি প্রতিবেদন টুলে সক্রিয়-সক্রিয় অর্থ খরচ করা সেই খতিয়ানকে অনাহারে রাখে যার তা দরকার ছিল, এবং উল্টোটি অবহেলা। শৃঙ্খলা হলো ব্যবসা যে সংখ্যার মালিক তার সঙ্গে ব্যয় মেলানো, এবং সিস্টেমের গুরুত্ব বদলালে সেই মিল পুনর্বিবেচনা করা।

আপনার দলের সঙ্গে আলোচনার প্রশ্ন

  1. আপনার প্রতিটি জটিল সিস্টেমের RTO ও RPO কী, এবং ব্যবসায় কে তাতে স্বাক্ষর করেছেন? প্রকৌশল যদি এই সংখ্যা একাই উদ্ভাবন করে, সেগুলো অনুমান, এবং অনুমান হয় খুব উদারভাবে নয়তো মোটেই অর্থায়িত হয় না। পুনরুদ্ধার সময় ও পুনরুদ্ধার বিন্দু উদ্দেশ্য একটি ব্যবসায়িক প্রভাব বিশ্লেষণ থেকে নামা উচিত যা প্রক্রিয়াকে তাদের বিঘ্নের খরচ অনুযায়ী র‍্যাঙ্ক করে, তাই খতিয়ান মিনিট পায় এবং অভ্যন্তরীণ উইকি একদিন। আপনার বর্তমান স্তরবিন্যাস আনুন এবং জিজ্ঞেস করুন প্রতিটি ব্যবসায়িক প্রক্রিয়ার জন্য জবাবদিহিযোগ্য ব্যক্তি আপনার নকশা করা ডেটা হারানো ও ডাউনটাইম সত্যিই মেনে নিতেন কি না। একটি বড় প্রতিষ্ঠানে এই আলোচনা সবকিছুকে সমানভাবে রক্ষা করার ব্যয়বহুল ভুল ঠেকায়, যা কিছুই ভালোভাবে রক্ষা করে না। প্রকৌশলের বাইরে কেউ যদি সংখ্যাগুলোর নাম বলতে না পারেন, আপনার এখনো উদ্দেশ্য নেই, আপনার আশা আছে।

  2. শেষবার কখন আপনি একটি প্রকৃত পুনরুদ্ধার করেছেন, এবং আপনি কি অর্জিত প্রকৃত RTO ও RPO মেপেছেন? আপনি কখনো পুনরুদ্ধার না করা একটি ব্যাকআপ একটি অপরীক্ষিত ধারণা, এবং যে ব্যর্থতা আপনাকে মারে (দূষিত আর্কাইভ, হারানো এনক্রিপশন কী, ভুল ভলিউমের স্ন্যাপশট, চালু না হওয়া একটি নির্ভরতা) তা কেবল চেষ্টা করলেই ভেসে ওঠে। আপনার সর্বশেষ টেবিলটপ নয়, সর্বশেষ পূর্ণ ফেইলওভার মহড়ার তারিখ ও ফল আনুন, এবং আপনি যে পুনরুদ্ধার অর্জন করেছেন ও যা প্রতিশ্রুতি দিয়েছেন তার মধ্যকার ফাঁক। একটি বড় দলের জন্য একটি সিস্টেমের একটি সফল পুনরুদ্ধার অন্যগুলো প্রমাণ করে না, তাই জিজ্ঞেস করুন গত বছরে জটিল সিস্টেমের কত অংশ শুরু-থেকে-শেষ পুনরুদ্ধার হয়েছে। মাপা ফাঁক আপনার সবচেয়ে সৎ নির্ভরযোগ্যতা সংখ্যা, এবং আপনি তা বলতে না পারলে আপনার পরিকল্পনা প্রমাণিত না হওয়া পর্যন্ত কল্পকাহিনি।

  3. আজ রাতে র‍্যানসমওয়্যার আপনার প্রোডাকশন এনক্রিপ্ট করলে এবং আপনার ব্যাকআপে পৌঁছালে, আপনার সর্বশেষ জানা-পরিষ্কার কপি কোনটি এবং কোথায় আপনি পুনর্নির্মাণ করবেন? সাধারণ দুর্যোগ পুনরুদ্ধার ধরে নেয় আপনার ডেটা অন্যত্র নিরাপদ, এবং একটি ধ্বংসাত্মক সাইবার আক্রমণ ঠিক সেই ধারণা ভাঙে আপনার ডেটা ও ব্যাকআপকে অস্ত্র করে। জিজ্ঞেস করুন অন্তত একটি ব্যাকআপ কপি অপরিবর্তনীয় ও অফলাইন কি না, আপনি সর্বশেষ পরিষ্কার পুনরুদ্ধার বিন্দু কীভাবে শনাক্ত করবেন, এবং প্রোডাকশন নিজেই আপোসকৃত হলে একটি বিশ্বস্ত ক্লিন-রুম পরিবেশ কোথা থেকে আসবে। এই দৃশ্যকল্পে এমন ফরেনসিক সময় লাগে যা আপনার স্বাভাবিক RTO কখনো বাজেট করেনি, তাই একটি পরিষ্কার বিন্দু খুঁজতে আসলে কতক্ষণ লাগে তার একটি সৎ অনুমান আনুন। এন্টারপ্রাইজ ও সরকারি দলের জন্য এটি সমান্তরালে চলা ভাঙন-বিজ্ঞপ্তি ঘড়িসহ একটি সম্মতি ঘটনাও (অধ্যায় 4.6)। উত্তর যদি হয় “আমরা সর্বশেষ ব্যাকআপ পুনরুদ্ধার করব,” আপনি এর জন্য মোটেই পরিকল্পনা করেননি।

  4. আপনার কোন সিস্টেম এমন একটি পুনরুদ্ধার স্তরের দাম দিচ্ছে যা তার ব্যবসায়িক প্রভাব বিশ্লেষণ যথার্থ করে না, এবং কোনটি বিপজ্জনকভাবে কম-সুরক্ষিত? পুনরুদ্ধার গতি ও ডেটা সতেজতা উভয়ই প্রতিটি স্তরে অর্থ খরচ করে, তাই একটি ব্লাঙ্কেট নীতি হয় একটি প্রতিবেদন টুলে সক্রিয়-সক্রিয় বাজেট অপচয় করে নয়তো সেই খতিয়ানকে অনাহারে রাখে যার তা সত্যিই দরকার ছিল। প্রতিদ্বন্দ্বী টান প্রকৃত: একটি মানক স্তর অনেক দলের পরিচালনার জন্য অনেক সরল, যখন প্রতি সিস্টেম স্তরবিন্যাস ব্যয়কে মূল্যের সঙ্গে মেলায় কিন্তু একটি সিস্টেমের গুরুত্ব সরলে চলমান বাছাই দাবি করে। প্রতিটি জটিল সিস্টেমের বর্তমান DR কৌশল, সে যে RTO ও RPO লক্ষ্য করে, তার স্ট্যান্ডবাই ও প্রতিলিপির মাসিক খরচ, এবং একটি নতুন প্রভাব বিশ্লেষণের বিপরীতে স্তরবিন্যাস শেষবার কখন পুনর্বিবেচিত হয়েছিল তার তারিখ আনুন। একটি এন্টারপ্রাইজ বা সরকারি পরিবেশে একটি অমানানসই স্তর অঞ্চল জুড়ে গুণ হয় এবং নিরীক্ষা জিজ্ঞেস করবে আপনি যে অর্থ খরচ করেন ও যে উন্মুক্ততা মেনে নেন দুটিই যথার্থ করতে, তাই একটি অব্যাখ্যাত সক্রিয়-সক্রিয় বিল এবং একটি অরক্ষিত জটিল সেবা সমানভাবে রক্ষা করা কঠিন।

  5. আপনি কি আপনার জটিল সিস্টেমের পুনরুদ্ধার ক্রম সত্যিই জানেন, এবং আপনার পুনরুদ্ধার আপনি পরীক্ষা করতে পারেন না এমন সরবরাহকারীদের ওপর কতটা নির্ভর করে? সিস্টেম জালে ব্যর্থ হয়, বিচ্ছিন্নভাবে নয়, এবং কেউ মানচিত্র না করা নির্ভরতায় একটি পুনরুদ্ধার থমকে যায়: একটি অ্যাপ্লিকেশন তার ডেটাবেস, পরিচয় প্রদানকারী বা DNS-এর আগে চালু করুন এবং আপনি কেবল একটি দ্বিতীয় বিভ্রাট তৈরি করেন। নির্ভরতা মানচিত্র করা ক্লান্তিকর এবং মানচিত্র বাসি হয়, কিন্তু বিকল্প হলো ফেইলওভারের সময় জীবন্ত পুনরুদ্ধার ক্রম আবিষ্কার করা, এবং মুষ্টিমেয় SaaS প্রদানকারীতে কেন্দ্রীভূত ঝুঁকি অদৃশ্য থাকে যতক্ষণ না তারা একসঙ্গে ব্যর্থ হয় এবং আপনার পুনরুদ্ধার তাদের উপর সীমাবদ্ধ করে। একটি বর্তমান নির্ভরতা মানচিত্র, নথিবদ্ধ পুনরুদ্ধার ক্রম, এবং তাদের ঘোষিত পুনরুদ্ধার প্রতিশ্রুতি ও আপনি কখনো সেগুলোর কোনোটি যাচাই করেছেন কি না সহ বাহ্যিক সরবরাহকারীদের তালিকা আনুন। একটি বড় বা জনসাধারণের প্রতিষ্ঠানের জন্য সরবরাহকারী ধারাবাহিকতা ও কেন্দ্রীভূত ঝুঁকি ক্রমশ একটি ক্রয় ও নিয়ন্ত্রক উদ্বেগ, তাই সেই পুনরুদ্ধার বাধ্যবাধকতা বিক্রেতার বিপণনে নয়, আপনি নিরীক্ষা করতে পারেন এমন রূপে চুক্তিতে থাকা উচিত।

  6. আপনি আজ রাতে প্রতিটি সার্ভার পুনরুদ্ধার করলে ব্যবসা কি সত্যিই চলত, এবং কে একটি দুর্যোগ ঘোষণা করতে অনুমোদিত? দুর্যোগ পুনরুদ্ধার IT পুনরুদ্ধার করে, কিন্তু ব্যবসা ধারাবাহিকতা প্রতিষ্ঠানকে সচল রাখে: মানুষ, যোগাযোগ, বেতন এবং সিদ্ধান্ত যা কারও সেগুলো নেওয়ার কর্তৃত্ব থাকার ওপর নির্ভর করে। আপনি প্রতিটি সিস্টেম পুনরুদ্ধার করেও গ্রাহকদের ব্যর্থ করতে পারেন যদি কেউ না জানে কে একটি দুর্যোগ ঘোষণা করতে পারে বা স্বাভাবিক চ্যানেলও বন্ধ থাকলে কর্মীদের কাছে কীভাবে পৌঁছাবে। প্রকৌশল পুনরুদ্ধারের মালিক, তবু ধারাবাহিকতা সুবিধা, HR, যোগাযোগ ও নেতৃত্ব উত্তরাধিকার জুড়ে বিস্তৃত, এবং বিভাগগুলোর মধ্যকার সেই জোড়াই ঠিক সেখানে পরিকল্পনা নীরবে পচে। ঘোষণা কর্তৃত্ব ও এসক্যালেশন শৃঙ্খল, ফলব্যাক যোগাযোগ পরিকল্পনা, নামকরা উত্তরাধিকারী ও বিকল্প সুবিধা, এবং ব্যবসার পক্ষ (শুধু IT নয়) শেষবার কখন পরিকল্পনা অনুশীলন করেছিল তার তারিখ আনুন। সরকার নামকরা উত্তরাধিকারী ও অপরিহার্য কার্যাবলিসহ একটি আইনি কার্যক্রম-ধারাবাহিকতা দায়িত্ব বহন করে, এবং এন্টারপ্রাইজ নিয়ন্ত্রক ধারাবাহিকতা বাধ্যবাধকতার মুখোমুখি, তাই দুটিই বিচার হয় ব্যবসা খারাপ দিন টেকে কি না, কেবল সার্ভার নয়।

খাতভেদে দৃষ্টিভঙ্গি

স্টার্টআপ। ক্ষুদ্র দল আর সামান্য রানওয়েতে আপনি একটি গরম দ্বিতীয় অঞ্চল সামর্থ্য দিতে পারেন না, তাই সস্তা অংশ সম্পর্কে সুচিন্তিত হোন যা এখনো আপনাকে বাঁচায়। একটি সৎ পুনরুদ্ধার স্তর ঠিক করুন, স্বয়ংক্রিয় স্ন্যাপশট এবং আপনার নিজস্ব অ্যাডমিন মুছতে পারে না এমন অন্তত একটি অপরিবর্তনীয় কপিসহ ৩-২-১ নিয়ম অনুসরণ করুন, এবং পুরো পরিবেশ কোড হিসেবে অবকাঠামো রাখুন যাতে সোর্স থেকে পুনর্নির্মাণ করতে পারেন। বিস্তৃত পরিকল্পনা বাদ দিন এবং তার বদলে প্রতি ত্রৈমাসিকে একটি স্ক্র্যাচ পরিবেশে একটি প্রকৃত পুনরুদ্ধার চালান, কারণ একটি একক সময় মাপা মহড়া কেউ না পড়া বাইন্ডারের চেয়ে আপনাকে বেশি শেখায়।

ছোট ব্যবসা। কোনো নিবেদিত ধারাবাহিকতা বিশেষজ্ঞ নেই আর বাজেট কম, তাই পুনরুদ্ধারকে গড়ার বদলে কেনা জিনিস গণ্য করুন। বিশেষায়িত DR অবকাঠামো দাঁড় করানোর বদলে আপনার ক্লাউড প্রদানকারীর ম্যানেজড ব্যাকআপ, স্ন্যাপশট ও আন্তঃ-অঞ্চল প্রতিলিপির ওপর ঝুঁকুন, এবং যাদের ব্যাকআপ অপরিবর্তনীয় এবং যাদের পুনরুদ্ধার প্রক্রিয়া আপনি নিজে চালাতে পারেন এমন বিক্রেতা বাছুন। পুরো অনুশীলনকে দুটি প্রশ্ন ঘিরে ফ্রেম করুন যার উত্তর বিশেষজ্ঞ ছাড়াই দিতে পারেন: আমরা কতটা ডেটা হারাতে পারি, এবং কতক্ষণ বন্ধ থাকতে পারি, এবং বিশ্বাসের আগে একটি পুনরুদ্ধার কাজ করে প্রমাণ করুন।

এন্টারপ্রাইজ। পরিসরে সমস্যা অনেক দল জুড়ে পোর্টফোলিও শাসন: প্রতিটি সেবাকে একটি RTO ও RPO দেওয়া একটি ব্যবসায়িক প্রভাব বিশ্লেষণ, ব্যাকআপ-ও-পুনরুদ্ধার থেকে সক্রিয়-সক্রিয় পর্যন্ত স্তরযুক্ত পুনরুদ্ধার কৌশল, এবং কেন্দ্রীভূত ঝুঁকিসহ উজান ও সরবরাহকারী নির্ভরতার একটি কেন্দ্রীয় দৃশ্য। স্ট্যান্ডবাই, প্রতিলিপি ও অপরিবর্তনীয়-কপি খরচ স্পষ্টভাবে বাজেট করুন, একটি ছন্দে নিয়ন্ত্রক-সাক্ষী পূর্ণ ফেইলওভার চালান, এবং লক্ষ্যের বিপরীতে প্রকৃত পুনরুদ্ধার একটি অনুসরণ করা নির্ভরযোগ্যতা মেট্রিক হিসেবে মাপুন। সাইবার-পুনরুদ্ধারকে অপরিবর্তনীয় ভল্ট কপি ও একটি ক্লিন-রুম রানবুকসহ নিজস্ব কর্মসূচি হিসেবে বজায় রাখুন, প্রাকৃতিক-দুর্যোগ মহড়া থেকে স্বাধীনভাবে পরীক্ষিত।

সরকার। ক্রয় নিয়ম, স্বচ্ছতা ও জনগণের কাছে জবাবদিহি প্রতিটি পছন্দ আকার দেয়, এবং ধারাবাহিকতা প্রায়ই পছন্দের বদলে আইনি দায়িত্ব। এমন একটি কার্যক্রম-ধারাবাহিকতা কর্মসূচি গড়ুন যা অপরিহার্য কার্যাবলি শনাক্ত করে, তাদের পুনরুদ্ধার ক্রম ঠিক করে এবং উত্তরাধিকারী ও বিকল্প সুবিধার নাম দেয় যাতে একজন অনুমোদিত ব্যক্তির অভাবে সিদ্ধান্ত কখনো থমকে না যায়, এবং FISMA বাধ্যবাধকতা সমর্থনকারী NIST SP 800-34-এর মতো স্বীকৃত নির্দেশনার সঙ্গে সারিবদ্ধ করুন। এয়ার-গ্যাপড ব্যাকআপ কপি রাখুন, বিকল্প অঞ্চলে পুনর্নির্মাণের জন্য কোড হিসেবে অবকাঠামো সংজ্ঞায়িত করুন, এবং একটি বার্ষিক পূর্ণ অনুশীলন সঙ্গে র‍্যানসমওয়্যার টেবিলটপ মহড়া চালান যার মাপা ফল আপনি অপরিহার্য সেবা টিকে থাকার প্রমাণ হিসেবে তদারকি সংস্থাকে প্রতিবেদন করেন।

উদাহরণ

স্টার্টআপ। বারোজনের একটি SaaS কোম্পানি একটি গরম দ্বিতীয় অঞ্চল সামর্থ্য দিতে পারে না, তাই সস্তা অংশ সম্পর্কে সুচিন্তিত। এটি একটি সৎ স্তর ঠিক করে: গ্রাহক ডেটাবেসের জন্য চার ঘণ্টার RTO, পনেরো মিনিটের RPO। এটি স্বয়ংক্রিয় স্ন্যাপশটসহ ৩-২-১ নিয়ম অনুসরণ করে, একটি কপি একটি দ্বিতীয় ক্লাউড অঞ্চলে প্রতিলিপি করা এবং একটি অপরিবর্তনীয় কপি একটি লক করা ধারণ জানালাসহ যা তার নিজস্ব অ্যাডমিন মুছতে পারে না। এর পুরো পরিবেশ কোড হিসেবে অবকাঠামো (অধ্যায় 8.2), তাই এটি সোর্স থেকে একটি নতুন স্ট্যাক দাঁড় করাতে পারে। প্রতি ত্রৈমাসিকে এটি এক শুক্রবার বিকেলে একটি স্ক্র্যাচ পরিবেশে একটি প্রকৃত পুনরুদ্ধার চালায়, সময় মাপে এবং একটি সংক্ষিপ্ত নোট ফাইল করে। প্রথম মহড়া নয় ঘণ্টা নিয়ে একটি অনুপস্থিত মাইগ্রেশন ধাপ খুঁজে পায়; সংশোধনই কারণ পরেরটি তিন ঘণ্টা নিয়েছিল।

এন্টারপ্রাইজ। একটি বহুজাতিক ব্যাংক এমন নিয়ন্ত্রক পুনরুদ্ধার প্রয়োজনের অধীনে কাজ করে যা জটিল সেবার পরীক্ষিত ধারাবাহিকতা বাধ্যতামূলক করে। এটি তার মূল ব্যাংকিং প্ল্যাটফর্মের জন্য একটি দ্বিতীয় অঞ্চলে উষ্ণ স্ট্যান্ডবাই চালায়, প্রায়-শূন্য RPO-র জন্য একটি মেট্রো জোড়ার ভেতরে সিঙ্ক্রোনাস প্রতিলিপি এবং আঞ্চলিক-দুর্যোগ টিকে থাকার জন্য একটি দূরবর্তী অঞ্চলে অ্যাসিঙ্ক্রোনাস প্রতিলিপিসহ। একটি ব্যবসায়িক প্রভাব বিশ্লেষণ প্রতিটি সেবাকে একটি RTO ও RPO দেয়, এবং একটি কেন্দ্রীয় দল কেন্দ্রীভূত ঝুঁকি হিসেবে চিহ্নিত দুটি SaaS প্রদানকারীসহ উজান নির্ভরতা মানচিত্র করে। বছরে দুবার এটি একটি পূর্ণ নিয়ন্ত্রক-সাক্ষী ফেইলওভার করে, লক্ষ্যের বিপরীতে প্রকৃত মাপে, এবং ফাঁক পরবর্তী চক্রে জোগান দেয়। একটি আলাদা সাইবার-পুনরুদ্ধার কর্মসূচি অপরিবর্তনীয় ভল্ট কপি ও একটি ক্লিন-রুম রানবুক বজায় রাখে, প্রাকৃতিক-দুর্যোগ মহড়া থেকে স্বাধীনভাবে পরীক্ষিত।

সরকার। সুবিধা সরবরাহ করা একটি জাতীয় সংস্থা যেকোনো বিঘ্নের সময় তার অপরিহার্য কার্যাবলি টেকাতে নির্মিত একটি কার্যক্রম ধারাবাহিকতা (COOP) কর্মসূচি বজায় রাখে। কার্যক্রম ধারাবাহিকতা চর্চা এবং এর FISMA বাধ্যবাধকতা সমর্থনকারী NIST SP 800-34 আকস্মিকতা-পরিকল্পনা নির্দেশনা অনুসরণ করে এটি অপরিহার্য কার্যাবলি শনাক্ত করে, তাদের পুনরুদ্ধার ক্রম ঠিক করে, এবং উত্তরাধিকারী ও বিকল্প সুবিধার নাম দেয় যাতে একজন অনুমোদিত ব্যক্তির অভাবে সিদ্ধান্ত কখনো থমকে না যায়। নাগরিক-মুখী সিস্টেম নথিবদ্ধ RTO ও RPO বহন করে, ব্যাকআপ এয়ার-গ্যাপড কপিসহ ৩-২-১ নিয়ম অনুসরণ করে, এবং অবকাঠামো একটি বিকল্প অঞ্চলে পুনর্নির্মাণের জন্য কোড হিসেবে সংজ্ঞায়িত। একটি বার্ষিক পূর্ণ অনুশীলন, সঙ্গে একটি র‍্যানসমওয়্যার দৃশ্যকল্পের টেবিলটপ মহড়া, মাপা পুনরুদ্ধারের বিপরীতে পরিকল্পনা পরীক্ষা করে, এবং ফল খারাপ দিনে অপরিহার্য সেবা টিকে থাকার প্রমাণ হিসেবে তদারকি সংস্থাকে প্রতিবেদন করা হয়।

ব্যবসায়িক যুক্তি: প্রেরণা, ROI ও TCO

DR ও ধারাবাহিকতার প্রতিদান এড়ানো বিপর্যয়, যা আপনার দরকার না হওয়া পর্যন্ত মূল্য নির্ধারণ করা সত্যিই কঠিন এবং দরকার হলে বেদনাদায়কভাবে সুনির্দিষ্ট। এটিকে ঝুঁকি ব্যবস্থাপনা হিসেবে ফ্রেম করুন: একটি বিঘ্নের প্রত্যাশিত খরচ তার সম্ভাবনা গুণ প্রভাব, এবং একটি বড় প্রতিষ্ঠানের জন্য প্রভাব ডাউনটাইমের প্রতি ঘণ্টায় হারানো রাজস্ব থেকে নিয়ন্ত্রক জরিমানা, ভাঙন-বিজ্ঞপ্তি খরচ এবং বিভ্রাট ছাড়িয়ে টেকা সুনামের ক্ষতি পর্যন্ত চলে। একটি একক অপুনরুদ্ধারযোগ্য র‍্যানসমওয়্যার ঘটনা কোম্পানি শেষ করেছে এবং, সরকারি খাতে, অপরিহার্য নাগরিক সেবা সপ্তাহ ধরে নামিয়েছে। তার বিপরীতে একটি পরীক্ষিত পুনরুদ্ধার সামর্থ্যের খরচ সামান্য ও জানা।

মালিকানার মোট খরচ (TCO) প্রকৃত ও চলমান: স্ট্যান্ডবাই অবকাঠামো, প্রতিলিপি ব্যান্ডউইথ, ব্যাকআপ সংরক্ষণ (অপরিবর্তনীয় ও অফলাইন কপি দ্বারা গুণিত), এবং স্বয়ংক্রিয়তা গড়া ও মহড়া চালানোর প্রকৌশল সময়। ঠিক এজন্যই আপনি সর্বত্র সক্রিয়-সক্রিয় কেনার বদলে RTO ও RPO অনুযায়ী স্তর করেন, যাতে ব্যয় একটি ব্লাঙ্কেট নীতির বদলে প্রতিটি সিস্টেমের মূল্য অনুসরণ করে। নেতৃত্বের কাছে যুক্তি দিতে পরিকল্পনাকে তাদের ভাষায় অনুবাদ করুন: আজ আমরা এই ডাউনটাইম ও ডেটা হারানো টিকতে পারি, আমাদের লক্ষ্যের ফাঁক এই, তা বন্ধ করতে এই খরচ, এবং না করলে এই উন্মুক্ততা। সবচেয়ে প্ররোচক নিদর্শন একটি মাপা মহড়া, কারণ আপনি প্রদর্শিত পুনরুদ্ধার একটি সংখ্যা যা নেতৃত্ব বিশ্বাস করতে পারে, আর একটি অপরীক্ষিত পরিকল্পনা সম্পদের ছদ্মবেশে দায়।

অ্যান্টি-প্যাটার্ন ও ফাঁদ

  • অপরীক্ষিত ব্যাকআপ। আপনি কখনো সম্পাদন না করা একটি পুনরুদ্ধার আশা; মহড়াই সেই জায়গা যেখানে আপনি দূষণ, অনুপস্থিত কী ও ভুল ভলিউম খুঁজে পান।
  • প্রোডাকশন থেকে নাগালযোগ্য ব্যাকআপ। র‍্যানসমওয়্যার আপনার ব্যাকআপ এনক্রিপ্ট বা মুছতে পারলে আপনার তিনটি নয়, একটি কপি আছে। একটি অপরিবর্তনীয় ও অফলাইন রাখুন।
  • সবকিছুর জন্য একটি RTO ও RPO। ব্লাঙ্কেট স্তর তুচ্ছকে অতি-সুরক্ষিত ও জটিলকে কম-সুরক্ষিত রাখে; একটি ব্যবসায়িক প্রভাব বিশ্লেষণ থেকে স্তর করুন।
  • DR ও BCP গুলিয়ে ফেলা। কে দুর্যোগ ঘোষণা করে বা কর্মীদের কাছে কীভাবে পৌঁছাবে কেউ না জানা অবস্থায় প্রতিটি সার্ভার পুনরুদ্ধার করা একটি পুনরুদ্ধার করা সিস্টেম ও একটি ব্যর্থ ব্যবসা।
  • হাতে গড়া পুনরুদ্ধার পরিবেশ। কোড থেকে পুনর্নির্মাণ করতে না পারা অবকাঠামো ড্রিফট করে, এবং ড্রিফট আবিষ্কৃত হয় ফেইলওভারের মাঝে।
  • উপেক্ষিত নির্ভরতা। একটি অ্যাপ তার ডেটাবেস, পরিচয় প্রদানকারী বা DNS-এর আগে পুনরুদ্ধার করা কেবল একটি দ্বিতীয় বিভ্রাট তৈরি করে।
  • পরিকল্পনা পচন। একবার লেখা ও কখনো অনুশীলন না করা বাইন্ডার এমন একটি সিস্টেম বর্ণনা করে যা আর নেই।
  • সরবরাহকারী অন্ধ বিন্দু। আপনার পুনরুদ্ধার আপনার জটিল সরবরাহকারীদের পুনরুদ্ধার দ্বারা সীমিত, এবং কেন্দ্রীভূত ঝুঁকি অদৃশ্য থাকে যতক্ষণ না তারা একসঙ্গে ব্যর্থ হয়।

পরিপক্বতা মডেল

  • স্তর 1, সূচনা: পুনরুদ্ধার অ্যাড হক ও প্রতিক্রিয়াশীল। ব্যাকআপ চলতে পারে কিন্তু পুনরুদ্ধার অপরীক্ষিত। কোনো সম্মত RTO বা RPO নেই, কোনো ব্যবসায়িক প্রভাব বিশ্লেষণ নেই, এবং ঘটনার সময় পুনরুদ্ধার উদ্ভাবিত হয়। একটি গুরুতর ডেটা হারানো বা র‍্যানসমওয়্যার ঘটনা সম্ভবত অপুনরুদ্ধারযোগ্য হতো।
  • স্তর 2, বিকাশ: মৌলিক চর্চা আছে কিন্তু দল জুড়ে অসঙ্গত। কিছু জটিল সিস্টেমের ৩-২-১ নিয়ম অনুসরণকারী ব্যাকআপ এবং সবচেয়ে গুরুত্বপূর্ণ সেবার জন্য নথিবদ্ধ RTO ও RPO আছে, এবং মাঝে মাঝে পরীক্ষিত পুনরুদ্ধারসহ একটি মৌলিক DR পরিকল্পনা আছে। কভারেজ আংশিক, নির্ভরতা মানচিত্র করা হয়নি, মহড়া অ্যাড হক, এবং একটি দলের শৃঙ্খলা পরেরটির নির্দেশ করে না।
  • স্তর 3, মানসম্মতকরণ: পুনরুদ্ধার চর্চা নথিবদ্ধ ও প্রতিষ্ঠান-ব্যাপী প্রয়োগ করা। একটি ব্যবসায়িক প্রভাব বিশ্লেষণ সিস্টেম জুড়ে স্তরযুক্ত RTO ও RPO চালায়, পুনরুদ্ধার কৌশল সেই স্তরের সঙ্গে মেলানো, পরিবেশ কোড হিসেবে অবকাঠামো, নির্ভরতা ও পুনরুদ্ধার ক্রম মানচিত্র করা, এবং নির্ধারিত মহড়া (টেবিলটপ, গেম ডে ও ফেইলওভার) একটি সংজ্ঞায়িত ছন্দে চলে। অপরিবর্তনীয়, অফলাইন কপিসহ একটি সাইবার-পুনরুদ্ধার পরিকল্পনা নথিবদ্ধ এবং স্বতন্ত্র দলের ওপর ছেড়ে না দিয়ে সামঞ্জস্যপূর্ণভাবে প্রয়োগ করা।
  • স্তর 4, ব্যবস্থাপনা: পুনরুদ্ধার ভিত্তিরেখার বিপরীতে মাপা ও নিয়ন্ত্রিত। প্রতিটি মহড়া অর্জিত প্রকৃত RTO ও RPO ধরে এবং লক্ষ্যের ফাঁক অনুসরণ করে, এবং পুনরুদ্ধার সাফল্য হার, গত বছরে শুরু-থেকে-শেষ পুনরুদ্ধার হওয়া জটিল সিস্টেমের অংশ, ব্যাকআপ কভারেজ ও অপরিবর্তনীয়তা, এবং প্রকৃত RPO হিসেবে পর্যবেক্ষিত প্রতিলিপি বিলম্বের মতো মেট্রিক ড্যাশবোর্ডে প্রতিবেদিত হয়। বিচ্যুতি কাজ ট্রিগার করে, সিস্টেম আসলে কীভাবে ব্যবহৃত তার ডেটা থেকে স্তরবিন্যাস পুনরায় আহরণ করা হয়, এবং যাওয়া-না-যাওয়ার সিদ্ধান্ত একটি স্লাইডে লেখা সংখ্যার বদলে প্রমাণের ওপর দাঁড়ায়।
  • স্তর 5, সমন্বয়: পুনরুদ্ধার নিরন্তর উন্নত, প্রতিষ্ঠান জুড়ে একীভূত ও অভিযোজিত। ফেইলওভার ও সাইবার-পুনরুদ্ধার ক্লিন-রুম পুনরুদ্ধার রুটিন হিসেবে মহড়া করা হয়, সরবরাহকারী ও কেন্দ্রীভূত ঝুঁকি সক্রিয়ভাবে পরিচালিত, এবং ধারাবাহিকতা নির্ভরযোগ্যতা (অধ্যায় 9.1) ও ঘটনা সাড়া (অধ্যায় 9.3)-র সঙ্গে একীভূত যাতে প্রতিষ্ঠান কখনো না দেখা ব্যর্থতা থেকে পূর্বাভাসযোগ্যভাবে সেরে ওঠে এবং সিস্টেম পরিদৃশ্য ও হুমকি চিত্র সরলে তার পুনরুদ্ধার অবস্থান পুনঃপরিসর করে।

আলোচনার ভাবনা

  1. আপনার কোন জটিল সিস্টেম কখনো শুরু-থেকে-শেষ পুনরুদ্ধার হয়নি, এবং তা পারে প্রমাণ করতে কী লাগবে?
  2. আপনি একটি পুরো দিনের জন্য আপনার প্রাথমিক ক্লাউড অঞ্চল হারালে কোন ব্যবসায়িক প্রক্রিয়া থামে, এবং কোন ক্রমে সিস্টেম ফিরিয়ে আনতেন?
  3. আপনার পুনরুদ্ধার এমন সরবরাহকারীদের ওপর কতটা নির্ভর করে যাদের নিজস্ব পুনরুদ্ধার আপনি দেখতে বা পরীক্ষা করতে পারেন না?
  4. কোথায় আপনি এমন পুনরুদ্ধার স্তরের দাম দিচ্ছেন যা ব্যবসায়িক প্রভাব বিশ্লেষণ যথার্থ করে না, এবং কোথায় কম-সুরক্ষা দিচ্ছেন?
  5. আপনার ব্যাকআপ আজ রাতে নাগালযোগ্য ও এনক্রিপ্ট হলে আপনার প্রকৃত সর্বশেষ জানা-পরিষ্কার পুনরুদ্ধার বিন্দু কী?
  6. আপনার প্রতিশ্রুত RTO ও RPO এবং আপনার সর্বশেষ মহড়া আসলে যা অর্জন করেছে তার মধ্যে সৎ ফাঁক কত?

প্রধান শিক্ষা

  • ধারাবাহিকতা লক্ষ্য; পুনরুদ্ধার একটি উপায়। ব্যবসা ধারাবাহিকতা পরিকল্পনা প্রতিষ্ঠান চালু রাখে; দুর্যোগ পুনরুদ্ধার তার নির্ভর করা IT সিস্টেম পুনরুদ্ধার করে।
  • RTO ও RPO সবকিছু চালায়, এবং দুটিই একটি ব্যবসায়িক প্রভাব বিশ্লেষণ থেকে আসে, প্রকৌশল অনুমান থেকে নয়। সবাইকে সমানভাবে রক্ষা না করে সিস্টেম স্তর করুন।
  • একটি অপরীক্ষিত ব্যাকআপ ব্যাকআপ নয়। ৩-২-১ নিয়ম অনুসরণ করুন, র‍্যানসমওয়্যারের বিরুদ্ধে অন্তত একটি অপরিবর্তনীয় ও অফলাইন কপি রাখুন, এবং একটি সূচিতে পুনরুদ্ধার পরীক্ষা করুন।
  • সংখ্যার সঙ্গে DR কৌশল মেলান: ব্যাকআপ-ও-পুনরুদ্ধার, পাইলট লাইট, উষ্ণ স্ট্যান্ডবাই বা সক্রিয়-সক্রিয়, প্রতিটি সিস্টেমের RTO ও RPO অনুযায়ী বাছা।
  • প্রতিলিপি সতেজতার বিনিময়ে সামঞ্জস্য ট্রেড-অফ করে (অধ্যায় 3.3); আপনার প্রকৃত RPO আপনার প্রতিলিপি বিলম্ব, নকশা নথি নয়।
  • কোড থেকে পুনর্নির্মাণ করুন কোড হিসেবে অবকাঠামো (অধ্যায় 8.2) দিয়ে, এবং প্রয়োজনের আগে নির্ভরতা মানচিত্র করুন।
  • টেবিলটপ অনুশীলন, গেম ডে ও পূর্ণ ফেইলওভার মহড়া দিয়ে পরীক্ষা করুন, এবং লক্ষ্যের বিপরীতে প্রকৃত RTO ও RPO মাপুন।
  • সাইবার-পুনরুদ্ধার আলাদাভাবে পরিকল্পনা করুন ক্লিন-রুম পুনরুদ্ধারসহ, এবং পুরো চর্চা নির্ভরযোগ্যতা (অধ্যায় 9.1), ঘটনা সাড়া (অধ্যায় 9.3) ও সম্মতি (অধ্যায় 4.6)-র সঙ্গে যুক্ত করুন।

তথ্যসূত্র ও আরও পড়ার জন্য

  • ISO 22301, Security and resilience: Business continuity management systems: Requirements (the international standard for BCP).
  • National Institute of Standards and Technology, SP 800-34 Rev. 1: Contingency Planning Guide for Federal Information Systems (RTO, RPO, and recovery strategies for government systems).
  • National Institute of Standards and Technology, SP 800-61 Rev. 2: Computer Security Incident Handling Guide (incident and cyber-recovery handling).
  • U.S. Federal Emergency Management Agency, Continuity Guidance Circular and federal COOP guidance (essential functions and continuity of operations).
  • Federal Financial Institutions Examination Council (FFIEC), Business Continuity Management booklet (regulatory recovery expectations for financial institutions).
  • Betsy Beyer, Chris Jones, Jennifer Petoff, Niall Richard Murphy, eds., Site Reliability Engineering: How Google Runs Production Systems (reliability and disaster testing).
  • Kelly Shortridge and Aaron Rinehart, Security Chaos Engineering (deliberately exercising failure and recovery).
  • Cybersecurity and Infrastructure Security Agency (CISA), #StopRansomware Guide (ransomware prevention and recovery practice).