10.8

View in English

10.8 成熟度モデル

概要と動機

成熟度モデルは、ある領域であなたの実践がどれだけ有能で一貫しているかを評価し、改善の道筋を記述する、構造化された方法です。少数の段階の梯子を定義します。最下位では、仕事はその場しのぎで反応的です。最上位では、測定され、管理され、継続的に最適化されています。各段には、照らして確認できる観察可能な特徴があります。

成熟度モデルは、曖昧な問い(「私たちはこれが得意か」)を、繰り返し可能な答え(「ここはレベル2、あそこはレベル4で、レベル3にはこれが必要だ」)に変えます。本書はすべての章で5段階のモデルを使い、12.4章でそれらを統合しています。この章は規律そのものについてです。モデルがどう働くか、いつ役立ち、どう誤解させるか。

それが重要な理由は単純です。大きな組織は、見えないものを改善できません。数十のチームにわたって、能力は大きく、目に見えずにばらつきます。テストは優れているがセキュリティが弱いチームもあれば、その逆のチームもあります。成熟度モデルは、共有の語彙と共通の物差しを与えるので、隔たりが比較可能になり、投資に優先順位をつけられ、進捗が単に主張されるのではなく、時間とともに追跡できます。よく知られた例には、CMMI(プロセスのための能力成熟度モデル統合)、DORA(DevOps Research and Assessment)モデル(ソフトウェアデリバリーのパフォーマンス)、ソフトウェアセキュリティのためのOWASP SAMM(Software Assurance Maturity Model)とBSIMM(Building Security In Maturity Model)、TMMi(テストのためのTest Maturity Model integration)、Agile Fluencyモデル、データ管理の成熟度モデル、そして数え切れない社内のスコアカードがあります。

企業、特に政府にとって、成熟度モデルは特別な重みを持ちます。政府調達は長く、CMMIの評定レベルをサプライヤーの資格として使ってきており、米国のCMMC(サイバーセキュリティ成熟度モデル認証)のような枠組みは、サイバーセキュリティの成熟度を防衛関連の仕事への適格性に直接結びつけます。それが成熟度モデルに本物の力を与えます。それはまた、この章の中心的なリスクを生みます。レベルがゲートや目標になったとき、人々は根底にある能力ではなく評定に向けて最適化します。うまく使えば、成熟度モデルは鏡です。まずく使えば、劇場です。

主要原則

  • 成熟度は目的ではなく手段である。 目標は能力と成果であって、レベルの数字ではありません。
  • 採点するためではなく、学ぶために評価する。 誠実な自己評価は、お世辞の評定に勝ります。
  • 高いほど良いとは限らない。 正しい目標は、リスク、文脈、コストによります。
  • 単一の全体評価ではなく、領域ごとに測定する。 能力は不均一で、単一の数字はそれを隠します。
  • 成熟度が最も低く、リスクが最も高い隔たりを優先する。
  • グッドハートの法則に注意する。 レベルが目標になったとき、能力を測るのをやめます。
  • 定期的に再評価する。 成熟度は、人、システム、脅威が変わるにつれてずれます。

推奨事項

領域に合った正しいモデルを選ぶ

改善したい能力にモデルを合わせ、存在する所では、考案されたものより、確立された証拠に基づくモデルを好みます。

  • プロセスとデリバリー: CMMI(広範なプロセスの成熟度)、DORAの能力モデル(研究に根ざしたデリバリーのパフォーマンス、11.2章)。
  • セキュリティ: OWASP SAMMとBSIMM(ソフトウェアセキュリティの実践)、CMMC(防衛のサイバーセキュリティ)。
  • テストと品質: TMMi。
  • アジャイルと働き方: Agile Fluencyモデル(10.7章)。
  • データ: データ管理の成熟度モデル(DMM、DCAM)。

社内利用には、(本書がするように)能力ごとに適用される単純な4段階か5段階の尺度のほうが、重い外部の枠組みよりしばしば実行しやすいものです。正式で評定されるモデルは、契約上必要とされる所のために取っておきます。

誠実に、能力ごとに評価する

安心ではなく真実を生む評価を行います。仕事をしている人々を巻き込みます。意見ではなく証拠を集めます。絵が現実を反映するよう、各能力を別々に採点します。ここは強く、あそこは弱い。改善を導くのに使われる自己評価は、バッジを得るのに使われる外部の評定より価値があります。前者は率直さに報い、後者は見せ方に報いるからです。12.4章は、本書のすべての領域にわたる統合された自己評価を提供します。出発点の道具として使ってください。

罰するためではなく、優先順位をつけるために成熟度を使う

評価の出力は、非難のための成績表ではなく、優先順位づけされた改善の積み残しです。成熟度をリスクと組み合わせます。リスクの低い領域のレベル1の能力は問題ないかもしれません。安全やコンプライアンスが重要な領域のレベル2の能力は緊急です。低い成熟度が高いリスクに出会う隔たりに投資を向け、梯子を登ること自体のためではなく、改善が結果で測られるよう、仕事をアウトカム(11.1章)につなげます。

目標レベルを意図して設定する: 高いことは無料ではない

レベルが一つ上がるごとに労力がかかり、しばしばプロセスの重みが加わります。正しい目標が「どこでもレベル5」であることはまれです。追加の能力が、その領域のリスクに対して追加のコストを正当化するレベルです。規制対象や安全が重要な能力は、本当に最上位の段を必要とするかもしれず、監査はしばしば少なくとも「定義された」レベル3を要求します。他の多くはレベル3で十分に仕えられ、それ以上押し進めれば官僚主義が積み上がるだけです。能力ごとに目標を決め、リスク調整後の見返りがそうなったところで、登るのをやめます。

成熟度の劇場に備える

成熟度モデルの価値を破壊する唯一の失敗の様式は、点数のために最適化することです。寛大に採点する評価、評定のためだけに組み立てられた証拠、本番のインシデントが反証する「レベル5」の主張に注意してください。評価を観察可能な行動と本物の成果に結びつけておきます。評価者を入れ替える、あるいは外部で妥当性を確認します。疑わしいほど高い自己採点は、臭いとして扱います。レベルが目標になった瞬間、モデルはあなたに真実を語るのをやめます。

トレードオフ: 長所と短所

アプローチ長所短所
正式に評定されるモデル(CMMI、CMMC)比較可能、契約上認められる、厳密高価。ゲーム化を招く。プロセスを硬直させうる
軽量な社内スコアカード速く、実行しやすく、低いオーバーヘッド外部との比較がしにくい。偏りやすい
証拠に基づく能力モデル(DORA)本物の成果に結びつく。研究の裏づけ範囲が狭い。本物の指標が必要
単一の全体の成熟度評価伝えやすい不均一な能力を隠す。誤解させる
能力ごとの評価正確で実行しやすい優先順位づけより多くの労力。単一の見出しの数字がない

中心的な緊張は、鏡としての評価対目標としての評価です。チームが自分をはっきり見る助けになるのと同じモデルが、レベルが報酬、適格性、地位に結びついた瞬間に逆効果になります。レベルが重要になるほど、より多くのエネルギーが、実質ではなく成熟の見かけに流れます。

チームで議論すべき問い

  1. 契約上評定されるレベルとは別に、率直な社内の自己評価を保つべきですか。そしてそれぞれを誰が所有しますか。 CMMCやCMMIのレベルが収益をゲートするとき、エネルギーが改善ではなく合格に向かうので、評定と真実は離れていきます。大きな企業や政府のサプライヤーにとって、その隔たりこそリスクが隠れる所です。監査に合格しても露出したままです。意図して二つの帳簿を運営してください。適格性のために正式な評定を保ち、誰も水増しに報われない率直な社内のスコアカードを保ちます。それぞれに所有者を名指しし、両者の間の距離を、覆い隠すのではなく調査のシグナルとして扱います。どちらの帳簿が真実を語っているかの証拠として、最近のインシデント、ヒヤリハット、評定後の劣化を会議に持ち込んでください。

  2. 各領域で、確立された証拠に基づくモデルを採用していますか。それとも独自のスコアカードを考案していますか。そしてそれは正しい判断ですか。 確立されたモデル(デリバリーのDORA、セキュリティのSAMMやBSIMM、テストのTMMi)は、自前の格子にはない研究と外部との比較可能性を持ちます。軽量な社内の4段階の尺度は、より速く実行しやすく、社内の舵取りにはしばしばより良い選択です。罠は、正式なモデルの儀式をすべて持ちながら証拠の基盤を持たない、重いオーダーメイドの枠組みを考案することです。領域ごとに決めてください。正式に評定されるモデルは契約が要求する所のために取っておき、存在して合う所では証拠に基づくモデルを使い、それ以外のすべてには単純な能力ごとの尺度を保ちます。領域の一覧を持ち込み、各領域が現在どのモデルを使っているかに印を付け、考案されたスコアカードすべてに異議を唱えてください。

  3. 評価は誰が行い、寛大な採点をどう捉え、どれだけの頻度で再評価しますか。 自分で採点する評価は自分を持ち上げ、成熟度は人、システム、脅威が変わるにつれてずれるので、2年前の評定はしばしば作り話です。評価者を入れ替える、あるいは外部の妥当性確認を入れ、疑わしいほど高い自己採点を、祝う勝利ではなく追いかけるべき臭いとして扱います。再評価の周期を、各領域がどれだけ速く変わるかに結びつけてください。たとえば、文書化よりセキュリティのほうが頻繁に。管理職からの意見を集めるのではなく、証拠を集めて仕事をしている人々を巻き込みます。答えが、一つのチームが年に一度、相互チェックなしで自己採点するというものなら、能力ではなく安心を測っています。

  4. 各能力が実際に必要とする目標の成熟度レベルは何で、さらに高く押し進めることがプロセスの重みを買うだけなのはどこですか。 高いことは無料ではありません。レベルが一つ上がるごとに労力がかかり、通常は儀式が加わるので、どこでもレベル5という一律の目標は、一部の領域が決して返さない官僚主義に、有限の改善予算を流し込みます。大きな組織では、正しい目標は能力ごとに異なります。リスクの低い領域のレベル2はまったく安全かもしれませんが、安全やコンプライアンスが重要な領域の同じレベルは緊急事態だからです。能力ごとのリスク評価、次の段が労力とプロセスでいくらかかるかの誠実な見積もり、監査や契約上の下限を持ち込んでください。多くの監査は少なくとも定義されたレベル3を要求するからです。企業と政府の設定では、一部の規制対象の能力は本当に最上位の段を必要としますが、ほとんどはレベル3で十分に仕えられるので、能力ごとに意図して目標を決め、リスク調整後の見返りがそうなったところで、登るのをやめてください。

  5. 最後に成熟度レベルを上げたとき、それが守るはずだった成果は実際に改善しましたか。それとも点数だけが動きましたか。 インシデント、リードタイム、欠陥率が横ばいのままレベルが上がるのは、グッドハートの法則が働いている姿です。数字が目標になった瞬間、能力を測るのをやめます。大きなチームでは、これは容易にすり抜けます。本番が別のことを語っていても、成功した評定は進歩のように感じられるからです。投資する前に、各能力のレベルを本物の成果指標に結びつけ、それから議論に前後の証拠を持ち込んでください。四半期ごとのインシデント、変更失敗率、復旧時間、その能力が改善するために存在するものは何でも。評定されたレベルが適格性をゲートする企業と政府のポートフォリオでは、その隔たりは危険です。組み立てられた証拠でレベルは上がりうるのに、根底の実践は静かに劣化しうるからで、その最初の証明は、侵害、停止、あるいは失敗した監査です。

  6. 単一の見出しの成熟度評価を伝えていますか。それとも能力ごとの絵ですか。そしてレベルが報酬、順位づけ、チームの地位に結びつくことはありますか。 単一の全体の数字はリーダーシップに示しやすく、まさに重要な不均一さを隠します。強いデリバリーがレベル1のセキュリティ能力を覆い隠しうるからで、能力ごとのヒートマップはより手間がかかりますが、低い成熟度が高いリスクに出会う所を示します。より難しい問いは、点数がどう使われるかです。レベルがチームの報酬や順位に結びついた瞬間、誠実な報告は死に、労力は実質ではなく成熟の見かけに流れるからです。ヒートマップと、レベルが現在、人事評価、予算の決定、ベンダーのスコアカードに供給している場所の率直な説明を持ち込んでください。評定されたレベルが収益と適格性をゲートしうる企業と政府のサプライヤーでは、どの評価が結果を伴い、どれが舵取りのためだけに存在するかを明確にしてください。人々が水増しに報われる成熟度の絵は、現実を記述するのをやめるからです。

セクター別の視点

スタートアップ。 重い評定されるモデルは、短い滑走路では払えないオーバーヘッドです。少数の能力にわたる単純な尺度で1時間の自己評価を行い、具体的な何かをブロックする最も低い成熟度の隔たり(たとえば、最初の企業顧客からのセキュリティ質問票)だけを直し、残りは放っておきます。評価はコンサルタントではなく午後一回のコストで済むべきで、その出力は、必要もなく資金も出せない一様な高い点数ではなく、次の一つの行動です。

小規模事業者。 専任の評価者はおらず予算も厳しいので、オーダーメイドの枠組みを依頼するのではなく、軽量な公開モデル、自己採点できる短いデリバリーやセキュリティのチェックリストを借りてください。常設のプログラムではなく、弱い点がどこで顧客を失わせるかについての年次の会話として扱います。安く率直に保ってください。ベンダーにお金を払って作らせたお世辞の点数は、午後一回で自分で行った率直なものより価値が低いからです。

大企業。 価値は、多くのチームにわたって一貫して適用される共有の能力ごとのスコアカードにあり、隔たりが比較可能になり、改善予算が低い成熟度が高いリスクに出会う所へ流れます。レベルが予算や地位に供給されるようになったら、成熟度の劇場に強く備えてください。評価者を入れ替えるか外部で妥当性を確認し、結果を、チームを順位づけて誠実な報告を殺すリーグ表ではなく、舗装された道への投資(4.2章)を導くヒートマップとして管理します。

政府。 成熟度レベルは、ここではしばしば文字通りのゲートです。防衛の仕事のCMMC、サプライヤーの資格としてのCMMIの評定。必要なレベルを本物の能力で満たし、監査の下限が静かに上限にならないよう、率直な社内の自己評価を正式な評定とは別に保ってください。評定者に透明に証拠を文書化し、認証されたレベルと実際の実践の間のあらゆる隔たりを、書類として片付けるのではなく、閉じるべき説明責任のあるリスクとして扱います。

事例

スタートアップ。 10人のSaaSのスタートアップは、デリバリー、テスト、セキュリティ、オンコールをカバーする単純な4段階の尺度で、1時間の自己評価を行います。デリバリーとテストはレベル3ですが、セキュリティはレベル1のままだとわかり、それは、セキュリティ質問票つきの最初の企業顧客と契約を結ぼうとしているので重要です。そこで創業者たちは、必要もなくまだ払う余裕もない一様な高い点数を追う代わりに、次の1か月を、セキュリティだけを擁護できるレベル2に引き上げることに使い、残りは放っておきます。

大企業。 金融サービス企業が、軽量な能力ごとのスコアカード(デリバリー、テスト、セキュリティ、オブザーバビリティ、オンコール)で40のチームを評価します。ヒートマップは、規制上の露出が最も高い所でセキュリティの成熟度が最も遅れていることを明らかにするので、プラットフォームチームは、まずそれらのチームのために舗装された道のセキュリティツール(4.2章)に資金を出します。評価がチームを順位づけるためではなく投資に優先順位をつけるために使われるので、管理職は誠実に報告します。1年後の再評価は本物の動きを示し、そして決定的に、点数が上がっただけでなく、セキュリティインシデントも減りました。

政府。 防衛の請負業者は、仕事に入札するために必要なCMMCのレベルに到達しなければならず、システムインテグレーターは契約の資格としてCMMIの評定を保持しています。ここで成熟度レベルは、収益への文字通りのゲートです。うまく運営された版は、必要なレベルを本物の能力の下限として扱い、率直な社内の自己評価を正式な評定とは別に保ちます。まずく運営された版は、評定のために証拠を組み立て、その翌日に実際の実践を劣化させ、監査に合格しながら露出したままでいます。

ビジネスケース: 動機、ROI、TCO

成熟度評価の見返りは、向けられた投資から来ます。改善予算は有限です。盲目的に使えば、最も声の大きいものに資金を出します。成熟度評価は、リスクに対して能力が最も弱い所を示すので、同じ支出がより多くのリスクの低減とより多くの成果の改善を買います。評価自体は安く、構造化された証拠に基づくレビューのわずか数日で、間違った配分の改善プログラム、あるいはさらに悪いことに、侵害、停止、失敗した監査として表面化する検出されない能力の隔たりのコストに比べれば取るに足りません。

総所有コストでは、規律は軽量に保てば低コストで、評定の官僚主義に固まれば高コストです。支配的な隠れたコストは成熟度の劇場です。成熟の見かけを作ることに費やした労力は何も返さず、本物のリスクを覆い隠しえ、それはマイナスのROIです。リーダーシップに論拠を示すには、成熟度を、リスクと投資のレンズ、「すべてを改善する」を「まずこの三つを改善する」に変えるヒートマップとして提示し、レベルを追うこと自体への誘惑に対して明示的に予算を組んでください。レベルが契約上必要とされる所(CMMC、CMMI)では、ROIは直接的です。それは適格性の代価であり、目標は、それを高価な見せかけではなく本物の能力で満たすことです。

アンチパターンと落とし穴

  • 目標としてのレベル: それが表すはずの能力ではなく、数字を追うこと。
  • 成熟度の劇場: 評定のために証拠を組み立てる一方で、実際の実践が劣化すること。
  • 単一の全体評価: 危険な不均一さを隠す単一の成熟度の点数。
  • 高いほど常に良い: リスクやコストにかかわらず、すべての能力をレベル5に押し上げること。
  • 一度評価して二度としない: 一回限りの評定を恒久的な真実として扱うこと。
  • 非難のためにチームを順位づける: 成熟度を罰に使い、誠実な報告を殺すこと。
  • モデルの崇拝: 有用性を超えて、重い枠組みの儀式に従うこと。
  • 成果の無視: デリバリー、信頼性、セキュリティが改善しないまま、梯子を登ること。

成熟度モデル

  • レベル1、開始。 成熟度の共有された概念がありません。能力は想定され、不均一で、測定されません。評価は、あるとしても反応的で、計画ではなく、インシデントや監査の要求がきっかけです。
  • レベル2、発展。 少数のチームが何らかの尺度に対してその場しのぎの評価を行いますが、モデル、周期、厳密さはチームごとに異なります。結果は一貫せずに使われ、証拠は薄いので、見かけのために採点するリスクが常にあります。
  • レベル3、標準化。 単一の能力ごとのモデルと評価の周期が文書化され、組織全体に適用されます。評価は証拠に基づき、仕事をしている人々を巻き込み、成績表ではなく、優先順位づけされた改善の積み残しに供給します。
  • レベル4、管理。 成熟度がデータで測定され制御されます。各能力のレベルはベースラインに対して追跡され、成果指標(インシデント、リードタイム、変更失敗率)に結びつけられ、決まった周期で再評価されるので、ずれと寛大な採点は意見ではなく数字として現れ、目標は、リスクとコストに対して領域ごとに意図して設定されます。
  • レベル5、オーケストレーション。 評価は組織全体に統合され、継続的に改善されます。成熟度、リスク、成果が一つの適応的な絵として投資に情報を与え、目標は脅威と文脈が移るにつれて再均衡され、評価者は当然のこととして入れ替えられるか外部で確認され、実践は、もはやコストに見合わない儀式を積極的に退役させます。

議論のためのアイデア

  1. 証拠なしに成熟していると想定している能力はどれですか。
  2. 最も低い成熟度が最も高いリスクと一致するのはどこで、改善予算はそこへ向かっていますか。
  3. あなたの組織で、成熟度のレベルが目標やゲートになっているものはありますか。それはどんな行動を生みましたか。
  4. 各能力の正しい目標レベルは何で、さらに登ることが単に官僚主義を加えるだけなのはどこですか。
  5. チームは成熟度を誠実に報告しますか。それとも点数の使い方が率直さを罰していますか。
  6. 最後に「成熟度を改善した」とき、成果は実際に変わりましたか。

要点

  • 成熟度モデルは、段階の梯子に対して能力を評価し、改善の道筋を記述します。トロフィーではなく鏡です。
  • 領域ごとに、確立された証拠に基づくモデル(CMMI、DORA、SAMM/BSIMM、CMMC)を選びます。軽量な能力ごとの尺度が、しばしば最も実行しやすいです。
  • 誠実に、能力ごとに評価し、結果を順位づけや非難ではなく、リスクによる優先順位づけに使います。
  • 高いことが常に良いとは限らない。 リスクとコストに対して、目標レベルを意図して設定します。
  • 成熟度の劇場とグッドハートの法則に注意します。目標になったレベルは、能力を測るのをやめます。
  • 本書の統合された成熟度の自己評価と、各章自身の成熟度のセクションについては、12.4章を参照してください。

参考文献とさらなる読み物

  • CMMI Institute / ISACA, Capability Maturity Model Integration (CMMI).
  • Watts Humphrey, Managing the Software Process (origins of software process maturity).
  • Nicole Forsgren, Jez Humble, Gene Kim, Accelerate (capability, not maturity-level, thinking for delivery).
  • OWASP, Software Assurance Maturity Model (SAMM); BSIMM (Building Security In Maturity Model).
  • U.S. Department of Defence, Cybersecurity Maturity Model Certification (CMMC).
  • TMMi Foundation, Test Maturity Model integration.
  • James Shore and Diana Larsen, The Agile Fluency Model.
  • Martin Fowler, “Maturity Model” (bliki), on their uses and abuses.