6.1 AI戦略と準備態勢
概要と動機
人工知能は、研究上の目新しさから、大きな組織が責任をもって規模で展開することを今や期待される中核の能力へと変わりました。企業と政府機関にとって、本当の問いはもはや、AIがデモで印象的な何かをできるかどうかではありません。特定の投資が、代替案よりもうまく本物の問題を解決し、何年も安全に運用でき、監査、調達、公衆の精査を生き延びられるかどうかです。AI戦略とは、AIをどこに適用し、どこで避け、最初のモデルが本番に届く前にどんな基盤が必要かを決める規律です。
大きなチームにとって、規模と慣性が賭け金を上げます。不適切に枠づけられた取り組みは、予算を燃やし、才能あるエンジニアの気を散らし、公衆の面前で失敗したときに規制当局と市民の信頼を損ないます。よく選ばれた取り組みは、退屈な作業を自動化し、これまで決して届かなかったデータから洞察を引き出し、熟練した人々をより価値の高い仕事に解放できます。違いがモデルそのものであることはまれです。問題をどれだけうまく枠づけるか、データと人材の準備がどれだけできているか、ビジネスケースがどれだけ誠実かに帰着します。
政府と規制対象の文脈は、さらに制約を加えます。公的機関は支出を正当化し、透明性を保証し、不法な差別を避け、選挙で選ばれた公職者と公衆に説明責任を負い続けなければなりません。調達規則は、単独の供給元へのロックインを禁じ、説明可能性を求め、ベンダーにモデルの振る舞いの公開を要求するかもしれません。ここでは、コンプライアンス、監査可能性、出口の選択肢を、後付けではなく第一級の要件として扱ってください。
主要原則
- 使い道を探す技術からではなく、解く価値のある問題から始めます。
- ニーズを満たす最も単純なアプローチを好みます。AIは多くの選択肢の一つで、しばしば最良ではありません。
- データの準備、人材、プラットフォームの成熟を、後で整理する並行の作業ではなく、前提条件として扱います。
- 作るか買うかの決定を明示的に行い、市場と能力が変わるにつれて見直します。
- ライセンスやパイロットだけでなく、運用、監視、最終的な置き換えを含む総所有コストを定量化します。
- 初日から出口を設計します。ベンダーやモデルの切り替えを法外に高価にするアーキテクチャを避けます。
- 規制対象と公共の設定では、透明性、調達のコンプライアンス、説明責任を設計上の制約として扱います。
- 行動するコストと並べて、行動しないコストを測ります。
推奨事項
技術を選ぶ前に問題を枠づける
1ページの問題の記述を書きます。改善したい決定やタスク、現在のベースライン、望む測定可能な成果、システムが間違えたときに何が起こるかを名指しします。それから、その問題がそもそもAIに合うかを問います。関連するデータは十分にあるか。タスクはルールベースではなくパターンベースか。確率的な答えを許容できるか。人間が出力を確認できるか。多くの問題は、決定論的なソフトウェア、より良いプロセスの設計、あるいは単により良いデータの衛生で、より良く解決されます。AIが合わない場所を明示的に書き留めてください。たとえば、法律で完全に説明可能でなければならない決定、まれな間違いのコストが壊滅的で捉えようがない場合。
作る・買う・ファインチューニング・プロンプトの決定木を使う
最も安く最も速いものから、最も高価で最も制御できるものへと進みます。
- 既存のホスト型モデルにプロンプトを与える。 汎用モデル(AnthropicのClaudeや、他のプロバイダーの同等の提供物など)が、注意深いプロンプティングと検索で問題を解決するなら、まずそれをします。最低のコスト、最速の反復、訓練のインフラストラクチャなし。
- 検索やツールで補強する。 ギャップが知識や行動なら、モデルの重みに触れる前に、クエリ時に関連する文書を取得してモデルにコンテキストとして与える検索拡張生成(RAG)とツールの使用を加えます。
- ファインチューニングあるいは適応する。 プロンプティングが、必要な精度、トーン、形式を一貫して達成できないなら、より小さなモデルをあなたのデータでファインチューニングします。つまり、事前学習されたモデルを、あなたの例でさらに訓練して専門化します。これはMLOps(機械学習運用)のパイプラインのコストで制御を買います。
- 専門的な製品を買う。 明確に定義された領域(文書処理、不正スコアリング)では、成熟したベンダーの製品が、築けるどんなものにも勝るかもしれません。
- ゼロから作る。 基盤モデル(幅広いデータで事前学習され、多くのタスクに適応できる大きなモデル)の訓練は、独自のデータ、深い人材、戦略的な理由を持つ組織のために取っておきます。ほとんどすべての企業と機関にとって、これは間違った選択です。
データ、人材、プラットフォームの前提条件を確立する
データを、利用可能性、品質、ラベル付け、系統、使用の法的根拠について監査します。個人データやサードパーティのデータを含め、AIのためにそれを使う権利が本当にあることを確認します。人材を誠実に評価します。データサイエンティストが必要で、MLエンジニア、データエンジニア、確率的なシステムを理解するプロダクトマネージャー、出力を評価できるレビュアーも必要です。スケールする前に、プラットフォームの基準線を立ち上げます。実験追跡、モデルレジストリ(訓練されたモデルのバージョンとその承認状態の記録のシステム)、監視、安全なサービングで、新しいユースケースごとに運用を再発明しないようにします。
規制対象と政府の文脈を意図して扱う
調達、法務、リスクのチームを早期に関与させます。ベンダーに、モデルの出所、訓練データの扱い、評価結果、既知の制約の開示を求めます。データとプロンプトの可搬性を認める契約を好み、あなたを閉じ込める独自の形式を避けます。適切な所では、公衆に面するAIシステムの目的と安全策を公開し、人々に自動化された決定に異議を唱える窓口を与えます。監査が文書化された擁護できるプロセスを見つけられるよう、認められたフレームワーク(6.5章を参照)に合わせます。
総所有コストを計算し、ロックインを防ぐ
ライフサイクル全体のコストをモデル化します。推論あるいはライセンス、データパイプライン、人間によるレビュー、監視、再訓練、インシデント対応、廃止。それを現状のコストと代替案のコストと比べます。モデルを内部のインターフェースの背後に置き、プロンプトと評価データセットを可搬に保ち、ときどき第二のプロバイダーをテストすることで、ロックインを減らします。
トレードオフ: 長所と短所
| アプローチ | 長所 | 短所 | 最適な場合 |
|---|---|---|---|
| ホスト型モデルにプロンプトを与える | 速く、安く、インフラ不要、切り替えが容易 | 制御が少ない。呼び出しごとのコスト。データ共有の問い | プロトタイプ、幅広いタスク、不確かな要件 |
| 検索による補強 | 答えをあなたのデータに根づかせる。更新可能 | 検索の品質が難しい。インフラが増える | 知識の多いタスク |
| より小さなモデルのファインチューニング | 制御。規模では呼び出しごとのコストが低い。オンプレの選択肢 | MLOps、データ、維持管理が必要 | 安定した、量の多い、専門的なタスク |
| 製品を買う | 実証済み、サポートあり、価値までが速い | ライセンスコスト、ロックイン、限られた適合 | 明確に定義された日用品的な問題 |
| 基盤モデルを作る | 最大の制御と差別化 | 莫大なコスト、稀少な人材、高いリスク | フロンティアのラボを除き、ほぼ決してない |
支配的なトレードオフは、制御対コストと速度です。プロンプティングは最大の速度と柔軟性を与えますが、制御は最小です。作ることは最大の制御を与えますが、費やすべき組織がほとんどない資源を要求します。ほとんどの大きなチームは中間に住むべきです。まずプロンプトと検索、選択的にファインチューニング、日用品的なニーズには買う。ロックインは短期の利便性を長期のリスクと交換し、それは、複数年の出口の義務が一般的な政府で特に重要です。
チームで議論すべき問い
上位三つの候補ユースケースは、それぞれプロンプト、検索、ファインチューニング、購入、構築のはしごのどこに位置し、何の証拠がそれを一段動かしますか。 これが重要なのは、無駄なAI支出の大半が、一段高く始めることから来るからです。注意深いプロンプティングで足りたはずの所でモデルを訓練すること。大きなチームにとって、はしごを共有の既定として合意することは、各グループが高価なパイプラインを再発明するのを止めます。各候補の1ページの問題の記述、現在のベースライン、ギャップが知識(検索)、一貫性(ファインチューニング)、解決済みの日用品(購入)のどれかについての誠実な読みを持ち込んでください。企業と政府の設定では、各段の調達と監査のコストを加えてください。ファインチューニングされたモデルは、ホスト型の呼び出しにはないMLOpsの負担を引きずるからです。答えは、その部屋で少なくとも一つの過剰にスコープされたプロジェクトを廃止あるいは格下げさせるはずです。
最も依存しているベンダーやモデルの具体的な出口の計画は何で、実際にテストしましたか。 ロックインは受け入れるのが安く、解くのが高価で、政府では、リハーサルしなければ果たせない複数年の出口の義務を負うかもしれません。頼っている独自の機能の一覧、プロンプトと評価データセットが可搬かどうか、モデルが内部のインターフェースの背後にどう置かれているか(あるいは置かれていないか)を持ち込んでください。見るべきシグナルは、評価スイートを第二のプロバイダーに対して誰かが実行したことがあるかです。なければ、出口の計画は計画ではなく願望です。誠実な答えが、切り替えには数か月かかり、中核のコードの書き直しを要するというものなら、それを渡るべき橋ではなく、今直すべき設計上の欠陥として扱ってください。
誠実な準備態勢のスコアカードは、データの権利について何を語り、どのユースケースを今日失格にしますか。 データの準備を飛ばすことは、パイロットを静かに沈める失敗です。モデルは機能するが、データを使う法的根拠が最初からなかったり、ラベルも系統もなかったりする。大きな組織では、個人データとサードパーティのデータが、法域とデータセットによって異なる同意と契約上の制限を提起します。各候補の利用可能性、品質、ラベル付け、系統、法的根拠の監査を持ち込み、データの基盤が存在するまで、一部のユースケースをブロックされたと印づける覚悟を持ってください。規制対象と公共の設定では、使えない法的根拠は遅延ではなく、完全な停止であり、準備態勢の仕事への資金は、後付けではなく、計画の明示的な項目であるべきです。
稼働中のAIのユースケースが実際に機能しているとどう知り、何の証拠がそれを廃止させますか。 ほとんどのAIポートフォリオはゾンビを蓄積します。出荷され、誰かを感心させ、今ではそのコストに見合うかを誰も確認せずに永遠に走るパイロット。ローンチ前にベースラインと成功の指標に合意し、それから明示的な廃止の閾値を設定して、止める決定がその場で擁護されるのではなく、事前になされるようにしてください。現在の指標、成果あたりの人間による監督のコスト、ローンチ以来見たドリフトを持ち込んでください。企業と政府のポートフォリオでは、誰が各システムを決まった周期でレビューし、誰がそれを退役させる権限を持つかを指名してください。レビューする責任を誰も負わないユースケースは、誰も決して止めないものだからです。
人間はどこでループに留まり、その監督はいくらかかり、実際に予算を付けましたか。 最も安く見えるAIのユースケースは、完全な自動化を静かに想定し、現実が押し戻すレビュー、訂正、エスカレーションを通じてコストを漏らすものです。どの決定を人が確認しなければならず、どれをモデルが単独でとってよく、どれを決してとってはならないかを意図して決め、それが意味する人間の時間を値付けしてください。低信頼のケースの量、間違った答えのコスト、現在のエスカレーションの経路を持ち込んでください。規制対象と公共の設定では、自動化された各決定を責任ある担当官と異議申し立ての経路に結びつけてください。説明できない監督は、持っていない監督だからです。
提案していることを動かす人材とプラットフォームはありますか。それとも、持っていない容量を静かに想定していますか。 野心的なAIの計画は、モデルよりも、地味な基盤で失敗します。パイプラインを保守する人がいない、出力を評価できる人がいない、デプロイするプラットフォームがない。各候補のユースケースを、実際に必要とする技能とインフラストラクチャに対応づけ、ギャップが採用、パートナー、あるいは築かない理由のどれかである所を誠実に述べてください。各システムを本番で所有できる人、それが動くプラットフォーム、買わなければならない能力の目録を持ち込んでください。大きなあるいは公的な組織では、調達と採用のリードタイムを加えてください。関連する期間内に採用できない人材に依存する計画は、届けられない計画だからです。
セクター別の視点
スタートアップ。 速度と生存が支配します。中核の価値に触れる狭いユースケースを一つ選び、薄いインターフェースの背後のホスト型モデルで出荷し、支出に固い上限を設けてください。インフラストラクチャを築いたりモデルを訓練したりするのは避けます。最も乏しい資源はエンジニアリングの注意で、保守できないファインチューニングのパイプラインは、堀ではなく負債だからです。速く動く市場に追随できるよう、切り替えを安く保ちます。
小規模事業者。 おそらくデータサイエンティストはおらず予算も厳しいので、AIを、人員を置くプログラムではなく、すでに使っているツールに埋め込まれたものとして買ってください。準備態勢を機械学習のプロジェクトではなく、データの衛生とプライバシーの問題として枠づけます。どんな顧客データを持ち、それで何をしてよく、間違った自動化された答えがどこで顧客を失わせるかを知る。AIを任意で、透明で、簡単にオフにできるようにするベンダーを好みます。
大企業。 問題は多くのチームにわたるポートフォリオのガバナンスです。共有の作る・買うのはしご、一貫した準備態勢の評価、グループが高価なパイプラインを再発明するのをやめるためのロックインと総コストの分析。MLOpsと人間による監督の負担を明示的に予算化し、プロバイダーが入れ替え可能であるようにインターフェースの層を標準化し、AIのユースケースを、散らばったパイロットではなく、明確な指標と廃止の基準を備えたポートフォリオとして管理します。
政府。 透明性、調達規則、説明責任があらゆる選択を形づくります。政策を生成するのではなく公式の情報源を引用するシステムを好み、重大な決定には説明責任のある人間を置き、契約でデータの可搬性とモデルの制約の開示を求めます。平易な言葉の説明と異議申し立ての経路を公開し、署名する複数年の出口の義務を守り、説明責任のある担当官の手にあるべき最終的な評価の決定には、AIを関与させません。
事例
スタートアップ。 5人のスケジューリングのスタートアップは、2人のエンジニアを中核のプロダクトから外すことなく、自然言語の「会議を予約して」機能を加えたいと考えました。重要な最小の問題、つまりリクエストを提案された時間に解析することを選び、後でプロバイダーを切り替えられるよう、薄い内部APIの背後のホスト型モデルで出荷しました。チームは月ごとの固い支出の上限を設け、ユーザーが提案された時間を受け入れるかを追跡し、量が追加の作業を正当化するときにだけ、ファインチューニングされたモデルを見直すことに合意しました。
大企業。 多国籍の保険会社は、保険金請求のトリアージを速めたいと考えました。独自のモデルを訓練する代わりに、問題を狭く枠づけ(受け付けた請求のルーティングと要約)、ホスト型モデルと保険証券の文書に対する検索でプロトタイプを作り、人間の処理時間と精度に対して測定しました。価値を証明した後にだけ、最も量の多い請求の種類のために、呼び出しごとのコストを削る小さなモデルをファインチューニングしました。プロバイダーを入れ替えられるよう、モデルを内部APIの背後に保ち、低信頼のケースの人間によるレビューを含む3年間のTCOをモデル化しました。
政府。 国の税務当局は、職員が市民の問い合わせに答えるのを助けるAIアシスタントを検討しました。それらの答えが法的義務に触れるので、機関は透明性を主張しました。システムは公式のガイダンスを引用付きで表面化させることしかできず、政策を発明することは決してなく、人間が自動化された提案のすべてを送信前にレビューしました。調達はベンダーにモデルの制約の開示とデータの可搬性を求め、機関は平易な言葉のシステムの説明と異議申し立ての経路を公開しました。最終的な評価の決定にはAIを一切関与させず、それらを説明責任のある担当官のために取っておきました。
ビジネスケース: 動機、ROI、TCO
AI戦略は、二つの鏡像の失敗を避けるために存在します。決して元を取れないAIへの過剰投資と、競合や同業の機関が先行する間の投資不足です。ROIは、節約された労働、短縮されたサイクルタイム、下がったエラー率、可能になった新しい能力から来ます。これらを本物のベースラインに対して測り、めったになくならない人間による監督の本当のコストを割り引いてください。
TCOは地味な項目を含まなければなりません。データパイプライン、監視、世界がずれるにつれた再訓練、セキュリティレビュー、最終的な廃止。安く見えるパイロットは、何年も規模で動くと高価になりえます。採用しないコストも示してください。より遅いサービス、より高い手作業のコスト、戦略上のずれ。リーダーシップへの論拠は、ポートフォリオの視点で示します。少数の高信頼の賭け、明確な成功の指標、失敗への廃止の基準、データと人材の基盤が存在することを示す準備態勢の評価。リーダーに準備態勢への明示的な資金を求めてください。飛ばせば、高価な手戻りを保証することになります。
アンチパターンと落とし穴
- 問題を探す解決策。 同業がそうしたからAIを買い、それから使い道を探すこと。
- データの準備の飛ばし。 利用できない、ラベルのない、あるいは法的に使えないデータの上でモデルを立ち上げること。
- デモ駆動の決定。 本番品質の評価なしに、洗練されたデモに基づいてコミットすること。
- 人間のループの無視。 完全な自動化を想定し、コストの大半が隠れるレビューを過小に予算化すること。
- 静かなロックイン。 出口の計画なしに、一つのベンダーの独自の機能の上に深く築くこと。
- 運用の過小評価。 デプロイをゴールではなく、保守の義務の始まりとして扱うこと。
- 後付けのコンプライアンス。 設計の後に透明性と監査可能性を、数倍のコストで後付けすること。
成熟度モデル
- 開始。 その場しのぎの実験、共有の戦略なし、誇大宣伝と個人の熱意に駆動される決定。
- 発展。 一部のプロジェクトに問題の枠づけがあり、最初のプラットフォームの基準線が現れ、作るか買うかは議論されるが一貫しません。
- 標準化。 明確な指標、文書化された決定木、準備態勢の評価、ロックインとTCOの分析を備えたAIのユースケースのポートフォリオが、チーム間で一貫して適用されます。
- 管理。 ポートフォリオが測定されます。準備態勢、ROI、TCO、人間による監督のコストがベースラインに対して追跡され、廃止の基準が証拠に基づいて徹底され、デリバリーと品質への影響が各実施/不実施の判断を駆動します。
- オーケストレーション。 AI戦略がビジネスとリスクの計画と統合され、準備態勢が継続的に維持され、組織は証拠に基づいてAIシステムを日常的に退役させ、置き換え、再スコープし、市場とリスクの状況が変わるにつれてポートフォリオを再均衡します。
議論のためのアイデア
- 問題が本当にAIに合わないとき、どう決め、誰がノーと言う権限を持ちますか。
- どの準備態勢の閾値が、プロジェクトをパイロットから本番へゲートすべきですか。
- 価値までの時間が速くなる代わりに、どれだけのロックインが許容されますか。
- 政府では、透明性の義務は、作るか買うかの選択をどう形づくるべきですか。
- ベンダーと熱心な支持者に過小評価するインセンティブがあるとき、TCOの見積もりをどう誠実に保ちますか。
- AIのポートフォリオを所有するのは誰で、廃止の決定はどうなされますか。
要点
- 戦略は、技術ではなく、本物の問題と誠実なベースラインから始まります。
- 最も単純な選択肢を好みます。プロンプト、次に検索、次にファインチューニング、次に購入、ゼロから作ることはまれに。
- データ、人材、プラットフォームの準備態勢は前提条件であり、それらへの資金は計画の一部です。
- 規制対象と政府の文脈は、設計により、透明性、調達のコンプライアンス、出口の選択肢を求めます。
- 完全なTCOと行動しないコストをモデル化し、最初のアーキテクチャの決定から、ベンダーのロックインを防ぎます。
参考文献とさらなる読み物
- Ajay Agrawal, Joshua Gans, and Avi Goldfarb, Prediction Machines: The Simple Economics of Artificial Intelligence.
- Eric Siegel, The AI Playbook: Mastering the Rare Art of Machine Learning Deployment.
- Andriy Burkov, The Hundred-Page Machine Learning Book.
- National Institute of Standards and Technology, AI Risk Management Framework (AI RMF 1.0).
- Organisation for Economic Co-operation and Development, OECD AI Principles.
- Thomas H. Davenport, The AI Advantage: How to Put the Artificial Intelligence Revolution to Work.