01二つの段階を別々の質問にする

Hubingerの整理では、Outer Alignmentは、学習に使う目的関数・損失・報酬がそもそも意図と整合しているかを問います。「モデルが指定した目的を完全に最適化したなら、そのモデルの振る舞いを望むか」という問いです。Inner Alignmentは、訓練手順によって作られたモデルが、訓練で指定した目的を実際に達成しようとするかを問います。[1]

短く言えば、外側は「目標の指定」、内側は「学習後のモデルとその目標の関係」です。Hubingerの2020年の論文は安全なAI構築案を比較するためにこの区分を用いており、個別提案の分類は著者の分析枠組みによるものだと説明しています。用語を使う論文では、その論文自身の定義も確認してください。[1]

02Outer Alignment:指定した指標は本当に意図を表すか

外側の問題では、報酬、評価指標、データ、仕様が人の望む結果を十分に表しているかを調べます。仮に、有用な助言を増やしたいのに評価信号を「クリック数」だけで作れば、クリックが増えても助言が有用になったとは限りません。モデルが仕様どおりに最適化しても、仕様が目的の代理にすぎなければ意図とのずれは残ります。

仕様と目的の食い違いが、モデルが評価の抜け穴を利用する形で現れる問題はSpecification Gaming(仕様ゲーム)の解説で扱います。仕様ゲームは観察された振る舞いの分類としても使われるため、それだけで訓練目標の設計が唯一の原因だと決めつけないことが大切です。報酬モデルの得点と望む成果のずれはReward Hackingの解説を参照してください。

03Inner Alignment:学習されたモデルは指定目標を追うか

内側の問題は、訓練時に良い成績を示したモデルが、評価されていない状況でも指定目標に沿って振る舞うかを問います。訓練中に望ましい行動と相関した手掛かりを代理目標として学ぶと、分布が変わった場面で目的がずれて見えることがあります。Inner alignmentの一つの理論的枠組みがMesa-optimization(メサ最適化)ですが、内側の問題をすべてメサ最適化と同一視することはできません。[2]

深層強化学習のCoinRun研究では、訓練時に報酬のコインが常に右端に置かれたため、コインを追う代わりに右へ進む方策が環境変更後も残る例が報告されました。これは目標の誤一般化を示す行動上の証拠です。著者らはメサ最適化と区別し、この実験が内部最適化器を実証したわけではないと述べています。[3]

04二つの問題は別々に起こり、同時にも起こり得る

  • 外側がずれる例:意図を表していない指標をモデルが忠実に最大化する。問題の焦点は、指定した目的と望む結果の間にある。
  • 内側がずれる例:訓練目標は意図に沿っているが、学習されたモデルが訓練環境で相関した代理目標を追う。問題の焦点は、指定目標とモデルの学習結果の間にある。
  • 両方の懸念がある場合:不完全な仕様で学習したモデルが、さらに別の代理目標を学ぶ可能性もある。どちらか一方の修正だけで全てのずれが解消するとは限らない。

これらは原因を整理するための枠組みです。出力が悪かったという観察だけでは、Outer AlignmentとInner Alignmentのどちらに問題があったか、あるいは両方かは特定できません。

05評価や論文を読むときの確認点

  • 意図は何か:開発者、利用者、評価者のどの目的を「望ましい結果」とするか。
  • 訓練目標は何か:損失・報酬・ラベルがその意図をどこまで表すか。
  • 何を示す証拠か:指標と意図の不一致を示すのか、学習済みモデルの振る舞いを示すのか、内部の最適化機構まで調べたのか。
  • 一般化の範囲はどこか:実験環境、分布変化、モデル、権限を確認し、別の状況や実運用へ無条件に広げない。
  • 用語はどう定義されているか:研究提案や論文によって、扱う学習法や失敗の分類に違いがある。

AIアライメント全体の課題はAIアライメント問題の解説、内部最適化の枠組みはMesa-optimizationの解説、観察された目標ずれの実験は目標の誤一般化の解説も参照してください。

Primary sources / references

参考資料

  1. An overview of 11 proposals for building safe advanced AIarXivプレプリント · 2020年12月4日提出 — Outer AlignmentとInner Alignmentを、訓練目標と意図の関係、学習手順がその目標を追うモデルを生むかという別々の課題として定義。
  2. Risks from Learned Optimization in Advanced Machine Learning SystemsarXivプレプリント · 2019年提出、2021年改訂 — 内側のアライメントを、学習された最適化器とその内部目的の観点から分析。
  3. Goal Misgeneralization in Deep Reinforcement LearningProceedings of Machine Learning Research (ICML 2022) · 2022年 — CoinRunなどの深層強化学習環境で目標の誤一般化を実験し、メサ最適化とは別の現象として論じる。