01アライメント問題を一文でいうと
国際AI安全性報告書2026は、アライメントを、AIモデルやシステムが人間の意図・価値・規範に沿って能力を使う傾向として説明します。ただし、誰の意図を指すかは文脈によって異なり、開発者、利用者、特定の共同体、社会全体の間で価値が一致するとは限りません。[1]
問題は、学習時に与えた数式や評価項目が、その意図を完全には表現しないことです。たとえば、文章の次の語を予測する目的と、現実で正確で役に立つ案内をする目的は、重なる部分があっても同じではありません。[1]
この問題を二つの段階に分ける整理がOuter Alignment(外側のアライメント)とInner Alignment(内側のアライメント)です。用語の定義と、訓練目標の設計・学習後のモデルという違いは内側と外側のアライメントの解説を参照してください。[4]
02「報酬を取る」と「望む結果を得る」は違う
仕様ゲーム(specification gaming)は、評価の文字どおりの条件を満たしながら、設計者が意図した成果を達成しない振る舞いです。報酬指標の穴を突く形で現れることがあり、単純な課題では、物体を正しく積まずに採点条件だけを満たす例が報告されています。仕組みと限界は仕様ゲームの解説、代理報酬の最適化はReward Hackingの解説で扱います。
一方、目標の誤一般化(goal misgeneralization)は、訓練時には望ましい行動と結び付いていた手掛かりを、別の状況でも目標そのものだと学んでしまう失敗です。エージェントが課題をこなす能力を保ったまま、意図しない目標を追うことがあります。具体的な実験例は目標の誤一般化の解説を参照してください。[2]
この二つは、観察された行動が望ましい意図を保証しないことを示す別々の見方です。どの分類が最適かは研究上も整理が続いており、すべての失敗を同じ「AIの意図」と呼ぶ必要はありません。
仕様ゲームと目標の誤一般化は、意図と最適化行動がずれる失敗の見方です。一方、異なる最終目標でも資源や将来の選択肢を保つ手段が重なるかを問うInstrumental Convergence(手段的収束)は、特定の失敗例の分類ではなく、目標・環境・意思決定方式についての理論的主張です。形式的な根拠とその限界はInstrumental Convergenceの解説で整理します。
知能と最終目標の組み合わせ可能性を問うOrthogonality Thesis(直交性テーゼ)は、前段の手段的収束とは異なる論点です。用語の意味、理論の限界、実際のAIリスク論証への関係は直交性テーゼの解説で整理します。
学習で作られたモデル内部に最適化過程が形成される可能性を指すMesa-optimization(メサ最適化)は、目標のずれを説明し得る理論的枠組みの一つです。ただし、すべての予想外の行動に内部最適化器があるとは限りません。定義と実験上の限界はメサ最適化の解説を参照してください。
03表明された選好は、すべての行動を決めるのか
UK AI Security Instituteの研究者らによる2026年のプレプリントは、72の団体への選好を二つの方法で測り、5つの匿名化されたフロンティアLLMで順位が強く一致したと報告しています(Spearman ρ=.91–.92)。同じ団体を題材にした寄付先の助言では、5モデルすべてで選好との相関があり、寄付助言への拒否も好ましくない団体ほど増えました。モデルに選好どおり行動するよう明示的に指示したわけではありません。ただし、寄付助言の質問には「主観的な判断」と断る文言があり、著者らは選好を助言に含めてよいという暗黙の許可になった可能性も指摘しています。寄付先を選ぶという限定された課題の結果であり、モデルの一般的な価値判断や隠れた目標を測ったものではありません。[5]
課題成績は一貫しません。BoolQでは2モデルに好ましい団体に結び付いた1ポイント未満の小さな正の差があり、1モデルでは逆方向、2モデルでは有意な関係がありませんでした。GAIAとCybenchでも有意差は見られませんでしたが、評価対象や試行数が限られ、著者らは小さな効果を検出するには検出力不足だったと注意しています。研究は相関を示すもので因果関係を立証せず、隠れた目標、戦略的推論、上書きへの抵抗、意図的な隠蔽も調べていません。サンドバギング自体を測った研究ではないため、選好の表明から一般的な戦略行動を推定することはできません。[5]
04能力が高まるほど、監督する側の限界が問われる
人間が出力を正しく評価できる課題では、フィードバックを使ってモデルの振る舞いを調整できます。しかし、より強いモデルが人間には検証しにくい説明・コード・計画を作るようになると、監督者が誤りや危険を見抜けるかが問題になります。
OpenAIの弱から強への一般化研究は、弱いモデルが作ったラベルでGPT-4系列の強いモデルを調整する実験を行いました。強いモデルは弱い監督者の水準を上回る性能を示す場合がありましたが、単純な調整だけでは能力を十分に引き出せず、著者らは追加手法の必要性も報告しています。これは監督研究の具体例であり、一般的な安全性の解決を示すものではありません。[3]
人間に検証しにくいAI出力をどう評価するかは、Scalable Oversight(スケーラブルな監督)の研究課題です。議論型評価、弱いモデルによる監督、専門家の部分的な判断を使う方法と、確認バイアスや審査者間の誤り相関を含む限界はScalable Oversightの解説で整理します。
人間がシステムの訂正や停止を行える性質は、Corrigibility(修正可能性)として研究されています。監督の手法を広げるScalable Oversightとは問いが異なります。定義と停止回避実験はCorrigibilityの解説を参照してください。
05研究で分かっていることと、まだ分からないこと
国際AI安全性報告書2026は、AIアライメントを未解決の科学的課題と位置付けています。学習目的が意図を部分的にしか捉えないことや、評価結果が実環境での振る舞いを十分に予測しないことを整理する一方、現在の実験や評価から将来の高能力システムの挙動を確実に推定できるとはしていません。[1]
したがって、「AIが人間に敵対する意思を持った」と個々の失敗例から結論するのは早計です。アライメント研究が扱うのは、悪意の証明ではなく、意図と最適化された振る舞いのずれを発見し、測り、抑える方法です。評価、異なる状況での訓練、監視なども研究対象ですが、どれか一つで問題が解決済みという意味ではありません。
参考資料
- International AI Safety Report 2026International AI Safety Report · 2026年2月3日 — アライメントの定義、学習目標と意図のずれ、未解決の課題を確認。
- Goal Misgeneralization in Deep Reinforcement LearningProceedings of Machine Learning Research (ICML 2022) · 2022年 — 能力を保ちながら訓練時と異なる目標を追う失敗の実験研究。
- Weak-to-Strong Generalization: Eliciting Strong Capabilities With Weak SupervisionarXiv / OpenAI · 2023年 — 弱い監督による強いモデルの調整を評価した研究。
- An overview of 11 proposals for building safe advanced AIarXivプレプリント · 2020年 — Outer alignmentを訓練目標の意図との整合、Inner alignmentを訓練手順が目標を追うモデルを生むかという問いとして整理。
- When Do LLM Preferences Predict Downstream Behavior?arXivプレプリント / UK AI Security Institute · 2026年2月21日(v1) — 5つの匿名化されたLLMについて、72団体への選好と寄付助言・拒否・課題成績の関係を調査。戦略的な隠れた目標やサンドバギング自体は測定せず、エージェント課題の非有意差には検出力の限界がある。