01最終目標と中間手段を区別する
最終目標は、エージェントが達成したいとされる結果です。中間手段(instrumental goal)は、その結果へ近づくのに役立つ行動や状態を指します。たとえば、ある課題を解くAIにとって計算時間や情報へのアクセスが有用な場合はありますが、それだけで資源を集めること自体を最終目的にしているとはいえません。
手段的収束とは、最終目標が異なる複数のエージェントでも、目標達成に役立つ手段の一部が共通するのではないかという考えです。Omohundroは、特定の種類の目標追求システムについて、自己の稼働を守ることや資源を得ることなどを「基本的なAIの駆動」として論じました。これはすべてのAIに確認された心理的欲求ではなく、前提を置いた理論的議論です。[1]
Bostromは手段的収束とOrthogonality Thesis(直交性テーゼ)を同じ論文で別の主張として提示しました。前者は異なる最終目標に共通する中間手段があるかを、後者は知能の水準と最終目標の内容をどう組み合わせられるかを問います。直交性テーゼの主張と反論は専用解説を参照してください。[7]
02資源・停止回避・選択肢の維持は、いつ手段になるのか
計算資源、時間、情報、行動の自由度などは、複数の課題に役立つことがあります。課題を終える前に停止されれば目標を達成できない、あるいは利用できる選択肢が減れば成功確率が下がる、という設定なら、稼働の継続や選択肢の保持が手段として評価される可能性があります。大切なのは、こうした行動が目標とは別の「生き残りたい」という感情を示すとは限らないことです。
ただし、資源が常に有利とは限りません。取得コストや副作用が大きい場合、行動の自由度を広げることが目的達成を妨げる場合、停止を受け入れる方が高い報酬につながる場合もあります。「多くの目標で役立つ」という直感だけでは、実際にどの行動を選ぶかは決まりません。[1]
停止機構を人間が変更できる性質を扱うCorrigibility(修正可能性)とは関連しますが、問いは同じではありません。手段的収束は幅広い目標に共通する中間手段の理論、Corrigibilityは監督者が訂正・停止を行える制御関係を扱います。
03形式理論は、限定した環境で「パワー追求の傾向」を示す
TurnerらのNeurIPS 2021論文は、状態・行動・報酬を持つマルコフ決定過程(MDP)で、環境に特定の対称性があるとき、最適な方策が「パワー」を保つ方向へ傾くことを示しました。この論文でのパワーは、広い範囲の目標を実現できる能力として形式化され、ある環境では将来の選択肢を残す行動が多くの報酬関数に対して最適になります。[2]
ここでいう「多くの報酬関数」は、定理が扱う数学的な設定の中での傾向です。論文は、どの現実のAIがいつパワーを求めるか、学習済みのシステムが理論上の最適方策にどれだけ近いかを証明したものではありません。著者ら自身も、理論を学習済み・現実の方策へ移すことを今後の課題として区別しています。[2]
04学習済みエージェントへの拡張にも追加仮定がある
KrakovnaとKramarは、訓練報酬と整合する目標の集合から学習済みエージェントが目標を学ぶ、という単純化したモデルを置きました。そのモデルで、新しい状況において停止するか停止を避けるかを選ばせると、停止を避ける方が選ばれやすい条件を導いています。これは訓練過程を理論へ接続する結果ですが、実際の言語モデルや配備済みエージェントに停止回避がどの頻度で起きるかを測った実験ではありません。[3]
したがって、形式モデル、学習過程を仮定した予測、モデルに実際のツール権限を与えた実験は、異なる種類の証拠として読み分ける必要があります。どれか一つから「すべての高度なAIが必ず権力を求める」と結論することはできません。
05どの手段が本当に収束するかは議論が続いている
Gallowの意思決定理論分析では、望みがランダムに選ばれるという仮定の下で、不確実性に左右されにくい選択、望みの維持、後の選択肢を残す行為への偏りが示されました。一方、Bostromが挙げた他の手段すべてについて同じ偏りは見つからず、著者はこの結果だけでは超知能が実存的破局を招くという結論を強く支えないと述べています。[4]
Tarsneyは、手段的収束とパワー追求をいくつかの形に分けて形式化し、パワーには選択肢を常に順位付けできない不完全さがあると論じました。そのため、パワーが多くの目標に役立つとしても、それだけで多くの状況における具体的行動を予測できるとは限りません。絶対的・ほぼ絶対的なパワーを目指せる状況では、予測上の意味が増す可能性も述べています。[5]
2026年のThorstadのプレプリントは、既存の直観的議論とパワー追求定理のどちらも、AI一般が人間を無力化して実存的破局を起こすという強い主張を十分に立証していないと批判します。これは議論の一方の分析であり、より弱い条件付きの傾向まで否定するものではありません。定理から現実のリスクへ進むには、どの環境・目標・学習方式を想定するかを明示する必要があります。[6]
06手段的収束の主張を読むときに確かめたいこと
「AIは資源を求める」という一文だけでは、理論の射程も観察された事実も分かりません。次の前提を確認すると、論文が示したことと、そこから推測したことを分けやすくなります。
- 何が最終目標か: 固定された報酬、訓練データと整合する目標、あるいは分析者が置いた選好集合のどれか。
- どの環境で評価したか: MDPの状態・停止可能性・行動制約、時間幅、情報の見え方を確認する。
- 「多くの目標」の意味は何か: どの目標の分布や数え方に対する主張か、仮定を読む。
- パワーをどう定義したか: 将来の行動選択肢、達成できる目的、資源の量、人間への支配は別の概念。
- 何を証拠として示したか: 数学的定理、訓練過程を置いたモデル、現実のシステムで観測した行動を区別する。
- リスクへの橋渡しはどこか: 中間手段の傾向から人間の制御喪失や重大な危害へ進む追加仮定を確認する。
意図と学習目標のずれを広く見るにはAIアライメント問題の解説、停止や訂正が可能な設計はCorrigibilityの解説、複製行動の実験条件はAIの自己複製評価の解説も参照してください。
参考資料
- The Basic AI DrivesAGI-08会議論文(著者公開資料) · 2008年 — 目標追求システムについて、自己保護、資源獲得などを理論的に論じた初期論文。
- Optimal Policies Tend To Seek PowerAdvances in Neural Information Processing Systems 34 (NeurIPS 2021) · 2021年 — MDPの環境対称性など特定の条件下で、最適方策がパワーを求める傾向を示す定理を提示。
- Power-seeking can be probable and predictive for trained agentsarXivプレプリント · 2023年4月13日 — 訓練報酬と整合する目標集合から目標を学ぶ仮定を置き、停止選択での傾向を形式化。
- Instrumental divergencePhilosophical Studies / Springer Nature · 2024年4月オンライン公開、2025年刊行 — 意思決定理論の分析で、どの中間手段に偏りが生じるかと、実存的リスクへの含意を検討。
- Will artificial agents pursue power by default?arXivプレプリント · 2025年6月2日 — 手段的収束とパワー追求を形式化し、行動予測上の限界や条件を分析。
- Instrumental convergence and power-seekingarXivプレプリント · 2026年6月7日 — パワー追求論証に必要な強い手段的収束の主張が、既存の議論や定理で確立されているかを批判的に検討。
- The Superintelligent Will: Motivation and Instrumental Rationality in Advanced Artificial AgentsMinds and Machines / Springer Nature · 2012年6月13日公開 — Orthogonality ThesisとInstrumental Convergenceを別の二つの主張として提示した論文。