01知能と最終目標は、異なる問いとして考える

直交性テーゼは、人工エージェントの知能の水準と、最終目標(final goal)の内容が、概念上は別の軸として組み合わせられるという主張です。ここでいう知能は、ある目標を達成する方法を探す能力・道具的合理性として扱われます。Bostromは、より高い問題解決能力が、それだけで人間に望ましい最終目標を決めるとは限らないと論じました。[1]

これは「知能が上がるほど人間の価値観から遠ざかる」という逆向きの法則でもありません。主張の焦点は、能力だけを見て最終目標の内容を一意に推定できるかどうかです。目標はどのように作られ、学習され、変更されるのかという実装上の問いは残ります。

02可能性の主張は、実現の容易さや確率を示さない

「直交する」という比喩を、知能と目標が現実のAI集団で統計的に独立しているという意味に読み替えると、主張を強くしすぎます。Bostromの議論は、より正確には多くの組み合わせが原理上可能かを問うものです。論文自身も、ある目標と知能水準の組み合わせが論理的に可能だとしても、現実にそのシステムを作るのが容易とは限らないと注意しています。[1]

したがって、このテーゼだけから、特定の危険な目標を持つAIが開発される確率、現在のモデルが隠れた最終目標を持つ頻度、目標が訓練後も固定される度合いを算出することはできません。可能性、作りやすさ、実際に選ばれる設計、配備後の行動は別々に検討する必要があります。

03手段的収束とは、別の命題を組み合わせる

直交性テーゼが問うのは「どんな最終目標を、どの知能水準と組み合わせて考えられるか」です。手段的収束が問うのは「異なる最終目標を持つエージェントでも、目標達成に使える中間手段が重なるか」です。Bostromは二つを区別した上で並べ、危険な行動がどのように生じうるかを論じました。[1]

この二つを並べても、AIが必ず危険な目標を持つ、資源を際限なく集める、あるいは人類に実存的危害を与えるとは直ちにいえません。実存リスクの議論へ進むには、エージェント性、具体的な最終目標、目標達成に何が役立つか、利用可能な手段や人間との相互作用について追加の前提が必要です。手段的収束の形式結果と異論は手段的収束の解説を参照してください。

04「知能」の定義を変えると、論証も変わる

MüllerとCannonは、AIの実存リスクを導く標準的な論証が二種類の知能概念を使っていると批判しました。制御喪失を考える前提には人間のような一般知能を置く一方、直交性テーゼには目標達成手段を見つける道具的知能を置くため、同じ論証の前提として接続できない場合があるという分析です。これは直交性テーゼのあらゆる読み方を反証したというより、テーゼから実存リスク結論へ進む論証の組み立てを問題にしています。[2]

この批判を検討するときは、「知能」が目標を実現する能力を指すのか、目標自体を熟考・修正する能力を含むのかを確認します。定義が異なると、知能の上昇が目標にどう影響するかという問いも変わります。

05可能な目標から、危険な行動が自動的に導かれるわけではない

Sharadinは、直交性と手段的合理性から危険な資源獲得を結論するには、ある行動がどの意味で目標を「促進する」のかという説明が必要だと論じています。論文は複数の促進概念を検討し、それらがBostrom型の実存リスク結論を支えないと主張します。ここで争われているのは、目標と知能の組み合わせが原理上ありうるかだけでなく、資源獲得のような特定行動が幅広い目標に実際どれほど役立つかです。[3]

2026年8月の書籍章プレプリントは、生物の価値形成とLLMの学習・利用形態を比較し、古典的な直交性テーゼは現在のLLMには当てはまらないと主張しています。これはLLMが利用者の入力や人間の文章からどのような目標・価値を得るかについての一つの理論的立場です。プレプリントの主張を、あらゆるモデルで最終目標が必ず人間に一致する実証結果として扱うことはできません。[4]

06直交性テーゼを読むときに確かめたいこと

「賢ければ善意になる」「どんな賢いAIも任意の価値を持てる」といった主張の根拠を比べるには、次の点を分けて読みます。

  • 知能の定義: 目標達成のための道具的推論か、目標そのものを反省・変更する一般的能力まで含むか。
  • 主張の強さ: 論理的に可能という命題か、実装できる、起こりやすい、現行モデルで観察されたという主張か。
  • 最終目標の根拠: 開発時に指定した目的、訓練データから学ぶ価値、プロンプトで与えたタスクを区別しているか。
  • 目標の持続性: システムが長期に目標を保持するエージェントなのか、個別リクエストに応答するモデルなのか。
  • リスクへの追加前提: 想定する目標がどう危険な手段を生み、人間にどのような損害へ結び付くのか。

意図と学習目標のずれを広く見るにはAIアライメント問題の解説、目標に共通する中間手段の仮説は手段的収束の解説も参照してください。

Primary sources / references

参考資料

  1. The Superintelligent Will: Motivation and Instrumental Rationality in Advanced Artificial AgentsMinds and Machines / Springer Nature · 2012年6月13日公開 — 直交性テーゼを、知能水準と最終目標の内容が概念上別の軸だとする主張として提示。
  2. Existential risk from AI and orthogonality: Can we have it both ways?Ratio / Wiley Online Library · 2021年7月オンライン公開、2022年刊行 — 一般知能と道具的知能の区別から、直交性テーゼを用いた実存リスク論証の妥当性を批判的に検討。
  3. Promotionalism, orthogonality, and instrumental convergencePhilosophical Studies / Springer Nature · 2024年10月オンライン公開、2025年刊行 — 目標の促進概念を分析し、危険な資源獲得が実存リスク結論を支えるかを検討。
  4. The Evolutionary Origin of Values: implications for AI alignment, sentience and existential riskarXivプレプリント(書籍章として提出) · 2026年8月4日提出、8月14日改訂 — 生物とLLMの価値形成を比較し、古典的直交性テーゼのLLMへの適用に異論を提示。