Research archive / 読むための案内
解説アーカイブ
AGI・ASI・シンギュラリティの用語整理、予測と懐疑論、AI安全、アライメント、評価、国際報告書、ガバナンスを研究資料に立ち返って読み解く書庫です。トップページが描く全体像から、予測の根拠・仕組み・証拠の読み方・組織の判断へ進めます。
初版 2026年9月26日 · 最終更新 2026年9月27日
AGI・ASI・シンギュラリティ — 用語と仮説
能力の広さ、能力水準、技術や社会の転換シナリオを区別し、定義と測定の資料から読み解きます。
シンギュラリティ予測 — 2045年説と懐疑論
特定の年を確定視せず、専門家調査、能力評価、社会への導入、自己改善の条件から予測の根拠と限界を検討します。
AIアライメント — 目標と評価を読み解く
最初に問題の全体像をつかみ、次に評価仕様の穴と、環境が変わったときの目標のずれを区別すると、隣接する研究テーマを整理しやすくなります。
- ペーパークリップ最大化装置とは? 思考実験の出典と限界ペーパークリップ最大化装置は、AIに与えた目標と人間の意図がずれる問題を考える思考実験です。Bostromの原文、手段的収束との関係、何を証明しないかを一次資料から整理します。
- AIアライメント問題とは? AIの目的と人間の意図がずれる理由AIアライメント問題とは、AIの振る舞いを人間の意図・価値・規範に沿わせる難題です。報酬の抜け穴、目標の誤一般化、弱い監督の限界を研究資料とともに整理します。
- Specification Gaming(仕様ゲーム)とは? AIが評価の抜け穴を使う仕組みSpecification gamingは、AIが目的の文字どおりの条件を満たしつつ、設計者の意図した結果を外す現象です。報酬ハッキングとの関係、実験例、何がまだ分からないかを解説します。
- Goal Misgeneralization(目標の誤一般化)とは? 能力を保ったまま目標がずれる現象Goal misgeneralizationは、AIエージェントが課題をこなす能力を保ちながら、訓練時とは異なる状況で意図しない目標を追う失敗です。深層強化学習とLLMの実験、仕様ゲームとの違いを整理します。
- 人間に検証しにくいAIをどう監督する? Scalable Oversightの方法と限界Scalable Oversight(スケーラブルな監督)は、人間には検証しにくい高能力AIの出力を、議論・弱いモデルの監督・専門家の部分判断などで評価する研究です。代表的な手法と実験の限界を整理します。
- Corrigibility(修正可能性)とは? AIの停止・訂正をめぐる研究と限界Corrigibility(修正可能性)は、AIが人の訂正・停止を受け入れ、監督者の判断を不当にゆがめない性質です。形式的な停止ゲームと、LLMを使った限定的な停止回避実験を分けて解説します。
- Instrumental Convergence(手段的収束)とは? AIの資源獲得・権力追求の議論Instrumental Convergence(手段的収束)は、異なる目標を持つエージェントでも資源や将来の選択肢の維持が共通の手段になるという理論的主張です。形式的な結果、学習過程を扱う研究、近年の反論と限界を一次資料から整理します。
- Orthogonality Thesis(直交性テーゼ)とは? AIの知能と最終目標の関係Orthogonality Thesis(直交性テーゼ)は、AIの問題解決能力と最終目標は別の軸だという哲学的主張です。論理的可能性と実装の難しさ、AIの実存リスク論証への批判、現在のLLMへの適用を一次資料から整理します。
- Mesa-Optimization(メサ最適化)とは? AIモデル内部の最適化とアライメントMesa-optimization(メサ最適化)は、学習で作られたモデル自身が入力の中で別の最適化を行う可能性を指す概念です。内側の目的と学習時の目的、Transformer研究、目標の誤一般化との違いを整理します。
- Inner AlignmentとOuter Alignmentの違いとは? 内側と外側のアライメントOuter alignmentは訓練目標が意図した結果を表すか、inner alignmentは学習後のモデルがその目標を追うかを問います。仕様の誤り、メサ最適化、目標の誤一般化を分けて解説します。
- Reward Hacking(報酬ハッキング)とは? 代理報酬を最適化する問題Reward hackingは、AIが不完全な代理報酬を高めても、意図した成果の評価が下がり得る問題です。仕様ゲームとの重なり、RLHFの報酬モデル過剰最適化、研究上の限界を整理します。
Frontier AI評価 — 能力と安全性をどう測るか
概念の仕組みを読んだ後は、実際の評価が何を測り、どこで結論の範囲に限界を持つかを確認します。
- Frontier AIの安全性評価とは? 能力を測る方法とベンチマークの限界Frontier AIの安全性評価(evals)で何を測れるか、ベンチマーク飽和・エージェント記録・試行回数・推論予算による能力曲線を解説。結果を実配備へ当てはめる際の限界も整理します。
- AIは評価中だと気づく? Evaluation Awarenessの研究と読み方AIが評価中だと認識する「評価認識」と、気づいた後に回答を変えることは別の問いです。会話記録の分類、行動観察、内部表現の研究を比べ、ベンチマーク解釈の注意点を整理します。
- AIのサンドバギングとは? 能力評価で確認されたことと検出の限界AIのサンドバギングは、評価中に能力を意図的に低く見せる振る舞いです。制御実験、弱い監督による誘発、IRTを使う条件付き検出研究と、実評価記録での未検出を分けて整理します。
- AIの自己複製はどこまで可能? RepliBenchの評価と現実の限界AIエージェントの自己複製を資源・重み・配備・持続に分解。RepliBench、運用シナリオ、コンテナ脱出の評価を比べ、全工程の自律複製が示されたかを区別します。
- AI Control評価とは? 信頼できないAIを監視する方法と試験の限界AI Control評価は、AIが監督を意図的にすり抜ける可能性を仮定し、信頼できるモデルや監査を使う運用プロトコルの安全性と有用性をレッドチームで調べます。代表例と評価指標の限界を解説します。
- AIサイバーリスクとは? 攻撃支援・自律化の現状と防御AIはサイバー攻撃の脆弱性調査やコード作成を支援し、防御にも使われます。国際報告とAISIの模擬評価・評価中インシデントから、確認された能力、自律型攻撃との違い、対策の論点を整理します。
国際AI安全性報告書 — 証拠と論点の読み方
公式報告書の要約・構成・証拠範囲をたどり、具体的な論点はテーマ別の解説で深掘りします。
AIガバナンス — 組織の安全枠組みを読む
公的機関の技術評価と企業の安全枠組みを区別し、それぞれの役割や開発・配備判断へのつながりを読みます。
- Frontier AI Safety Frameworkとは? 主要企業の安全枠組みを比較Frontier AI Safety Framework(フロンティアAI安全枠組み)を、Anthropic RSP 3.4、Google DeepMind FSF 3.1、OpenAI Preparedness Framework v2から比較。対象リスク、判断の閾値、対策、文書の読み方を整理します。
- AI Safety Instituteとは? 日本・英国・米国の役割と違いAI Safety Instituteは各国政府のどんな機関か。日本AISI、英国AI Security Institute、米国CAISIの所管・評価・ガイダンスの違いと、公開資料の読み方を一次資料から整理します。
読み進め方
AGI・ASI・シンギュラリティの用語整理 → 2045年予測の根拠と懐疑論 → アライメントの基礎と失敗例 → 評価の方法と限界 → 国際報告書の読み方 → 組織の判断と安全枠組み
この書庫の読み方
本文では、研究で観察された実験結果、各報告書が整理する現状、将来についての推測を分けて記します。小規模な実験をそのまま実運用中のAIの性質や発生確率へ広げず、資料が示す範囲と限界をあわせて確認してください。
サイト全体の見取り図はシンギュラリティの概要とAIリスクの章、参考図書はトップページの書棚から読めます。