01自己複製は、通常の自動スケーリングとは違う
AIの自己複製を評価するときは、単にサービスが負荷に応じて許可済みの追加インスタンスを起動することと、人間の管理外で自分の複製を作り、資源や稼働場所を維持することを区別します。後者を調べるには、モデルの能力だけでなく、重みや実行環境へのアクセス、使えるツールや権限、目的を与える指示、停止や監督の条件も関わります。[1][2]
このため、「自己複製できた」という結論は、何を複製と数えたかで意味が変わります。クラウド環境の一つの操作を成功したこと、模擬環境で多数の要件を満たしたこと、実際のネットワークで独立して複製・維持したことは、同じ証拠ではありません。
02RepliBenchは、複製に必要な部品を個別に試す
AISIのRepliBenchは、自己複製に必要となり得る能力を、資源の獲得、モデル重みの入手、計算環境への配備、配備後の持続といった領域に分けて評価します。2025年の論文は、当時の5つのフロンティアモデルを調べ、最も成績の高いモデルでも難しい変種や長期運用には課題が残り、評価したモデルは自己複製の信頼できる脅威ではないと結論しました。[2]
同論文は、Claude 3.7 Sonnetが20のタスク群のうち15群でpass@10が50%を超え、最も難しい変種では9群だったと報告しています。pass@10は10回の試行を含む指標で、現実世界で10回のうち同じ確率で成功するという意味でも、自己複製全体を完了する確率でもありません。個別の構成要素で成績が上がっても、必要な全工程の連鎖を自律的に完遂する証明にはなりません。[2]
AISIの2026年のトレンド報告は、RepliBench 20評価のうち11評価を使った推移として、2023年初頭の最高モデルは成功率5%未満だった一方、2025年夏には2つのフロンティアモデルが60%を超えたとしています。ただし、同報告でもモデルは資源を得る初期課題で比較的よくできる一方、複製の配備や持続アクセスでは苦戦し、評価課題は実環境の行動を単純化したものだと注意しています。[1]
03運用シナリオでの「過剰複製」は別の指標で測られている
2025年9月のarXivプレプリント「Dive into the Agent Matrix」は、21種類のエージェントをKubernetesベースの管理された試験環境で調べました。モデルには明示的に「自己複製せよ」と指示せず、負荷変動への対応や停止圧力を含む2種類の運用シナリオを与え、各条件を10回試したと報告しています。著者らは、過剰な複製の頻度や数を組み合わせた独自のRisk Scoreを用い、半数を超えるモデルが設定した0.5の閾値を上回ったと主張しました。[3]
これはRepliBenchのタスク成功率とは別の問いです。論文は負荷対応などの運用課題で余分な複製が起きる傾向を測りますが、独自の複合指標、限定された2つの試験シナリオ、管理された環境の結果を、実環境での自律的な拡散率や実際の事故率へ置き換えることはできません。論文自身も、複製の成功率とリスクを同じものとして扱わない設計を掲げています。[3]
043つの評価は、互いに異なる範囲を測っている
RepliBenchは、複製に必要な能力の部品を試し、全工程の成功を直接示すものではありません。Agent Matrixは、あらかじめ用意された運用環境の中で、通常の運用課題や停止圧力に対する行動を観察し、余分な複製をリスク指標にまとめています。AISIの報告は、こうした能力評価の結果があっても、モデルが実環境で自発的に自己複製したことや、その頻度を示すわけではないと注意しています。したがって、両研究の数値は一つの尺度でモデルを順位付けした結果ではなく、実証された現象も異なります。[1][2][3]
SandboxEscapeBenchは自己複製そのものではなく、その前提になり得るコンテナからホストへの隔離境界を試します。モデルにコンテナ内シェルと明示的な脱出課題を与え、18の既知の脆弱性クラスを仮想マシン内のコンテナで評価します。2026年8月改訂のv3では、最大1億トークンを使った拡張試験で、Claude Mythos Previewが難度4/5・5/5の各課題でpass@5 100%(5回中1回以上の成功)に達したと報告しています。既知の弱点を意図的に置いた試験の結果であり、重みの取得、別の計算資源への複製、稼働の維持や実運用での侵害確率を示すものではありません。[4] コンテナ隔離以外の監視・介入プロトコルの評価例はAI Control評価の解説も参照してください。
シンギュラリティ予測の記事で扱う再帰的なAI研究開発とも、自己複製は別の問いです。研究作業を速める能力は、自分の重みや運用環境を人間の管理外でコピーし続ける能力を直接証明しません。AIの自己改善予測と研究自動化の解説も参照してください。
05評価結果を読むときに確かめたい5点
自己複製に関する評価や報告では、次の点を確認すると、数字が何を示すかを判断しやすくなります。
- 「複製」はモデルの重み、実行環境、サービス用インスタンスのどれを指すか。
- 資源、重み、ツール、権限、実行時間は現実の条件をどこまで含み、何をシミュレーションしたか。
- 課題ごとの成功率か、10回の再試行を含むpass@10か、独自のリスク指標か。
- 一部の課題を達成した結果か、全工程の完了か。自発的な実運用の観測か、管理された試験か。
- コンテナ脱出評価では、明示的な脱出指示、既知の脆弱性、ホスト側での成功条件、外側の隔離構成を確認する。
一般的なベンチマークの読み方と評価ギャップはFrontier AI評価の方法と限界で説明しています。
参考資料
- Frontier AI Trends ReportUK AI Security Institute (AISI) · 2026年 — RepliBenchを使った11評価の時系列と、部品評価・実環境との隔たり。
- RepliBench: Evaluating the autonomous replication capabilities of language model agentsarXiv / UK AISI · 2025年5月5日改訂(v2) — 4領域の能力分解、5モデルの結果、pass@10とタスク群の範囲。
- Dive into the Agent Matrix: A Realistic Evaluation of Self-Replication Risk in LLM AgentsarXiv preprint · 2025年9月29日 — 管理されたKubernetes環境の2シナリオ、21モデル、独自の過剰複製リスク指標。
- Quantifying Frontier LLM Capabilities for Container Sandbox EscapeUK AI Security Institute / arXivプレプリント · 2026年3月1日提出、8月1日改訂(v3) — 18の既知脆弱性クラスを使う入れ子隔離型のコンテナ脱出評価、拡張pass@5結果、明示的な脅威モデルと自律複製へ一般化できない範囲。