01安全枠組みは、評価結果を組織の判断へつなぐ

安全評価(evals)が「どの条件で、何ができたか」を調べるのに対し、安全枠組みは、その結果を開発・配備の手順へどう結び付けるかを定めます。想定する脅威、能力やリスクの判断基準、必要な保護策、責任者と報告方法などを組み合わせます。評価とベンチマークの違いはFrontier AI評価の解説も参照してください。[1][3][5]

ここで比較するのは、AnthropicのResponsible Scaling Policy(RSP)、Google DeepMindのFrontier Safety Framework(FSF)、OpenAIのPreparedness Frameworkです。各社が自ら公開した方針と報告であり、共通の第三者認証を受けた格付けではありません。

023社の公開文書は、閾値と対策の結び方が違う

Anthropic — RSP v3.4

2026年7月8日発効のv3.4は、能力・利用上の閾値と、それに対応する対策を示します。文書では、自社として行うことと業界全体への推奨を分け、Frontier Safety RoadmapやRisk Reportsで進捗とリスク評価を伝える構成です。したがって、表中の業界向け推奨を、そのまま同社が無条件に約束した実施事項と読み替えないことが大切です。[1]

公式ページにはv3.4のほか、2026年8月のRisk Reportが掲載されています。方針の版と、特定時期のリスク報告は別資料として確認できます。[2]

Google DeepMind — FSF v3.1

2026年4月17日版は、深刻なリスクに結び付くCritical Capability Levels(CCL)と、より早い段階で追跡するTracked Capability Levels(TCL)を区別します。評価で近さを調べ、リスク評価・緩和策・残余リスクの受け入れ判断へ進む構造です。v3.1ではCBRN領域のTCLや、機械学習R&Dとミスアラインメントをまとめた領域などが示されています。[3][4]

OpenAI — Preparedness Framework v2

公開PDFはv2、最終更新日は2025年4月15日です。生物・化学、サイバー、AI自己改善を追跡し、既存リスクを大きくするHighと、前例の少ない新しいリスク経路につながるCriticalの能力閾値を定めています。Highでは配備前、Criticalでは開発中にもリスクを十分に抑える保護策を求める方針です。[5]

2026年8月7日の発表は、Astraの初期評価ではCriticalサイバー能力を排除できないという段階でした[8]。追加の証拠と評価を経て9月1日に閾値を満たすとの判断が示され[9]、9月3日にはAstraが初の該当モデルとして公開されました[6]。「排除できない」と「閾値を満たす」は、時系列上の異なる評価段階です。

また8月18日、OpenAIは現在のPreparedness Frameworkを超える広い取り組みが必要だと述べ、訓練から配備までの保護策をまとめる方向へ枠組みを進化させる方針を示しました[10]。これは今後の更新意向を示す発表で、v2の公開PDF(2025年4月15日更新)の版が改訂されたという意味ではありません[5][10]。

04枠組みを読むときの4つの確認点

  1. 対象範囲: どの脅威・能力を扱い、何を別の方針に任せているか。
  2. 発動条件: どんな評価・証拠で閾値に達したと判断するか。
  3. 結果への対策: 追加評価、開発時の保護策、配備制限などがいつ必要になるか。
  4. 説明責任: 誰が承認し、リスク報告・モデルカード・外部レビューのどこまでを公開するか。

枠組みの説明だけでは、約束した手順の実施や対策の有効性までは確認できません。最新の方針版に加え、モデル別の評価・安全報告、外部評価、更新履歴を照合すると、記述と実際の適用を分けて読めます。

AI評価が測るものと限界は評価の解説、学習された目標が意図からずれる研究はアライメント問題の解説で深掘りできます。

Primary sources / references

参考資料

  1. Responsible Scaling Policy v3.4Anthropic · 2026年7月8日 — 閾値と緩和策、業界向け推奨と自社計画、RoadmapとRisk Reportの構成。
  2. Anthropic's Responsible Scaling PolicyAnthropic · 2026年8月14日更新 — 現行版一覧と2026年8月Risk Reportの掲載状況。
  3. Frontier Safety Framework v3.1Google DeepMind · 2026年4月17日 — CCL・TCL、リスク管理工程、2026年版の変更履歴。
  4. Frontier safety at Google DeepMindGoogle DeepMind · 2026年4月17日 — 現行版とモデル別評価・緩和策レポートへの公式案内。
  5. Preparedness Framework v2OpenAI · 2025年4月15日更新 — 追跡カテゴリ、High/Critical閾値、閾値に対応する保護策。
  6. Safety overview: GPT-6 AstraOpenAI · 2026年9月3日 — Preparedness FrameworkのCriticalサイバー能力閾値に達したとするモデル別概要。
  7. OpenAI's Frontier Governance FrameworkOpenAI · 2026年5月28日 — Frontier Governance FrameworkとPreparedness Frameworkの役割の違い。
  8. Responding to the next frontier of critical cyber capabilitiesOpenAI · 2026年8月7日 — Astraの初期評価でCriticalサイバー能力を排除できないとした段階の公表。
  9. Path to Astra: critical capabilities and frontier safeguardsOpenAI · 2026年9月1日 — 追加評価でAstraがCritical閾値を満たすと判断した更新と、安全策の説明。
  10. Pacing model development in an era of cyber-critical capabilitiesOpenAI · 2026年8月18日 — 現行のPreparedness Frameworkを超える取り組みの必要性と、枠組みの今後の進化方針。