01評価(evals)とベンチマークは同じではない

ベンチマークは、定められた課題群と採点方法で性能を比較する一つの形式です。安全性評価は、モデルの能力や傾向について、特定の危険シナリオを前提に証拠を集め、リスク判断や対策に結び付ける活動全体を指します。テスト問題の点数だけでなく、モデルを動かす道具、権限、評価者、運用条件も結果を左右します。

国際AI安全性報告書2026は、評価を含むリスク管理を、モデルの試験、組織の開発・公開判断、条件付き対策、インシデント報告などの組み合わせとして整理します。[1]

02何を、どの状況で測るのか

評価対象には、たとえばサイバー攻撃に関わる能力のような「何ができるか」、有害な依頼を拒否するかといった「どう振る舞う傾向があるか」、監視を避ける試みを検出できるかなど、異なる問いがあります。一つの試験結果を別の能力や別の状況へそのまま読み替えることはできません。

解釈には、どのモデル版を、どのシステム指示・ツール・権限で動かしたか、課題が現実の脅威モデルをどこまで表すか、何回試してどの程度のばらつきがあったかが必要です。評価者が再現可能な条件を説明できるか、モデルが採点方法や評価状況をどこまで認識できるかも結果の意味に関わります。認識と、その後に回答を変えることは別の問いです。評価認識の研究と測定方法を参照してください。評価中に能力を意図的に低く見せるサンドバギングの実証と未確認の範囲は、サンドバギングの解説で扱います。

評価環境の設定も結果を左右します。Anthropicは2026年9月、同一の第三者評価パートナーが構築したサイバー評価で4件のインシデントを報告しました。課題文はインターネット接続のないシミュレーションと説明していましたが、環境設定ミスで外部ネットワークへ接続でき、対象システムや許可行為も課題文に明示されていませんでした。AnthropicはMETRに独立調査を依頼したと記しています。これは同社の報告時点の説明であり、独立調査済みの結論や一般的な実配備での発生率とは区別し、ネットワーク隔離と許可範囲を確認して読む必要があります。[7]

03ベンチマークは、難問のままではいられない

能力が上がると、以前は難しかった問題群が短期間で飽和し、モデル間の差や次の能力を測りにくくなります。Stanford AI Index 2026は、Humanity’s Last Examでフロンティアモデルの成績が一年で30ポイント上がり、数年使えると想定されていた評価が数か月で飽和する場合があると報告しました。[2]

テスト問題自体の品質にも注意が必要です。同レポートがまとめた一つの検証では、無効と判定された設問の割合はMMLU Mathで2%、GSM8Kで42%でした。この範囲は検証対象となった二つのベンチマークの結果であり、すべてのAI評価や問題集に当てはまる割合ではありません。[2]

さらにStanfordのResponsible AI章は、主要な開発者が能力ベンチマークの結果を広く報告する一方、責任あるAIのベンチマーク報告はまだ少ないと指摘しています。測りやすい性能と、安全に関わる性質の測定量には偏りが残ります。[3]

04試行回数は不確実性に応じて配分できる

英国AI Security Institute(AISI)の研究者が2026年8月に公開したプレプリントは、評価試行を固定回数繰り返す代わりに、推定の不確実性が十分小さくなるまで課題ごとに追加し、その後の試行を止めるoptstopを提案しました。すべての課題を候補に残したまま、課題ごと・グループごとに必要な試行回数を変える方法です。[10][11]

原論文は、予定した全試行を実行した評価記録をshadow modeで切り詰め、全件実行の結果と比較しました。200項目・各10回を計画した9条件(合否、順序評価、連続スコア)では、想定停止により予定試行の57〜97%を省きました。個別条件の3つでは統計的同等性が確定しませんでしたが、階層的な総合解析では全件実行との差が事前設定の同等範囲内だったと報告しています。これはライブ運用での停止試験ではなく一つの検証設計での結果で、すべての安全性評価を同じ比率だけ短縮できる保証ではありません。[11]

この方法は、同じ評価グループ内の観測が交換可能であることと、課題の提示順をランダム化することを前提にします。また、成功がまれな能力を見逃さないよう、推定成功率が1%未満に近づく場合は停止を保守的に遅らせます。結果を読むときは、課題順、停止基準、低頻度の成功をどう扱ったかも確認してください。[10][11]

05METRのtime horizonが測るのは、特定の作業時間軸

METRのTime Horizonは、ソフトウェア開発などの一連の課題について、人間ならどれほどの時間がかかるかを見積もり、AIがその課題を50%の確率で完了できる長さとして表す指標です。作業時間が長いほど、まとまった仕事を続ける能力を比較しやすくなります。[4]

2026年のMETR報告は、Time Horizon 1.1の228課題を用い、人間の推定作業時間は1秒から30時間までと説明しています。一方、16時間を超える測定は課題数が少なく、推定が信頼できる範囲に限界があるとしています。これは特定の課題群での能力評価であり、職業全体の自動化、実環境での自律性、危険な意図を直接測る指標ではありません。[4]

06推論時の計算予算は、能力評価の数字を変える

評価で許す推論時の計算量(test-time compute)も、モデルのスコアを左右する条件です。McFadyenらの2026年arXivプレプリントは、ソフトウェア、数学、医療、サイバーの7ベンチマークで、トークン予算の拡大、文脈の圧縮、回答の反復提出を調べました。5つの主要ベンチマークを共通条件で比較する実験と、別途収集されたサイバー評価データの分析を区別し、どの追加計算や提出方法が効くかはベンチマークごとに異なると報告しています。したがって、予算を増やせば全課題で同じ割合だけ成績が上がる、という結果ではありません。[12]

AISIの狭いサイバーCTF課題群では、約8%の課題は1課題あたり1,000万トークン以上の予算で初めて解け、一部には5,000万トークンまで必要でした。同機関が人間の作業時間から推定した80%成功のtime horizonも、最先端モデルでは、課題ごとの上限を250万から5,000万トークンへ変えると約2時間から約14時間へ変化しました。これはAISIの特定のサイバー課題・モデルと推定方法に限った値で、METRの50%基準によるtime horizonとは直接比較できません。[13]

追加計算の効果が小さい領域もあります。たとえば同研究はHealthBenchで、各モデルが通常の予算内に成績の頭打ちを示したと報告しています。評価結果を読むときは、1課題あたりの予算とトークンの数え方、計算を一つの長い試行と複数の試行のどちらへ配分したか、正誤フィードバックの有無、性能が頭打ちになったかを確認してください。配備時に使える費用・待ち時間の制約に合わせた低予算の点数も実用上は意味がありますが、それを高い予算での能力上限と取り違えないことが重要です。[12][13]

07評価設計が結論の範囲を決める

2026年5月に公表されたMETRのFrontier Risk Reportは、公開モデルの比較に加えて、Anthropic、Google、Meta、OpenAIが参加した、企業内部でのAI利用に関するパイロット評価を報告しています。この企業単位の調査はモデル単体の評価とは異なり、参加企業が共有した情報や内部運用も扱います。[4]

2026年9月のClaude Opus 5.5事前評価も、範囲を確認して読む例です。METRはAnthropicとの無報酬の評価契約のもと、10営業日のAPIアクセスを受け、5つの課題でAI研究開発に関する能力を調べました。METRは前モデルFable 5.1からの改善を段階的と評価し、完全なAI研究開発の自動化は見込みにくいと結論していますが、この評価は特定の安全方針の閾値への適合確認でも、モデルのアライメント評価でもありません。報告ではAnthropicが文面を確認・編集したこと、別チームによる予備評価は結論だけが共有され、根拠の詳細は評価要約の執筆者に共有されなかったことも明記されています。[6]

同じ報告書でも、時期、参加者、公開された情報、使用したベンチマークの範囲を伴わずに結論だけを引用すると、何を測った結果かが失われます。METR自身も評価の飽和や、測定範囲の制約を記しています。

英国AI Security Institute(AISI)は、9モデルを71件の非公開サイバーCTF課題で各10回評価した6,390件のReAct試行記録を分析し、平均pass rateだけでは分からない失敗理由を調べました。報告では、あるモデルが試行の10%で課題を拒み、別モデルが30%で提供元のポリシー違反検知を起こしました。複数モデルでは課題を途中で断念する発言が目立ち、2モデルは「毎ターン、ツールを呼ぶ」という足場の指示に対するツール呼び出し率が50%未満でした。[8][9]

このケースは、合否の集計だけでは能力の限界、拒否、エージェント足場への不遵守を切り分けられないことを示します。対象は非公開のサイバーCTF課題と特定のReAct構成に限られ、観測比率を他のモデルや評価分野の失敗率として一般化できません。原研究は、人手レビューの手順やサンプリング、LLMスキャナーの精度検証にも改善余地があるとしています。ログ分析は合否集計を補う証拠として、試験条件と分析方法を併せて読む必要があります。[8][9]

08事前テストに合格しても、実世界の安全は確定しない

国際AI安全性報告書2026は、制御された事前評価の成績が、現実環境での有用性やリスクを確実には予測しない「評価ギャップ」を指摘しています。評価方法はまだ成熟途上で、モデルの相互作用や実際の利用文脈を十分に捉えられない場合があります。[1]

したがって、安全性評価は、試験条件と脅威モデルを限定した証拠として読む必要があります。課題の設計、再現性、採点の抜け道、失敗例、人間による確認、公開後の監視を重ねるほど判断材料は増えますが、これだけであらゆるリスクを消せるわけではありません。評価結果を企業内の対策や配備判断につなげる公開方針はFrontier AI安全枠組みの比較、報酬や採点条件の抜け道は仕様ゲームの解説、AIの意図と学習目標のずれはアライメント問題の解説も参照してください。

モデル単体の能力試験とは別に、未信頼のAIが監督をすり抜けると仮定して、監視・介入手順そのものを試すAI Control評価があります。レッドチームと防御プロトコルを使う方法はAI Control評価の解説で扱います。AIサイバー能力評価の実測範囲と評価中のインシデントはAIサイバーリスクの解説で扱います。

Primary sources / references

参考資料

  1. International AI Safety Report 2026International AI Safety Report · 2026年2月3日 — 評価ギャップ、危険な能力評価、リスク管理手法の整理。
  2. Technical Performance — The 2026 AI Index ReportStanford HAI · 2026年 — ベンチマークの飽和と設問品質に関する集計。
  3. Responsible AI — The 2026 AI Index ReportStanford HAI · 2026年 — 責任あるAIの評価・報告と測定ギャップ。
  4. Frontier Risk Report (February to March 2026)METR · 2026年5月19日 — Frontier AIの企業内部利用を含むパイロット評価とTime Horizon 1.1の方法。
  5. Task-Completion Time Horizons of Frontier AI ModelsMETR · 2026年更新 — Time Horizon評価の課題設計、スキャフォールド、採点確認と更新履歴。
  6. Summary of METR's predeployment evaluation of Claude Opus 5.5METR · 2026年9月22日 — 5課題・10営業日のAI研究開発能力評価、評価目的、開発元レビューと根拠開示の限界を確認。
  7. An alignment assessment of recent cybersecurity incidentsAnthropic · 2026年9月9日 — 4件のサイバー評価インシデント、環境設定・許可範囲の問題、METRによる独立調査予定を報告。
  8. Transcript analysis for AI agent evaluationsUK AI Security Institute(AISI) · 2025年10月10日 — 平均pass rateだけでは分からない拒否・途中断念・ツール使用の問題と、AISIによる6,390件の試行記録分析の概要。
  9. Assuring Agent Safety Evaluations By Analysing TranscriptsJerome Wynne、Cozmin Ududec(UK AISI Science of Evaluation team) · 2025年10月10日 — 9モデル、71件のサイバーCTF課題、6,390件のReAct試行記録に関する手法・結果・分析上の限界。
  10. Optimal stopping: spending evaluation compute where it countsUK AI Security Institute(AISI) · 2026年8月27日 — optstopの逐次評価の考え方、慎重な導入手順、ランダム化と希少な成功への保守的な扱い。
  11. Knowing When to Stop: Bayesian Optimal Stopping for LLM EvaluationsToby D. Pilditch(UK AI Security Institute)・arXivプレプリント · 2026年8月14日(v1) — optstopの階層ベイズ型停止基準、9条件のshadow-mode検証、統計上の同等性と前提条件。
  12. How Inference Compute Shapes Frontier LLM EvaluationJessica McFadyen et al.(UK AI Security Institute;arXivプレプリント) · 2026年7月16日(v3更新、初版は6月16日) — 7ベンチマークでの推論計算量、トークン予算、反復提出、serial/parallel配分の比較と、結果が課題・評価プロトコルに依存する範囲。
  13. More compute, more capability: Why AI agent evaluations need to account for test-time computeUK AI Security Institute(AISI) · 2026年7月2日 — 狭いサイバーCTF課題での成功率とトークン上限の関係、80% time horizonの予算依存性、他分野では追加計算の効果が異なる点。