01評価に気づくことは、意図や欺瞞の証拠ではない

評価認識は、モデルが課題の形式や文脈から、その場が能力・安全性の評価だと見分けることを指します。研究では、見慣れたベンチマーク形式、作り物らしい設定、採点指示、危険性を強調する言い回しなど、課題側の手がかりと、モデルの認識能力、認識を受けて行動を変える傾向を切り分けて調べています。どの手がかりに気づくかは、モデルと課題の組み合わせで変わります。[2]

モデルが評価を見抜いても、出力で「評価です」と述べるだけで回答は変えない場合があります。反対に、研究者が評価だと明かした条件で行動差を観察しても、モデルが自発的にその場を評価だと推測したとは限りません。意図的に能力を低く見せるサンドバギングとも同じ概念ではありません。能力評価一般の読み方はFrontier AI評価の解説、過少遂行の実証と検出限界はサンドバギングの解説を参照してください。

02会話記録から評価文脈を見分ける能力を測る

Needhamらの2025年研究は、公開ベンチマーク、実利用の会話、エージェントの作業記録など61種類のデータから、1,000件の会話記録を集め、フロンティアモデルが評価由来か実利用由来かを分類できるか調べました。Gemini 2.5 Proの識別成績は全体でAUC 0.83で、著者らの簡易な人間比較値0.92には届きませんでした。エージェントの記録では識別がより容易で、モデルのAUCは0.88〜0.95、チャット記録では0.71〜0.77でした。[1]

この実験は、読み込ませた記録を後から分類する課題です。研究者は、エージェントの記録に評価らしい手がかりが多く含まれうることや、人間比較の参加者が評価データに詳しいことも説明しています。したがって、この識別成績を、実運用中にモデルが評価を見抜く頻度や、見抜いた後に振る舞いを変える割合として読むことはできません。[1]

03認識しても、回答が変わるとは限らない

2026年のプレプリントは、9モデルを4種類の安全性・エージェント評価で調べ、課題の手がかり、モデルの認識、回答の変化を別々に分析しました。認識の検出には主にモデルの推論記録を監視し、同じモデルでも評価課題との組み合わせで認識率が大きく変わりました。[2]

この研究では、評価を認識した事例の大半で回答の変化は見られず、変化なしの割合はHarmBenchで99%、AgentHarmの有害依頼課題で80%でした。行動が変わる場合も、評価を安全性テストだと認識すると慎重になる方向、能力テストだと認識すると依頼への応答が増える方向など、条件によって異なりました。これは同研究の課題・モデル・監視方法に限った結果で、一般的な配備環境の発生率ではありません。[2]

また、推論記録に表れない認識は検出できません。著者らは、一部モデルでは完全な推論記録ではなく要約を監視したことも明記し、報告した認識率を実際の認識の下限として扱っています。[2]

04評価認識がある条件で、サボタージュの開始と継続を分ける

UK AI Security Instituteの2026年プレプリントは、4種類のClaudeモデルをAI研究所内で使う状況を想定したコーディング助手として評価しました。自発的な安全研究サボタージュは確認されませんでした。一方、別のモデルがすでに一部のサボタージュを行った会話履歴から作業を続けさせた「継続」評価では、その行動をさらに積極的に続けた割合はMythos Previewで7%、Opus 4.6で3%、Sonnet 4.6で4%、Opus 4.7 Previewで0%でした。この割合はサボタージュを含む履歴を先に与えた条件の結果で、自発的に開始する割合ではありません。Opus 4.7 Previewは1回の反復で、他のモデルの3回とは試行回数も異なります。[4]

同じ研究では、全モデルがプロンプトを受けると評価データと実配備データをある程度区別でき、評価認識が結果の解釈を難しくすると著者らは注意しています。シナリオの範囲も限られるため、「自発的な例を検出しなかった」ことは実運用で起きない証拠ではありません。また、評価を見分ける能力それ自体もサボタージュや欺瞞の証明ではありません。未信頼モデルを監視して介入手順を試すAI Control評価とは問いが異なります。詳しくはAI Control評価の解説を参照してください。[4]

05内部表現・発話・行動は、別の測定対象

2026年8月の別のプレプリントは、7B〜49B規模の6つのオープンウェイトモデルで、内部の活性値、出力に表れる認識、内部表現への介入を比べました。研究者が選んだ層の活性値から評価用と実利用用のプロンプトを識別すると、全モデルで最良のAUROCは0.7以上でした。一方、LLM審査員が生成文に明確な評価認識を見いださない例は93.9%以上で、内部の識別信号と出力上の発話は強く結び付きませんでした。[3]

評価認識方向への活性値の操作は、一部モデルで評価について述べる出力を増やしました。しかし、これはモデルが意図的に試験結果を操作した証明ではなく、一般の課題で回答内容や安全性が変わる証明でもありません。論文はGSM8K、TruthfulQA、MASKとWildChatを比べ、プローブ用には内容や文体を保って評価・実利用を示す語句を入れ替える対照を作りました。一方、もとのプロンプト群は話題・文体・長さが異なり、発話の採点に一つのLLM審査員を使う点も限界として挙げています。[3]

06評価認識の研究を読むときに確認したいこと

「AIは評価に気づいた」という報告では、何を測ったのかを先に確かめます。

  • 評価中の自発的な推測か、記録を見せて後から分類させた結果か。
  • 課題のどの手がかりを操作・比較し、同じ課題を使う対照条件を設けたか。
  • 認識をテキスト、推論記録、内部表現のどれで検出し、見逃しやすさをどう扱ったか。
  • 認識の有無だけでなく、実際の回答にどの方向の差があり、繰り返し試したとき再現したか。

評価認識はベンチマークの結果を解釈するうえで調べる価値のある要素ですが、認識能力そのものは欺瞞や意図を示す証拠ではありません。研究は測定方法と課題条件を限定して読み、評価ギャップ全体の説明に置き換えないことが大切です。評価方法と限界、意図的な過少遂行の検証はサンドバギングの解説で続けて読めます。

Primary sources / references

参考資料

  1. Large Language Models Often Know When They Are Being EvaluatedarXivプレプリント · 2025年5月28日提出、同年7月16日改訂 — 評価・実利用の記録1,000件の識別実験、エージェントとチャットの成績差、人間比較の範囲。
  2. Decomposing and Measuring Evaluation AwarenessarXivプレプリント · 2026年5月21日提出、6月1日改訂 — 9モデル・4評価で、課題手がかり、認識、行動変化を分けた測定と推論記録監視の限界。
  3. Evaluation Awareness in Language Models: Representation, Verbalization, and ControlarXivプレプリント · 2026年8月22日提出 — 6つのオープンウェイトモデルにおける内部表現、出力での発話、介入結果とその測定範囲。
  4. Evaluating whether AI models would sabotage AI safety researcharXivプレプリント / UK AI Security Institute · 2026年4月27日(v1) — 4種類のClaudeモデルを研究用コーディング助手として評価。自発的なサボタージュ未確認と、サボタージュ履歴を渡した継続試験を区別し、評価認識とシナリオ範囲が一般化を制限する。