AnthropicとAccentureは2026年9月18日、「埋め込み評価」で提携した。AIモデルの開発現場へ独立評価者を置く試みだ。評価者は社員に近いアクセスを持ち、訓練の過程や社内の判断まで追う。新しいのは、評価を公開前の試験から開発中の監視へ前倒しする点だ。ただし、費用はAnthropicが払い、何を公表できるかという共通基準はまだない。
用語メモ
- Anthropic:対話AI「Claude」を開発する米国企業。評価を受ける側である。
- Accenture:企業や政府の業務を支援する会社。傘下のAI専門組織Facultyが評価を担う。
- 埋め込み評価:評価者がAI企業の内部へ入り、開発中から安全性や判断過程を確かめる方法。
- レッドチーム:意図的に厳しい使い方を試し、弱点や想定外の動きを探す検査。
埋め込み評価は、完成したAIではなく開発の過程を見る
従来の外部評価では、完成に近いモデルへ課題を与え、能力や危険な振る舞いを調べることが多い。埋め込み評価では、評価者がAI企業の内側で働く。Anthropicは、社員と同程度のアクセスを想定する。訓練中のモデル、開発と公開を決める議論、社員への聞き取りまで対象になり得る。
今回のチームは、モデルの評価、レッドチーム、望ましい振る舞いとのずれの確認、安全策の試験を担う。両社は今後5年間、この分野の能力づくりへ少なくとも10億ドルずつ投じる見込みだ。ただし、人数、開始時期、個々のモデルを止める権限は公表していない。
違いは、失敗を見つける時点にある。公開直前に結果だけを測ると、訓練方法や評価項目を選んだ理由までは追いにくい。開発中から見れば、どの警告が採用され、何が退けられたかを確かめられる。AI企業に編集者が必要な理由で扱った「判断の来歴」を、外部の専門家が検証する試みとも言える。
社員並みのアクセスだけでは、評価者の独立は決まらない
内部へ近づくほど情報は増える。一方で、評価する会社との関係も深くなる。今回はAnthropicがAccentureの費用を直接負担する。契約期間、報告書を公開する時期、不都合な結果を単独で公表できるかは、発表資料から確認できない。
Anthropic自身も限界を認めている。アクセス範囲や報告方法の共通基準はなく、独立性を保つ資金の仕組みも未整備だ。同社が2026年6月に示した制度案では、政府や共同基金による資金、利害関係の開示、評価者の資格化を挙げた。評価の甘い相手を選ぶ「評価者選び」を防ぐため、無作為の割り当ても案に含む。
今回の提携は非独占である。Anthropicは別の評価者も加え、Accentureも他のAI企業を評価できる。複数の目を入れる設計は、一社の基準へ依存する危険を減らせる。しかし、報告が公開されなければ、利用者は検証できない。Thomson Reutersの自社AIでも、社内試験と外部評価は分けて考える必要があった。評価者の肩書より、見た範囲と公表できる範囲が重要である。
AIガバナンス視点を育む3つの学び
1. 評価を完成後の採点にしない
埋め込み評価が変えるのは、試験の難しさより時期である。開発中なら、問題が出た後の説明だけでなく、判断を変える過程を見られる。自社でAIを導入するときも、公開前の合否だけでなく、用途、データ、評価項目を決める会議へ確認役を入れたい。
2. 独立性は、距離ではなく三つの権限で確かめる
社外の評価者でも、費用、アクセス、公開を依頼主がすべて握れば検証は弱くなる。誰が払うか。何を見られるか。否定的な結果を誰の許可で公表できるか。この三つを契約前に分けると、「第三者確認済み」という言葉の中身を判断しやすい。
3. 外部評価へ責任を移さない
Anthropicは、評価者を入れてもモデルの安全責任は自社に残ると明記した。これは他社にも転用できる原則だ。評価報告を免責の印にせず、指摘を誰が直し、再評価し、利用者へ説明するかまで決める。外の目は責任の代わりではなく、責任を確かめられる状態にするために使う。
Sources / 参考資料
Accenture:Accenture:Accenture and Anthropic Partner to Build Team of Embedded Evaluators at Anthropic
Anthropic:Anthropic:Advanced AI Framework(2026年6月)
Anthropic:Anthropic:An alignment assessment of recent cybersecurity incidents
METR:METR:Frontier Risk Report(2026年2〜3月)
