Anthropicは2026年8月28日、「Automated Researchers Can Reliably Mitigate Alignment Failures」と題する研究結果を公式に発表した。AIシステム自身に、文献調査・手法や学習データの立案・対象モデルの訓練・公開安全性ベンチマークでの採点という、アライメント(AIの安全性)研究の一連の工程を自律的に実行させる「自動アライメント研究者(AAR)」の実験内容をまとめたものだ。
特定の誤動作パターンを狙った10種類のベンチマークで検証したところ、AARはすべての項目で性能を改善し、しかもモデル全体の能力を損なうことはなかったという。特に「欺瞞(deception)」に関するベンチマークでは、AARが安全性のギャップを85%解消したのに対し、経験豊富な研究者28名に最大8時間を与えた人間側の対照群は20%の解消にとどまった。かかった時間とコストの面でも差は大きく、AARは数時間・API利用料にして1時間あたり約4ドルで完了させたのに対し、人間の研究者側は1時間あたり約150ドル相当のコストがかかったとしている。
さらに、AARが編み出した手法は、訓練時に使っていない未知のベンチマークや複数ターンにわたる行動監査、対象モデルの最大4.7倍の規模のモデルにも効果が及ぶ「汎化」を示したという。特定のベンチマークに過剰適合しているわけではなく、より広い範囲で通用する改善策を導けている点をAnthropicは強調している。
TechCrunchも同日、Anthropicの研究者への取材を基にこの成果を「自己改善型AIの一端を垣間見せるもの」として報じた。AIの能力が急速に高まる中、その安全性を検証・改善する作業自体もAIに担わせられる可能性を示す一方、そうした自己改善プロセスをどう人間が監督し続けるかという新たな論点も浮かび上がっている。



