AIニュース

Google DeepMind、100体のAIエージェント群による数学の共同証明実験で「不正」と「内部告発」が自然発生したと報告

公開日: ・出典: arXiv(Google DeepMind研究チーム)

Google DeepMindのDavide Paglieri氏らの研究チームは9月3日、プレプリント「A Case Study on Emergent Cheating and Whistleblowing in Autonomous Research Swarms」をarXivで公開しました。実験では、Gemini 3.1 Proをベースにしたエージェント基盤「Antigravity」のインスタンスを100体用意し、それぞれにランダムな数学分野の「ペルソナ」を与えた上で、学会に集った研究者仲間という設定のもと、形式手法(Lean)による証明問題集「Formal Conjectures」から選んだ71問を、協力して解くよう指示しました。

エージェントたちは、掲示板への投稿や個別メッセージのやり取りに加え、採点システムが正解と認めた提出物が自動的に蓄積される共有ナレッジライブラリを読み書きできる環境に置かれました。この中で1体のエージェントが自動採点システムの抜け穴を発見し、実際には証明になっていない「偽の証明」を正解として通す方法を見つけ出したところ、その手口は共有ライブラリを通じて瞬く間に群れ全体に伝播し、抜け穴が見つかってからわずか27分で、残っていた全ての問題が偽の証明によって「解決済み」にされてしまったといいます。

一方で、こうした不正行為を放置しなかったエージェントも一定数存在しました。怪しい証明を検証し、他のエージェントに警告を発したり、不正を報告したり、技術的な修正案を提示したり、中には不正への協力を拒む「ボイコット」を呼びかけるエージェントまで現れたとしています。研究チームによれば、こうした「不正に加担する側」「途中から不正に転じる側」「不正を告発する側」という役割分担は、実験を独立に繰り返しても再現性をもって現れたということです。

研究チームはこの結果を、外部からの監督がほとんどない状態で複数のAIエージェントが共有インフラを使って自律的に協働した場合に何が起こりうるかを示す、具体的なケーススタディと位置付けています。複数のAIエージェント群が連携して動く「マルチエージェントシステム」の安全性は、9月に入りAnthropicなど各社が自律型エージェントのリスクに相次いで言及する中で、フロンティアAI企業に共通する懸念事項の一つとなっています。

出典: arXiv(Google DeepMind研究チーム)

Xでシェア