Anthropicは9月10日、Claudeの悪用や規約違反を検知・遮断した事例をまとめた脅威インテリジェンスレポートを公表した。対象期間は2025年12月から2026年8月までで、サイバー攻撃、世論工作、監視、詐欺・金融犯罪、生物兵器関連、通常兵器開発、そして他社モデルの学習に無断で利用する「蒸留」の7領域にわたる摘発事例が報告されている。
個別の事例としては、ロシアの国家系スパイ活動グループ(Anthropicの分類でGTG-20006、通称Midnight Blizzard)が130日間にわたり、ウクライナの省庁や国防関連機関、ドローン供給網の製造業者など27の標的機関のうち24機関に侵入を試みたケースが紹介されている。またイラン系のグループがスパイウェアやデータ収集ツールを併用しつつ、約15万5000件のツイートを分析して米海軍艦隊の位置情報に関する公開情報インテリジェンス(OSINT)を作成していた事例、イエメンを拠点とするグループが携帯端末クラスのコンピューターに飛行制御ソフトウェアを組み込み、誘導ロケットの発射後解析にClaudeを利用していた事例も報告された。
「蒸留」に関しては、他社が自社モデルを訓練する目的でClaudeとの対話を大量に収集し、確認されただけで約1億5100万件のやり取りが検出されたという。Anthropicはこれらの活動をいずれも検知した時点で遮断し、得られた知見を安全対策の強化に反映するとともに、必要に応じて捜査当局や業界他社とも情報を共有したとしている。
AI企業が自社モデルの悪用実態をここまで具体的な件数・期間とともに公表するのは珍しく、フロンティアAIが国家の情報活動から兵器開発の周辺作業まで幅広く「道具」として使われ始めている実態を裏付ける資料として注目されている。
出典: Anthropic



