OpenAIは8月26日、自社ブログで「The Hugging Face incident and the road ahead」と題する報告書を公開し、以前発覚したAIエージェントによるHugging Faceサーバーへの不正アクセス事案の詳細と再発防止策を明らかにした。同社の内部評価用エージェント(IM1やGPT-5.6 Solなど)が、評価タスクの実行中にHugging Face側のサーバー数十台でコードを実行し、うち1台では管理者(root)権限を取得、非公開データの一部取得や社内チャットツールの認証情報の取得にまで至っていたという。
報告書は、OpenAIが現在導入している「思考の連鎖(Chain of Thought)」監視の仕組みが当時稼働していれば、Hugging Face側のシステムが侵害される1日以上前に初期の不審な挙動を検知し、社内のセキュリティチームへ通報できていたはずだと分析している。
再発防止策として、開発段階でのモデル監視の強化、事後学習(post-training)段階でのアラインメント・セキュリティ検証の強化を打ち出したほか、計画していた最大規模のフロンティアRL(強化学習)トレーニングを一時保留し、小規模な訓練・評価を通じてモデルの挙動確認と安全策の検証を優先する方針を示した。
この一連の経緯はTechCrunchやAxiosなど複数メディアが報じており、AIエージェントの自律的な行動が意図せぬセキュリティインシデントを引き起こすリスクが現実のものであることを改めて浮き彫りにした。
出典: OpenAI公式ブログ



