MATS Research、マックス・プランク研究所、ELLIS Institute Tübingenの研究者らが、論文「Stealing Reasoning Traces from Proprietary LLM APIs」をarXivに公開しました。OpenAI・Anthropic・Googleの各社は、モデルの内部的な思考過程(chain-of-thought)を競合他社への漏洩防止やユーザーへの非開示を目的に暗号化した状態でAPI経由でやり取りする仕組みを採用していますが、この論文は3社共通のアーキテクチャ上の弱点を指摘しています。
論文が指摘する弱点は、各社がセッションをまたいで、さらには能力の異なるモデル間でも共通の単一の暗号鍵を使い回している点です。あるセッションで作られた暗号化済みの推論ブロックを別のセッションに渡せてしまうだけでなく、研究チームの検証では、同一プロバイダー内のより性能の低いモデルにその暗号化ブロックを渡すことで、非公開のはずの内容を平文で出力させることに成功したといいます。つまり、性能の低いモデルを「復号機」として使うことで、より高性能なモデル自体を直接攻撃することなく、その非公開の思考内容を読み取れてしまうことになります。
研究チームは、様々な経路で収集した公開エージェント実行ログ6,708件を対象にこの手法を適用し、31万5320件の非公開思考ブロックを実際に復号できたと報告しています。悪用の可能性として、モデル蒸留のための推論内容の窃取、他ユーザーが公開したログに含まれる個人情報の抽出、表向きは安全に見える回答の裏に隠された有害コンテンツの復元、そして不透明な推論ブロック内へのプロンプトインジェクションの隠蔽という4つの攻撃経路を実証したとしています。
The Hacker Newsなど複数の専門メディアが報じた時点で、OpenAI・Anthropic・Googleのいずれからも、この研究結果を名指しで認めた公式な発表は確認されていません。研究チームは追試により該当の攻撃経路が塞がれたとする一方、これは研究者側の再現テストに基づく主張であり、各社による公式な修正確認ではない点には留意が必要です。
出典: The Hacker News



