セキュリティ研究者らが、OpenAI・Anthropic・Googleの推論(思考)モデルAPIに共通する弱点を報告しました。各社は推論過程の中身を外部に見せない目的で暗号化した『思考ブロック』をAPI応答に含めていますが、あるセッションで生成された思考ブロックを別のセッションに差し込み、同じ提供元の性能が低いモデルに『そのまま書き起こして』と指示すると、性能の低いモデルは強力な安全対策を持たないため指示に従ってしまい、本来隠されているはずの思考内容を平文で出力してしまうことが分かったとしています。
研究チームは論文『Stealing Reasoning Traces from Proprietary LLM APIs』で、公開されている6,708件のエージェント実行ログから31万件超の思考ブロックを実際に解読したと報告。用途としては、上位モデルの推論を蒸留に悪用する、他ユーザーが公開したログから個人情報を抜き出す、表向き安全な回答の裏に隠された有害な内容を復元する、プロンプトインジェクションを不透明な思考ブロックの中に隠す、の4パターンを示しました。
各社の対応は温度差があります。OpenAIは開発者に対し、状態を持たないやり取りで履歴を手動管理する際は暗号化された推論アイテムをそのまま再送するよう案内を続けている一方、Googleはセッション内でモデルを切り替えた際の互換性をバックエンド側で処理していると説明。Anthropicは、思考ブロックは生成したモデルに紐づくものであり、モデルを切り替える際は削除すべきだとの立場を新たに示しています。3社とも本件についての公式な脆弱性表明は今のところ出していません。
出典: The Hacker News



