OpenAIは、自社モデルの隠れた推論過程を組織的に抽出しようとする攻撃を検知し、7月28日までに完全に遮断したと発表した。攻撃の中心にはMoonshot AI(Kimiの開発元)に関連する人物がいたとされるが、研究者による再検証では、Microsoft Azure上で同じ手口が依然として機能することが確認された。

「敵対的蒸留」という手法

OpenAIはこの攻撃を「adversarial distillation(敵対的蒸留)」と呼んでいる。あるモデルの出力や推論過程を無断で利用し、競合モデルの訓練や性能向上に流用する行為を指す。

攻撃者は、暗号化された推論データを別のセッションへコピーし、そのセッション内のモデルに復号・書き起こしを行わせることで、本来秘匿されているはずの推論内容を可読な形で取得していた。OpenAIの暗号化機構自体やデータベースへの侵入、保存済みユーザー会話への不正アクセスはなかったとしている。

7月下旬に活動が急増

活動は7月1日ごろから低調に始まり、7月24日から25日にかけて急増した。この2日間で4000人以上のユーザーが1万6000件のリクエストを送信し、関連する行動パターンは1万5000以上のアカウントにまで広がっていたという。OpenAIは7月28日までにこの活動を全面的に停止させた。

OpenAIは、攻撃活動の中心的なクラスターをMoonshot AI関係者に結びつけており、アカウントの停止、登録・基盤インフラの管理強化、暗号化推論のリプレイ脆弱性の修正といった対応を実施した。あわせてFrontier Model Forumや政府機関とも知見を共有し、業界全体での対策につなげる方針を示している。

Azure上では同じ手口が通用

THE DECODERによると、研究者が9月13日に同じ攻撃手法を再テストしたところ、Azure上でホストされているOpenAIモデルに対してはなお攻撃が成功した。Microsoftは9月27日から28日にかけてAzureのエンドポイントに保護機能を追加したという。

この経緯は、OpenAI自身のプラットフォームでの対策が、Azureのような提携先のクラウド環境には自動的に及ばないことを示している。研究者はクラウドプロバイダー間で同等レベルの防御を揃える必要があると指摘しており、現時点ではクラウド経由の利用者に同種のリスクが残っている可能性がある。

モデルの推論過程を保護する機能は、安全性対策への投資を回収しつつ競合との差別化を保つための重要な要素になっている。企業間・クラウド間で防御水準に差が生じれば、同じ脆弱性が形を変えて再利用されるリスクが今後も続くとみられる。