特定されたキャンペーン
OpenAIは、自社AIモデルの内部推論を抽出しようとする協調的な作戦を解体したと明らかにした。活動の中心は、中国のスタートアップMoonshot AI(チャットボットKimiの運営元)に起因するとされた。
この行動は7月に始まり、わずか2日間で4 mil以上のアカウントから16 milのリクエストというピークに達した。同社は7月28日に攻撃を完全に終了するまでに、15 milを超える関与ユーザーを追跡した。
使用された手法
サーバーや暗号化を攻撃する代わりに、運営者はモデルとの会話を操作し、通常は隠された推論ステップを露出させた。このプロセスは「adversarial distillation」と呼ばれ、競合システムをより低いコストと時間で訓練することを可能にする。
緊張の文脈
この出来事は、AnthropicがMoonshotを含む中国の開発者を自社モデルClaudeを使って独自AI訓練を加速させたとして非難した数週間後に発生した。この事例は、先進技術の無許可移転に対する米国の懸念を強める。
指摘されたリスク
OpenAIは、推論の抽出がフロンティアモデルの安全性を損ない、国家安全保障に影響を及ぼす可能性があると警告した。同社は調査結果をFrontier Model Forumおよび政府情報機関と共有した。
Moonshotはこれらの主張について公式にコメントしていない。