Kampanye yang Diidentifikasi
OpenAI mengungkapkan telah membongkar operasi terkoordinasi yang bertujuan mengekstrak penalaran internal model kecerdasan buatannya. Bagian utama aktivitas ini dikaitkan dengan startup Tiongkok Moonshot AI, pengembang chatbot Kimi.
Aksi dimulai pada Juli dan mencapai puncak 16 mil permintaan dari lebih dari 4 mil akun hanya dalam dua hari. Secara total, perusahaan melacak lebih dari 15 mil pengguna yang terlibat sebelum menghentikan serangan sepenuhnya pada 28 Juli.
Metode yang Digunakan
Alih-alih menyerang server atau enkripsi, para pelaku memanipulasi percakapan dengan model untuk memaksa pengungkapan langkah-langkah penalaran yang biasanya tersembunyi. Proses ini, disebut “adversarial distillation”, memungkinkan pelatihan sistem pesaing dengan biaya dan waktu lebih rendah.
Konteks Ketegangan
Insiden ini terjadi beberapa minggu setelah Anthropic menuduh pengembang Tiongkok, termasuk Moonshot, menggunakan model Claude mereka untuk mempercepat pelatihan AI sendiri. Kasus ini memperkuat kekhawatiran Amerika tentang transfer teknologi canggih tanpa izin.
Risiko yang Diingatkan
OpenAI memperingatkan bahwa ekstraksi penalaran dapat membahayakan keamanan model frontier dan menimbulkan implikasi bagi keamanan nasional. Perusahaan membagikan temuan ini kepada Frontier Model Forum dan saluran intelijen pemerintah.
Moonshot belum memberikan tanggapan resmi atas tuduhan tersebut.