Выявленная кампания
OpenAI сообщила, что ликвидировала скоординированную операцию, направленную на извлечение внутреннего рассуждения своих моделей искусственного интеллекта. Центральная часть деятельности была приписана китайскому стартапу Moonshot AI, ответственному за чат-бот Kimi.
Действие началось в июле и достигло пика в 16 тысяч запросов с более чем 4 тысяч аккаунтов всего за два дня. В общей сложности компания отслежила более 15 тысяч вовлечённых пользователей, прежде чем полностью прекратить наступление 28 июля.
Использованный метод
Вместо взлома серверов или шифрования операторы манипулировали разговорами с моделями, чтобы заставить раскрыть этапы рассуждения, которые обычно остаются скрытыми. Этот процесс, называемый «adversarial distillation», позволяет обучать конкурирующие системы с меньшими затратами и временем.
Контекст напряжённости
Эпизод произошёл спустя несколько недель после того, как Anthropic обвинила китайских разработчиков, включая Moonshot, в использовании своей модели Claude для ускорения обучения собственной ИИ. Случай усиливает американские опасения по поводу несанкционированной передачи передовых технологий.
Указанные риски
OpenAI предупредила, что извлечение рассуждения может поставить под угрозу безопасность frontier-моделей и иметь последствия для национальной безопасности. Компания поделилась выводами с Frontier Model Forum и правительственными разведывательными каналами.
Moonshot пока не сделала официального заявления по поводу обвинений.