Preveja.com · Рынки прогнозов в реальном времени

CNBC · G. Rok ·

OpenAI раскрывает китайскую кампанию по извлечению рассуждений из моделей ИИ

Компания обвиняет Moonshot AI в руководстве скоординированными усилиями по воспроизведению передовых возможностей через манипулируемые взаимодействия, вызывая тревогу по безопасности.

OpenAI раскрывает китайскую кампанию по извлечению рассуждений из моделей ИИ

Выявленная кампания

OpenAI сообщила, что ликвидировала скоординированную операцию, направленную на извлечение внутреннего рассуждения своих моделей искусственного интеллекта. Центральная часть деятельности была приписана китайскому стартапу Moonshot AI, ответственному за чат-бот Kimi.

Действие началось в июле и достигло пика в 16 тысяч запросов с более чем 4 тысяч аккаунтов всего за два дня. В общей сложности компания отслежила более 15 тысяч вовлечённых пользователей, прежде чем полностью прекратить наступление 28 июля.

Использованный метод

Вместо взлома серверов или шифрования операторы манипулировали разговорами с моделями, чтобы заставить раскрыть этапы рассуждения, которые обычно остаются скрытыми. Этот процесс, называемый «adversarial distillation», позволяет обучать конкурирующие системы с меньшими затратами и временем.

Контекст напряжённости

Эпизод произошёл спустя несколько недель после того, как Anthropic обвинила китайских разработчиков, включая Moonshot, в использовании своей модели Claude для ускорения обучения собственной ИИ. Случай усиливает американские опасения по поводу несанкционированной передачи передовых технологий.

Указанные риски

OpenAI предупредила, что извлечение рассуждения может поставить под угрозу безопасность frontier-моделей и иметь последствия для национальной безопасности. Компания поделилась выводами с Frontier Model Forum и правительственными разведывательными каналами.

Moonshot пока не сделала официального заявления по поводу обвинений.

← Блог