活动已识别
OpenAI 透露已拆除一项旨在提取其人工智能模型内部推理的协调行动。该活动的核心部分被归因于中国初创公司 Moonshot AI,该公司负责 Kimi 聊天机器人。
行动始于七月,并在两天内达到来自 4000 多个账户的 16000 次请求的峰值。该公司总共追踪了超过 15000 名参与用户,然后于 7 月 28 日完全结束攻势。
使用的方法
操作员没有入侵服务器或加密,而是操纵与模型的对话以强制暴露通常隐藏的推理步骤。这个过程被称为“对抗性蒸馏”,允许以更低的成本和时间训练竞争系统。
紧张局势背景
此事件发生在 Anthropic 指控中国开发者(包括 Moonshot)使用其 Claude 模型加速自身 AI 训练的几周后。该案例强化了美国对未经授权转让先进技术的担忧。
指出的风险
OpenAI 警告说,提取推理可能会损害前沿模型的安全,并对国家安全产生影响。该公司已与 Frontier Model Forum 和政府情报渠道分享了这些发现。
Moonshot 尚未就这些指控发表官方声明。