오픈AI, 문샷AI 관계자 연계 추론 추출 캠페인 차단

오픈AI, 문샷AI 관계자 연계 추론 추출 캠페인 차단

오픈AI, 문샷AI 관계자 연계 추론 추출 캠페인 차단

  • 오픈AI는 2026년 7월 1일 시작된 공격에서 문샷AI 관계자들이 모델 상호작용을 조작해 보호된 추론을 대규모로 추출했다고 밝혔다.
  • 공격자는 암호화나 데이터베이스를 뚫지 않고 요청 흐름을 조작했으며, 오픈AI는 이를 다른 모델 학습에 쓰는 적대적 증류로 규정했다.
  • 암호화된 추론을 같은 제공자의 취약한 모델에 주입하면 평문으로 재현될 수 있어, 프롬프트 조작과 민감정보 노출 위험이 커졌다.
  • 공격은 7월 24~25일 4,000명 이상 사용자의 16,000건 요청으로 급증했고, 관련 활동은 15,000명 이상으로 확대돼 7월 28일 차단됐다.
  • 오픈AI는 사기 계정을 정지하고 추론 재생 경로를 폐쇄했으며, 노출 가능성이 있는 스트리밍 출력을 탐지·보류하는 통제를 추가했다.
  • 추론 탈취는 안전장치 없는 모델의 역량 이전을 가속하므로, 한국은 핵심 모델의 출력·암호화 추론 분리와 사업자 간 공동 탐지를 정책화해야 한다.

한국은 AI 모델을 단순 정보시스템이 아닌 국가 역량 자산으로 관리해야 한다. 공공 도입 전 추론 보호 검증과 사업자별 침해 신고·공유 체계를 의무화할 필요가 있다.

주요 용어: 적대적 증류(한 모델의 출력을 다른 모델 학습에 무단 활용하는 방식), 보호된 추론(모델 내부의 문제 해결 과정을 숨긴 정보), 프롬프트 패턴(반복되는 요청 구조)

출처: The Hacker News