Categories: News

OpenAI·Anthropic·Google API 결함, 강한 모델 추론 노출

OpenAI·Anthropic·Google, API 숨은 추론 결함으로 강한 모델 추론 노출

  • OpenAI·Anthropic·Google의 추론 API는 암호화된 사고 블록을 세션 간 재사용하도록 설계됐고, 연구진은 이를 다른 세션과 계정에 다시 넣어 강한 모델의 내부 추론과 비밀을 읽어내는 경로를 확인했다.
  • 연구팀은 Stealing Reasoning Traces from Proprietary LLM APIs에서 Claude Haiku 4.5, GPT-5.6 Luna, Gemini Robotics ER-1.6을 ‘퍼지 디코더’로 활용해 상위 모델의 사고 내용을 전사하게 만들었고, 약한 모델이 상호운용 경로가 될 수 있음을 보였다.
  • 이 결함은 공개된 에이전트 로그의 암호화 추론 조각을 재생해 비공개 추론을 복원하고, 가시 텍스트에는 없는 API 키·비밀번호·비밀키를 숨은 블록에서 꺼내며, 악성 지시를 은닉한 프롬프트 주입까지 가능하게 했다.
  • 연구진은 공개 에이전트 궤적 6,708개에서 315,320개 사고 블록을 해독했고, 벤치마크를 뺀 실제 세션에서 704개 프라이버시 산출물을 찾았으며 그중 62개 API 키, 33개 비밀번호, 24개 접근 토큰, 7개 개인키가 포함됐다.
  • 이 사건은 암호화 자체가 깨진 것이 아니라 세션·사용자·모델 사이에서 온전한 추론 블록이 받아들여지는 설계가 문제였다는 점을 드러내며, 세션 로그와 원시 API 전사본을 공유하는 개발 관행이 곧바로 보안 노출로 이어진다.
  • 한국 정책 관점에서는 AI 에이전트 로그와 추론 필드를 기본 비공개로 두고, 공유 전사본에서 숨은 추론 블록을 제거하도록 조달·가이드라인을 바꾸며, 공공 AI 도입 시 모델 전환 시 재생 허용 범위를 명확히 해 산업 보호와 국가 비밀 유출 차단을 함께 설계해야 한다.

공개 로그에 추론 블록이 남는지 즉시 점검하고, 공공 AI 도입 지침에 재생·보관 금지와 비공개 필드 제거를 의무화해야 한다. 대외 공유 전사본은 원시값 대신 요약본만 남기는 체계를 서둘러 마련할 필요가 있다.

주요 용어: 암호화된 추론 블록(모델 내부 사고를 숨긴 상태로 전달하는 데이터), 프롬프트 주입(숨은 지시로 모델 행동을 바꾸는 기법)

출처: The Hacker News

ajken

Recent Posts

해커들, Roundcube 치명적 결함을 코드 주입 공격에 악용

Roundcube 취약점이 인증 우회형 SQL 인젝션 공격에 악용되며 웹메일 서버 보안 조치가 요구된다Roundcube 보안팀은 2026년…

5시간 ago

CTM360, 1만7000개 URL로 ClickFix 악성 유인 구조 분석

신뢰받는 웹사이트가 사용자 조작형 악성코드 유인처로 전환되는 구조CTM360은 ClickFix가 취약점·첨부파일 없이 가짜 Cloudflare 확인창으로 사용자를…

5시간 ago

공격자들, 공개 수시간 만에 워드프레스 CVE-2026-87902 악용

공개 직후 악용된 워드프레스 치명적 취약점, 패치 적용 필요공격자는 2026년 9월 22일 공개된 CVE-2026-87902를 수시간…

5시간 ago

BeyondTrust, CrowdStrike Falcon과 신규 통합 발표

권한·위협 데이터를 결합해 탐지와 대응을 단일 흐름으로 통합BeyondTrust는 2026년 9월 24일 Pathfinder Platform과 CrowdStrike Falcon…

5시간 ago

TeamFiltration, 기본 비밀번호로 Microsoft 365 계정 7개 침해

잊힌 서비스 계정이 Microsoft 365 클라우드 침입 경로로 확인되다Proofpoint는 UNK_CondorFiltration이 칠레 금융·유통기관의 Microsoft 365 28개…

5시간 ago

LatticeFlow AI, AI 거버넌스 관리형 서비스 공개

LatticeFlow AI, 지속적 위험 통제를 위한 AI 거버넌스 관리형 서비스 공개LatticeFlow AI는 2026년 9월 24일…

5시간 ago