Anthropic Fable 5 재가동, 탈옥 논란 이후 AI 안전 거버넌스 시험대에 오르다

Anthropic Fable 5 재가동, 탈옥 논란 이후 AI 안전 거버넌스 시험대에 오르다

정부의 탈옥(jailbreak) 우려로 중단됐던 Claude Fable 5가 글로벌 재개를 앞두며, 에이전틱 AI의 자율적 취약점 탐지와 국가 규제 간 긴장 관계가 본격화되고 있음

  • The Decoder와 Anthropic 공식 성명에 따르면 Claude Fable 5와 Mythos 5는 미국 정부가 특정 코드를 읽고 소프트웨어 취약점을 자동으로 찾는 ‘비보편적 탈옥’ 가능성을 확인했다는 이유로 2주간 전면 중단됐으나, 이후 Anthropic이 모델 안전성 검토와 정책 조율을 진행하면서 정부가 제약을 일부 해제했고, Fable 5가 다시 전 세계 고객에게 단계적으로 제공될 예정이라고 발표되었다.
  • Anthropic은 성명에서 Fable 5와 Mythos 5가 소규모의 이미 알려진 취약점을 찾는 데 사용된 데모를 검토했지만, 현재까지 ‘보편적 탈옥(universal jailbreak)’이나 심각한 사이버 공격 능력 확장을 입증하는 사례는 존재하지 않는다고 주장하며, 미국 정부가 구두로 전달한 잠재적 위험에 대해 동의하지 않으면서도 법적 수출 통제 명령에는 전면적으로 따르는 이중적 입장을 취하고 있어 AI 안전성 검증의 기술적·정책적 기준이 아직 합의되지 않았음을 드러낸다.
  • 이 과정에서 Claude Mythos 5, Fable 5는 에이전틱 AI가 소스코드와 네트워크 구성을 읽고 자체적으로 취약점을 식별·제안하는 연구 지원 도구로 인식되었고, 미국 상무부는 이러한 기능이 국가 기반 시설·정부 시스템에 대한 공격 준비에 악용될 수 있다고 판단해 외국인 이용자를 포함한 광범위한 차단 조치를 취했으며, 이는 AI 모델의 ‘사이버 무기화’ 가능성을 수출 규제 관점에서 직접 다룬 첫 사례 중 하나로 평가된다.
  • Anthropic은 Fable 5에 대해 프롬프트와 응답을 30일간 저장하고, 잠재적으로 유해한 사이버 보안·생물학 요청은 직원이 검토할 수 있도록 하는 내부 통제 체계를 강조했으며, Claude Opus 4.8 대비 2배 수준의 가격 책정과 별도 사용 크레딧 구조를 도입하여, 고위험 기능을 가진 Fable 5를 일반 모델과 분리된 ‘고급 연구 인프라’로 포지셔닝함으로써 정책 당국과 기업 고객 모두에게 통제 가능한 고위험 AI 서비스라는 인식을 심어주려 하고 있다.
  • AI 안전 거버넌스 측면에서 Fable 5 사건은 Anthropic의 Mythos 프레임워크와 같은 자체 안전성 기준과 미국 상무부의 국가 안보 기준이 충돌했을 때, 최종적으로 정부의 수출 통제가 우선하며 기업은 구체적인 피해 사례가 없는 상황에서도 모델 가용성을 전면 중단해야 한다는 현실을 보여주며, 향후 EU AI Act, 영국 AI 안전 규제 등에서 에이전틱 AI의 ‘자율 취약점 탐지 능력’을 별도 규제 항목으로 지정할 가능성을 높인다.
  • 한국 정부는 Claude Fable 5의 재가동과 미국 정부의 통제 변화가 글로벌 AI 안전 규범 형성의 핵심 사례가 되고 있다는 점을 인지하고, 국내 AI·보안 기업이 개발하는 취약점 탐지형 에이전틱 AI에 대해 ‘공세적 활용 금지·방어 목적 제한’을 명시하는 가이드라인과 국산 모델의 해외 제공 시 적용될 수출 통제 규정의 기본 틀을 선제적으로 마련해야 하며, 동시에 Anthropic·OpenAI와의 협력 시 미국 규제에 따른 기능 제한 범위를 계약 단계에서 명확히 정의하여 국가 안보와 산업 경쟁력을 모두 보호하는 전략이 필요하다.

Fable 5 중단과 재개 과정은 에이전틱 AI의 취약점 탐지 능력이 언제 국가 안보 위협으로 간주되는지를 보여주는 살아 있는 사례로, 한국은 자체 AI 안전성 심사 체계를 구축해 미국·EU의 규제와 연동 가능한 신뢰 기반을 서둘러 확보해야 한다.

주요 용어: 에이전틱 AI(사용자 지시 없이도 스스로 계획·실행을 수행하는 자율형 AI 시스템), 탈옥(jailbreak)(AI 모델의 안전 장치를 우회해 제한된 기능을 억지로 활성화하는 공격 기법), Claude Mythos 5(고위험 연구 분야에 특화된 Anthropic의 AI 안전 프레임워크 겸 모델 계열)

출처: The Decoder