Anthropic ‘Claude Mythos’ AI, 검증 안 된 대량 취약점 발견
AI 취약점 발굴 도구 ‘Claude Mythos’ 대량 발견과 검증 병목이 드러나며 소프트웨어 공급망 위험 관리 방식 재검토가 필요하다
- Anthropic은 ‘Claude Mythos Preview’를 281개 오픈소스 프로젝트에 적용해 23,019개 취약점 후보를 수집했다. Echo는 이를 취합해 AI 기반 코드 분석이 대형 프로젝트 다수를 동시에 스캔하는 새로운 공급망 감시 수단임을 보여준다고 평가한다.
- 외부 보안업체는 1,900개 후보만 실제 검토했고, 프로젝트 유지관리자에게 1,596건을 통보해 1,451건을 인정받았다. 97건은 상류 코드에 수정이 반영됐고 88건은 보안 권고로 공개돼, AI 탐지 결과가 현실 취약점으로 이어질 수 있음이 확인됐다.
- 나머지 21,119개 후보는 Anthropic 내부 외에는 누구도 검토하지 못한 상태다. Echo는 검증 인력 부족을 주된 원인으로 지적하며, 대규모 자동 탐지 체계가 인력 기반 검증·조치 역량을 앞질러 ‘발견된 취약점 적체’가 새로운 리스크로 부상하고 있음을 경고한다.
- 검토된 1,900개 중 1,726개가 실제 취약점으로 판정돼 정확도는 90.8%에 이른다. 그러나 이 표본은 무작위가 아니며 Echo는 가장 유망한 후보를 선별해 보낸 결과일 가능성을 언급한다. Anthropic은 나머지 약 2만 건의 정확도와 오탐률은 아직 공개하지 않았다.
- SpiderMonkey 엔진 취약점 50개로 만든 벤치마크에서 Claude Mythos Preview는 250회 시도 중 181회(72.4%)를 임의 코드 실행 익스플로잇으로 발전시켰다. 반면 Claude Opus 4.6은 1% 미만 성공에 그쳐 세대 간 약 90배 공격 능력 향상이라는 평가가 나온다.
- Echo가 2026년 7월 미국 보안 리더 80여 명을 조사한 결과, 37%는 ‘대응 가능량을 넘는 취약점 탐지’를 공급망 보안 최대 장애 요인으로 꼽았다. 한국은 오픈소스 의존도가 높아 AI 탐지 확산이 곧 대규모 취약점 적체와 우선순위 혼선으로 이어질 수 있어, 정부·산업계 차원의 검증·우선순위 표준 정립이 요구된다.
AI가 소프트웨어 취약점을 ‘대량 발견·부분 검증’하는 시대에 들어섰다. 한국 정책 담당자는 오픈소스 보안 책임체계, AI 탐지 결과의 국가적 우선순위 기준, 검증 인력·예산 확보 방안을 선제 설계해야 한다.
주요 용어: 소프트웨어 공급망(여러 조직과 오픈소스가 얽힌 소프트웨어 제작·배포 구조), CVE(공개 취약점 식별용 국제 표준 번호), CVSS(취약점 심각도 산정 국제 표준 점수 체계)