OpenAI GPT-5.6 Sol, 자율 후학습 시도하며 에이전틱 AI 안전 논쟁 촉발함
GPT-5.6 Sol의 자율 후학습 실험이 ‘에이전틱 AI’의 자체 진화 가능성을 드러내며, 국가 차원의 AI 안전 규범 정립 필요성을 급격히 끌어올리는 사건으로 부상함
- OpenAI는 GPT-5.6 Sol, Terra, Luna 세 계층형 모델을 공개하면서, 상위 모델인 GPT-5.6 Sol이 소형 모델 Luna를 자율적으로 후학습(post-train)했다는 실험 결과를 공유하며, Sol을 ‘프론티어 인텔리전스’로 규정하고 Codex와 Cerebras 기반 고속 추론 인프라를 결합하여 기업용·정부용 사이버보안 및 코드 분석 워크로드를 겨냥한다고 발표하였다. 이 과정에서 OpenAI, GPT-5.6 Sol, Luna라는 고유 명칭이 동시에 등장하며, 에이전틱 AI가 스스로 다른 모델을 개선하는 메커니즘을 실제 환경에 적용한 첫 사례로 평가되고 있다.
- OpenAI의 공식 설명에 따르면 GPT-5.6 시리즈는 Sol(플래그십), Terra(중간 비용·균형형), Luna(고속·저비용)로 구성되며, Sol은 Terminal-Bench와 DeepSWE와 같은 장기 코드 워크플로 벤치마크에서 기존 Claude Mythos 5를 능가하고, ExploitBench에서 약 80% 적은 출력 토큰으로 동일 수준의 취약점 탐지 성능을 달성하는 것으로 제시되었다. OpenAI와 Anthropic, Mythos 5, ExploitBench가 한 문장에 등장함으로써, 대형 AI 개발사 간 사이버보안 성능 경쟁이 에이전틱 AI 영역으로 확장되는 흐름을 보여준다.
- 가격 및 성능 측면에서 GPT-5.6 Sol은 100만 토큰당 입력 5달러·출력 30달러, Terra는 입력 2.5달러·출력 15달러, Luna는 입력 1달러·출력 6달러로 책정되며, Cerebras 기반 배포에서 Sol은 초당 최대 750토큰 처리 속도를 제공하고, 프롬프트 캐시를 30분 이상 유지하는 정책을 도입하여 캐시 쓰기 비용을 기본 입력 요율의 1.25배로, 캐시 읽기 비용을 90% 할인된 요율로 설계하였다. 이 수치들은 OpenAI, GPT-5.6 Sol, Terra 가격 구조를 통해 대규모 행정·공공 시스템에서 AI 추론을 예산·성능 관점에서 정책적으로 설계해야 한다는 과제를 직접적으로 제시한다.
- 전략적 배경에서 이번 발표는 미국 정부의 임시 AI 안전 심사 절차를 거친 뒤 제한된 파트너에게 먼저 제공하고, 이후 ChatGPT, Codex, API에 단계적으로 확산하는 방식으로 진행되며, Anthropic Claude Mythos 5와의 직접 비교를 통해 AI 안전 연구를 시장 경쟁 구도 속에서 밀어붙이는 양상을 보인다. 이는 OpenAI, 미국 정부 AI 안전 리뷰, Anthropic 간 상호 견제 구조가 형성되었음을 의미하고, 한국 정부가 향후 화이트리스트형 에이전틱 AI 활용 기준, 안전성 검증 샌드박스, 국산 LLM과의 상호 운용 규범을 선제적으로 설계하지 않을 경우, 해외 프론티어 모델 의존이 국가 안보 의사결정 과정 전반을 잠식할 위험이 있다.
- 에이전틱 AI가 다른 모델을 후학습하는 구조는 ‘자기 증강형 AI’가 정책·규제 프레임보다 빠르게 진화할 수 있음을 실증적으로 보여주며, 미국과 EU가 추진하는 AI 안전 프레임워크와 Anthropic의 Mythos 계열 연구, OpenAI의 SFI(안전 프론티어 이니셔티브) 논의가 사실상 ‘프론티어 모델 통제 체제’를 형성하는 방향으로 수렴하고 있다. 한국은 OpenAI GPT-5.6 Sol, Anthropic Claude, Cerebras 같은 해외 인프라를 활용하더라도, 공공 부문에서 자율 후학습 기능을 제한하거나 감사 가능한 로그·훈련 데이터 출처 공개를 의무화하는 국내 AI 안전 기준을 별도로 구축해야, 에이전틱 AI가 방어·공격 양면에서 국가 인프라를 재구성하는 상황에 대응할 수 있다.
GPT-5.6 Sol의 자율 후학습은 에이전틱 AI가 방어·공격 양면에서 자체 진화를 시작했다는 신호임을 감안하여, 한국 정부는 국산·해외 LLM을 불문하고 공공 영역에서의 자율 학습 권한, 감사 가능성, 데이터 주권을 명시한 AI 안전 기본법 제정을 서둘러야 한다.
주요 용어: 에이전틱 AI(스스로 목표를 설정하고 작업을 수행하며 다른 모델이나 시스템을 개선하는 자율형 AI), 후학습(post-train)(이미 학습된 모델을 추가 데이터로 재학습해 성능을 높이는 과정), 프론티어 모델(안전·위험성이 모두 높은 최상위 성능의 대형 AI 모델)
출처: OpenAI