AI 안전성

Mathematical A.I. Safety Institute, 암호 수준 수학 증명으로 AI 안전성 입증 추진

암호 연구 수준의 수학적 증명으로 AI 안전성을 입증하려는 신규 연구소 출범캐나다 수학자 제이콥 치머만이 샌프란시스코 베이 에어리어에 독립 연구소 ‘Mathematical…

6일 ago

Anthropic ‘Mythos 2·3’와 OpenAI ‘Astra’ 미공개 개발·통제 전략 부각

Anthropic와 OpenAI, 차세대 초거대 모델 ‘Mythos 2·3’와 ‘Astra’ 개발·통제 전략 부각Anthropic은 2026년 8월 Risk Report에서 내부 모델 ‘Model 2’를 공개하며…

3주 ago

글로벌 빅테크 AI ‘블랙박스 안전성’ 경쟁 격화…한국 R&D·규범 전환 착수

생성형 AI '블랙박스 안전성' 경쟁 격화…한국 보안 R&D 규범 전환 착수 필요Dark Reading 기사는 Anthropic·OpenAI 등 빅테크가 대형 언어모델 내부를…

2개월 ago

오픈AI ‘GPT-Red’ 프롬프트 인젝션 자동 탐지 공개… 에이전틱 AI 안전 검증 전환 돌입

프론티어 LLM 자체 공격·검증 체계 상용화로 AI 안전 거버넌스 재편 압박오픈AI는 'GPT-Red'라는 내부 레드팀용 모델을 공개해 GPT-5.6 'Sol'을 대상으로 프롬프트…

2개월 ago

Anthropic Fable 5 재가동, 탈옥 논란 이후 AI 안전 거버넌스 시험대에 오르다

정부의 탈옥(jailbreak) 우려로 중단됐던 Claude Fable 5가 글로벌 재개를 앞두며, 에이전틱 AI의 자율적 취약점 탐지와 국가 규제 간 긴장 관계가…

3개월 ago

Sakana AI, Fugu로 멀티-LLM 오케스트레이션 기술 공개… ‘Anthropic Fable 5’ 성능 동급 달성

Sakana AI, Fugu로 멀티-LLM 오케스트레이션 기술 공개… 'Anthropic Fable 5' 성능 동급 달성일본의 AI 연구소 Sakana AI는 자기 학습 기반의…

3개월 ago

Mistral, Anthropic Mythos 경계…군사 코드 스캔 논쟁 확산

Mistral의 경고는 AI 안전 도구가 군사 코드베이스 접근권을 가질 때, 기술 문제를 넘어 주권과 신뢰의 문제로 번진다는 점을 드러낸다.Arthur Mensch가…

4개월 ago

AI 환각 현상, 보안 위협으로 진화… 위협 탐지 오류 연쇄 증폭 우려

생성형 AI 모델의 신뢰도 문제, 보안 위협 판단 오류로 실제 공격 신호 누락 초래보안 분석 업계에서 AI 환각(Hallucination) 현상이 단순한…

4개월 ago

Anthropic, SpaceX Colossus에 22만 GPU 확보…Claude AI 컴퓨팅 독주

Anthropic의 SpaceX 데이터센터 22만 GPU 계약이 AI 보안 연구 인프라 격차를 심화시킨다.Anthropic은 SpaceX의 Colossus-1 데이터센터에 220,000개 GPU를 배치하며 Claude AI…

4개월 ago

최신 AI 모델, ARC-AGI-3 분석서 3대 추론 오류 반복…안전성 한계 드러낸다

고급 AI의 체계적 약점 확인으로 생성형 AI 보안 규제 강화 움직임 가속ARC-AGI-3 벤치마크 분석 결과 최신 AI 모델들이 3가지 체계적…

5개월 ago