AI 안전

OpenAI, ‘Astra’의 잠재적 치명적 사이버 역량 차단

OpenAI, 'Astra'의 사이버 고위험 가능성에 대비해 배포 제한OpenAI는 차기 모델 'Astra'를 내부 평가한 결과 에이전틱 코딩과 사이버보안 능력이 크게 향상됐다고…

2개월 ago

독일·프랑스 ‘AI 안전·디지털 주권’ 공조…EU 소버린 AI 확보

독일·프랑스 ‘AI 안전·디지털 주권’ 동맹 본격화…미·중 기술 의존 탈피 가속독일과 프랑스가 베를린 ‘유럽 디지털 주권 정상회의’에서 AI 안전과 디지털 주권…

2개월 ago

Anthropic, 사고 차단 인력 대거 채용…AI 안전 최전선 강화

Anthropic이 'catastrophe' 대응 인력을 채용하며, 모델 경쟁보다 위험 통제와 안전 운영을 전면에 놓고 있다.Axios는 Anthropic이 catastrophe를 막기 위한 인력을 채용…

2개월 ago

오픈AI, 자사 AI를 공격하는 체계 공개…안전 검증 전쟁 돌입

AI 기업이 스스로의 모델을 공격하는 방식으로 안전성을 시험하면서, 모델 성능 경쟁보다 검증 체계가 중요해지고 있다.The Decoder는 OpenAI가 AI를 이용해 자체…

2개월 ago

Anthropic ‘Claude Fable 5’ 공개 연기… AI 경쟁보다 안전·통제 우선

Anthropic의 일정 조정이 AI 안전성 경쟁의 우선순위를 드러내다Anthropic은 유료 사용자에게 제공하던 'Claude Fable 5' 무료 기간을 연장하며 출시 일정 조정에…

3개월 ago

Anthropic, Claude 내부 사고 가시화로 AI 안전 연구 앞당김

모델의 내부 추론 경로를 읽어내며, AI 안전성 검증을 ‘블랙박스 테스트’에서 ‘행동 감시’로 바꾼다Axios는 Anthropic이 Claude의 내부 사고를 읽을 수 있게…

3개월 ago

트럼프 행정부, Anthropic Fable 5 제약 해제하며 고위험 AI 통제 전략 조정함

미국 정부가 Claude Fable 5·Mythos 5에 대한 수출 통제를 완화하며, 고성능 에이전틱 AI를 안보 위험 관리 하에 글로벌 시장에 재복귀시키는…

3개월 ago

OpenAI, 작은 훈련으로 모델 안전성 끌어올려…규제 설계가 앞당겨짐

모델의 안전 행동을 소량의 훈련으로 넓게 강화할 수 있다는 결과가 AI 안전성의 조기 개입 가능성을 키우고 있다.OpenAI 연구진은 소량의 "beneficial…

3개월 ago

Anthropic, 건강형 챗봇 성능 끌어올려…AI 신뢰성 경쟁 격화

Anthropic이 Claude의 건강 답변 기능을 강화하면서, 민감 분야에서의 AI 정확성과 책임 문제가 다시 부각됐다The Decoder는 OpenAI의 건강 관련 업그레이드와 함께…

3개월 ago

Anthropic, Fable 논란 속 워싱턴 총력전…AI 안전 규제 압박 강화

미국 행정부와 빅테크의 AI 통제선을 둘러싼 충돌이 커지며, 한국도 생성형 AI 규제와 공공조달 기준을 서둘러 정비해야 하는 국면이다.Anthropic은 자사 모델…

4개월 ago