설명가능성

Anthropic, Claude 내부 사고 가시화로 AI 안전 연구 앞당김

모델의 내부 추론 경로를 읽어내며, AI 안전성 검증을 ‘블랙박스 테스트’에서 ‘행동 감시’로 바꾼다Axios는 Anthropic이 Claude의 내부 사고를 읽을 수 있게…

2개월 ago