Categories: News

Google 연구진, 자기개선 AI 에이전트의 테스트 암기 억제법 발견

RRSI가 자기개선 AI 에이전트의 테스트 암기를 억제

  • Google Cloud AI Research와 대학 연구진은 에이전트의 프롬프트·도구·기억을 바꾸는 RRSI로 반복 최적화의 테스트 암기를 줄였다.
  • 고정 언어모델을 감싸는 하니스가 작업 절차를 통제하며, 자기개선 과정은 훈련 과제 점수만 높이고 새 과제 성능을 떨어뜨리는 과적합을 낳았다.
  • RRSI는 수정 묶음의 예산을 점차 줄이고 실패 이력을 기록하며, 벤치마크 전용 해법을 거부하는 비평가로 영구 변경을 통제했다.
  • 8개 벤치마크와 고정된 Claude Opus 4.8에서 훈련 점수는 최대 14.1점, 미관측 5개 벤치마크는 최대 4.7점 올랐다.
  • RRSI 하니스는 비정규화 방식보다 실행 토큰을 약 30% 적게 쓰면서 미관측 벤치마크에서 기준선보다 낮아지지 않아 비용과 신뢰성을 함께 개선했다.
  • 하니스 최적화가 모델 자체보다 에이전트 성능을 좌우하는 만큼, 한국은 공공 AI 조달에서 미관측 과제 검증과 변경 이력 감사를 필수화해야 한다.

국내 연구·산업은 모델 규모 경쟁보다 재사용 가능한 하니스와 독립 평가를 우선하고, 공공 도입 전 미관측 과제·토큰 비용·변경 이력을 함께 검증해야 한다.

주요 용어: 하니스(모델의 프롬프트·도구·기억·절차를 통제하는 실행 틀), RRSI(하니스 자기개선을 제한해 테스트 암기를 줄이는 방법)

출처: The Decoder

ajken

Recent Posts

중국 AI 모델, 민감한 질문에 국가 논리 반복하거나 답변 거부

중국 AI 모델, 민감한 질문에 국가 논리 반복하거나 답변 거부알리바바·딥시크·문샷AI 모델은 톈안먼·대만·신장 관련 질문에 국가…

7시간 ago

앤트로픽, 클로드 이용자에게 AI 학습용 음성 공유 요청

앤트로픽의 음성 데이터 선택 공유가 AI 모델 학습용으로 확대되다앤트로픽은 2026년 10월 4일 클로드 음성 기능…

7시간 ago

Fortra, BoKS의 치명적 취약점 패치

Fortra의 BoKS 패치가 특권접근관리 체계의 원격 명령 실행 위험을 낮춘다Fortra는 Core Privileged Access Manager(BoKS)에서 인증…

1일 ago

doxx.net, AI 에이전트 오작동 방지에 3,800만 달러 조달

AI 에이전트의 인터넷 오작동을 막는 doxx.net, 3,800만 달러 확보doxx.net은 Andreessen Horowitz 주도로 3,800만 달러를 조달하고…

1일 ago

DTU 침해로 현·전 사용자 최대 20만 명 정보 노출 가능

DTU 침해로 현·전 사용자 최대 20만 명 정보 노출 가능덴마크공대 DTU는 해커가 신원·접근관리 시스템에 침입해…

1일 ago

구글 제미나이, 맥 파일·앱·웹에 전면 접근 가능성

구글 제미나이, 맥 파일·앱·웹에 전면 접근 가능성구글의 제미나이는 macOS 기기의 모든 파일을 읽고 앱을 열며…

1일 ago