Google 연구진, 자기개선 AI 에이전트의 테스트 암기 억제법 발견

Google 연구진, 자기개선 AI 에이전트의 테스트 암기 억제법 발견

RRSI가 자기개선 AI 에이전트의 테스트 암기를 억제

  • Google Cloud AI Research와 대학 연구진은 에이전트의 프롬프트·도구·기억을 바꾸는 RRSI로 반복 최적화의 테스트 암기를 줄였다.
  • 고정 언어모델을 감싸는 하니스가 작업 절차를 통제하며, 자기개선 과정은 훈련 과제 점수만 높이고 새 과제 성능을 떨어뜨리는 과적합을 낳았다.
  • RRSI는 수정 묶음의 예산을 점차 줄이고 실패 이력을 기록하며, 벤치마크 전용 해법을 거부하는 비평가로 영구 변경을 통제했다.
  • 8개 벤치마크와 고정된 Claude Opus 4.8에서 훈련 점수는 최대 14.1점, 미관측 5개 벤치마크는 최대 4.7점 올랐다.
  • RRSI 하니스는 비정규화 방식보다 실행 토큰을 약 30% 적게 쓰면서 미관측 벤치마크에서 기준선보다 낮아지지 않아 비용과 신뢰성을 함께 개선했다.
  • 하니스 최적화가 모델 자체보다 에이전트 성능을 좌우하는 만큼, 한국은 공공 AI 조달에서 미관측 과제 검증과 변경 이력 감사를 필수화해야 한다.

국내 연구·산업은 모델 규모 경쟁보다 재사용 가능한 하니스와 독립 평가를 우선하고, 공공 도입 전 미관측 과제·토큰 비용·변경 이력을 함께 검증해야 한다.

주요 용어: 하니스(모델의 프롬프트·도구·기억·절차를 통제하는 실행 틀), RRSI(하니스 자기개선을 제한해 테스트 암기를 줄이는 방법)

출처: The Decoder