CARD 2 · PROBLEM
2 / 5
어떤 문제를 풀고 있나
언어 에이전트의 지속적인 자기 개선을 위해서는 다양하고 적응적인 학습 목표의 확장 풀이 필요하나, 기존 환경 풀(수작업 큐레이션, 정적 합성, 고정 검증자)은 학습자의 규모 증가에 따라 목표 분포를 고정시킨다.
CARD 3 · METHOD
3 / 5
어떻게 풀었나
SPADE는 하나의 대규모 언어모델이 두 가지 역할을 수행하는 자기 대전 강화학습 프레임워크로, 환경 설계자(실행 가능한 코드로 Gym 스타일 인터페이스 작성)와 추론 에이전트(환경에서 학습)로 나뉜다. 환경 설계자는 에이전트의 능력 경계에 맞춘 환경을 만들고, 후회 신호(특권 힌트 사용 여부에 따른 보상 격차)로 학습한다.
CARD 4 · RESULTS
4 / 5
결과와 의의
30B 파라미터 모델로 확장할 경우, 8개의 수학, 과학, 코드, 추론 벤치마크에서 고정 환경 기준선 대비 평균 +5.3 개선, 도구 사용 설정에서 BFCL-v4 다중 턴 +5.7, ACEBench-Agent +13.9, 게임 설정에서는 모델 규모 증가에 따라 우월성이 더욱 커진다.
!
환경 설계 자체를 학습 가능한 요소로 만들어 개방형 자기 개선으로의 구체적인 진전을 제시하며, 정적 학습 환경의 한계를 극복하고 동적으로 확장 가능한 자기 개선 체계를 제안한다.
— 의의