CARD 2 · PROBLEM
2 / 5
어떤 문제를 풀고 있나
LLM 기반 에이전트의 지속적인 자기개선을 위해서는 다양하고 적응적인 목표들이 필요한데, 기존의 수작업 큐레이션이나 정적 합성, 동결된 검증기를 사용하는 학습 환경 풀들은 모델 스케일이 증가해도 목표 분포를 고정된 상태로 유지한다는 문제가 있다.
CARD 3 · METHOD
3 / 5
어떻게 풀었나
SPADE는 단일 LLM이 두 가지 역할을 수행하는 자기대국 강화학습 프레임워크다: 환경 설계자(Environment Designer)가 OpenAI Gym 스타일의 reset()/step() 인터페이스를 가진 실행 가능한 코드로 완전한 장기 학습 환경을 작성하고, 추론 에이전트(Reasoning Agent)가 이 환경에서 행동하는 방식을 학습한다. 환경 설계자는 사전학습 코퍼스에서 샘플링한 문서로 접지되고 누적 환경 메모리를 갖춘다. 에이전트의 후회(regret)는 특권적 힌트 유무에 따른 리워드 격차로 추정되며, 이를 최적화하면서 환경 설계자는 에이전트 능력의 경계에 있으면서도 실행 가능한 환경들을 학습한다.
CARD 4 · RESULTS
4 / 5
결과와 의의
30B 파라미터 모델로 확장했을 때, SPADE는 수학, 과학, 코드, 추론 벤치마크 8개 평균 +5.3 포인트 향상을 달성했고, 도구 사용 설정에서는 BFCL-v4 멀티턴 +5.7, ACEBench-Agent +13.9를 기록했으며, 게임 설정에서는 모델 규모가 증가할수록 성능 차이가 더욱 커진다.
!
환경 설계를 학습 가능한 컴포넌트로 만함으로써 LLM 에이전트의 개방형 자기개선을 향한 구체적인 진전을 이루었다. 이는 고정된 환경 풀의 한계를 극복하고 에이전트가 계속 성장할 수 있는 동적 학습 생태계를 구성한다.
— 의의