CARD 2 · PROBLEM
2 / 5
어떤 문제를 풀고 있나
터미널 에이전트를 위한 고품질 장기 훈련 데이터는 작업당 수백~수천 달러의 비용이 들며, 명령어·환경·참조 해답·검증기 간의 일관성을 유지하기 어렵다. 대규모 데이터 생성을 위해 자동화된 방법이 절실하다.
CARD 3 · METHOD
3 / 5
어떻게 풀었나
검증된 시드 작업에서 출발하여 참조 해답을 단계적으로 확장하고, 검증기와 명령어를 새로운 워크플로우에 재정렬한 후, 샌드박스 환경에서 검증하는 재귀적 합성 프레임워크(RST)를 제안한다. 수용된 작업을 다음 라운드의 시드로 재사용하여 반복 과정을 진행한다.
CARD 4 · RESULTS
4 / 5
결과와 의의
15라운드의 반복을 통해 약 0.05달러의 저비용으로 37,484개의 합성 터미널 작업을 생성했으며, 작업 난이도가 급격히 상승했다(참조 해답은 67줄에서 374줄로, 실행 명령어는 40개에서 244개로 증가). 합성 데이터로 미세조정한 결과 Qwen3.5 모델의 성능이 최대 10포인트 향상되었고, PPO를 적용하면 세 가지 벤치마크에서 20~41% 상대 성능 향상을 달성했다.
!
이 연구는 대규모 터미널 에이전트 훈련 데이터를 자동으로 생성할 수 있는 확장 가능한 방법을 제시하며, 비용 효율적이면서도 점진적으로 난이도가 높아지는 데이터셋 구축을 가능하게 한다. 15라운드 이후에도 합성 수율과 검증율이 안정적으로 유지되어 더 큰 규모의 데이터 생성이 가능함을 시사한다.
— 의의