CARD 2 · PROBLEM
2 / 5
어떤 문제를 풀고 있나
터미널 에이전트 학습을 위한 고품질 장기 수평선 훈련 데이터는 지시문, 환경, 참조 솔루션, 검증기 간의 일관성을 유지해야 하기 때문에 제작 비용이 매우 높습니다. 인간 저작은 확장성이 떨어지고 대규모언어모델(LLM)을 통한 직접 생성은 이러한 의존성을 자주 위반합니다.
CARD 3 · METHOD
3 / 5
어떻게 풀었나
검증된 시드 작업에서 시작하여 참조 솔루션을 확장하고, 검증기와 지시문을 새로운 워크플로우에 재정렬한 후, 샌드박스 환경에서 결과를 검증하며, 승인된 작업을 다음 라운드의 시드로 재사용하는 재귀적 검증 합성 프레임워크(RST: Recursive Synthetic Terminal Tasks)를 제시합니다.
CARD 4 · RESULTS
4 / 5
결과와 의의
15개 재귀 라운드를 거쳐 약 0.05달러의 비용으로 37,484개의 합성 터미널 에이전트 작업을 생성했으며, 작업 난이도가 지속적으로 증가했습니다(참조 솔루션은 67줄에서 374줄로, 실행된 명령어는 40개에서 244개로, DeepSeek-V4-Pro의 pass@4는 90%에서 2.5%로 감소). 합성 작업으로 학습한 결과 Qwen3.5 모델은 세 개의 벤치마크에서 최대 10점 향상되었으며, 정책 최적화(PPO)를 적용하면 상대적으로 20.0~41.2% 성능 향상을 달성했습니다.
!
이 연구는 고비용의 수동 데이터 생성을 자동화된 재귀적 합성으로 대체하여 대규모 터미널 에이전트 훈련 데이터 확보를 가능하게 합니다. 15라운드 이후에도 합성 수율과 검증율이 안정적으로 유지되며 난이도가 계속 상승하는 결과는 무한정 확장 가능한 데이터 생성 체계의 잠재력을 보여줍니다.
— 의의