CARD 2 · PROBLEM
2 / 5
어떤 문제를 풀고 있나
AI 과학자의 핵심 능력인 연구계획 생성은 검증 가능한 정답이 없어 강화학습의 환경으로 사용하기 어렵습니다. 기존 방식은 질문과 평가 기준을 같은 콘텐츠에서 추출하여 리워드 누수 문제가 심각합니다.
CARD 3 · METHOD
3 / 5
어떻게 풀었나
PaperGym은 각 연구논문을 완전한 학습 환경으로 변환하는 통합 프레임워크입니다. 논문 구조를 활용하여 질문은 연구 목표와 배경에서 합성하고, 평가 기준은 방법론과 실험에서 도출함으로써 리워드 누수를 3.7%로 감소시킵니다. OPSD의 자기-교사 학습을 위한 권한부여 컨텍스트로 룩브릭을 먼저 사용한 후, GRPO 보상으로 재사용하는 이중 학습 전략을 적용합니다.
CARD 4 · RESULTS
4 / 5
결과와 의의
Qwen3-1.7B/4B/8B 모델에서 감독학습 미세조정 및 단일 단계 학습보다 우수한 성능을 달성했으며, 5개 벤치마크 평균 성능이 +4.8~+5.6포인트 향상되었습니다. PaperGym-20k로 학습한 모델은 RubricHub Science 대비 세 방향 비교에서 58.1% 승률을 기록하였고, Qwen3-8B는 ResearchQA에서 73.48을 달성하여 훨씬 큰 규모의 Kimi K2.6을 초과했습니다.
!
이 연구는 과학논문의 구조를 활용하여 고품질 학습 환경을 체계적으로 구축하는 방법론을 제시하며, AI 과학자 개발에 필요한 리워드 신뢰성을 대폭 개선합니다. 공개 파이프라인, 20,000개 인스턴스 코퍼스, 벤치마크 제공으로 후속 연구의 기초를 마련합니다.
— 의의