CARD 2 · PROBLEM
2 / 5
어떤 문제를 풀고 있나
강력한 교사 모델로부터 장문맥 추론 능력을 짧은 문맥의 학생 모델로 전이하려 할 때, 토크나이저 불일치, 교사-학생 분포 불일치, 응답 길이 폭증, 학습 불안정성 등의 실질적 어려움이 발생한다.
CARD 3 · METHOD
3 / 5
어떻게 풀었나
공유 텍스트 공간에서 정책상 증류를 수행하여 토크나이저 차이를 처리하고, 학생 참조 KL 손실과 특수 종료 토큰(예: </think>, <|im_end|>)의 이점 마스킹을 도입해 과도한 생성 길이 문제를 완화하고 학생이 초기 정책에서 과도히 벗어나는 것을 제약한다.
CARD 4 · RESULTS
4 / 5
결과와 의의
Qwen3, Qwen3.5, Intern-S2, GLM-4.7, Gemma-4 등 다양한 계열의 학생 모델에서 일관된 성능 향상을 보였으며, 특히 Intern-S2-Preview는 ProofBench에서 21.2점 증가하여 55.2에 도달해 Gemini-2.5-Pro를 능가하고, HLE, HiPhO 등 과학 벤치마크에서도 개선되었다.
!
이 연구는 정책상 증류를 장문맥 추론 전이에 효과적으로 적용하는 방법을 제시하며, 수학 증명뿐 아니라 과학 분야까지 일반화되는 추론 능력 전이를 보여줌으로써 대규모 언어 모델의 효율적 학습 방법론에 기여한다.
— 의의