CARD 2 · PROBLEM
2 / 5
어떤 문제를 풀고 있나
대규모 언어 모델의 계산 효율성과 성능 사이의 균형을 맞추면서도 추론, 코딩, 장문맥 이해 등 다양한 능력을 통합적으로 갖춘 모델을 개발하는 것이 필요하다.
CARD 3 · METHOD
3 / 5
어떻게 풀었나
3140억 개의 전체 매개변수를 가진 희소 혼합-전문가(MoE) 아키텍처를 설계하였으며, 토큰당 13.2억 개만 활성화된다. 그룹화된 차분 잠재 주의(GDLA), 다중 토큰 예측, 전문가 특화 PolyNorm 활성화 함수 등의 기법을 통해 최적화 안정성과 전문가 특화를 강화하였다. 사후 학습 단계에서 감독 미세조정과 강화학습 기반 여섯 명의 전문가 교사, 다중 교사 정책상 증류법을 결합하였다.
CARD 4 · RESULTS
4 / 5
결과와 의의
Motif 3는 약 12.5조 개의 토큰으로 사전학습되었으며, 256K 토큰까지의 맥락 길이를 지원한다. 주요 공개 가중치 모델들과의 비교에서 경쟁력 있는 성능을 보였으며, 특히 장기간 에이전트 작업, 수학적 추론, 과학 지식, 그리고 환각 저감 평가에서 우수한 결과를 달성하였다.
!
희소 MoE 구조와 고급 주의 메커니즘, 다양한 전문가 학습 전략을 통합함으로써 계산 효율성을 유지하면서도 여러 도메인에서의 실용적 능력을 갖춘 고성능 모델을 제시하였으며, 이는 향후 대규모 언어 모델 개발의 새로운 방향을 제시한다.
— 의의