CARD 2 · PROBLEM
2 / 5
어떤 문제를 풀고 있나
대규모 언어 모델의 성능과 효율성을 동시에 달성하기 위해서는 계산 비용을 줄이면서도 모델 용량을 확대할 수 있는 아키텍처가 필요하다. 특히 장문맥 처리, 복잡한 추론, 다양한 전문 분야 작업을 한 모델에서 효과적으로 수행하는 것이 과제이다.
CARD 3 · METHOD
3 / 5
어떻게 풀었나
31조 4천억 개의 총 파라미터를 가진 혼합전문가(MoE) 기반 디코더 전용 모델을 구축했으며, 토큰당 132억 개만 활성화되는 세밀한 희소성을 적용했다. 그룹화된 미분 잠재주의(GDLA), 전문가별 PolyNorm 활성화, 다중토큰 예측 등의 기술을 통해 최적화 안정성과 전문가 특화를 강화하고, MXFP8 연산, 효율적인 커널 융합, 윈도우 기반 컨텍스트 병렬화로 256K 토큰까지의 장문맥 학습을 지원했다. 12.5조 토큰으로 사전학습한 후 감독학습과 강화학습 기반 6개 전문 교사, 소프트웨어공학 교사를 활용한 다중교사 온-정책 증류로 후학습을 수행했다.
CARD 4 · RESULTS
4 / 5
결과와 의의
Motif 3는 장문맥 에이전트 작업, 수학 추론, 과학 지식, 환각 민감도 평가에서 강력한 성능을 보이며 주요 공개 모델들과 경쟁력 있는 수준의 성능을 달성했다. 추론, 코딩, 도구 사용, 전문가적 작업, 장문맥 이해, 보정된 기각, 지시문 따르기 등 다양한 능력을 통합적으로 확보했다.
!
이 연구는 희소 혼합전문가 구조와 혁신적인 주의 메커니즘, 효율적인 학습 기법들을 결합하여 수조 단위 규모의 안정적인 학습과 다목적 성능을 동시에 달성하는 방법을 제시한다. 이는 향후 대규모 언어 모델의 설계와 최적화에 중요한 기준이 될 것으로 예상된다.
— 의의