CARD 2 · PROBLEM
2 / 5
어떤 문제를 풀고 있나
대규모 언어 모델의 효율성과 성능을 동시에 달성하기 위해서는 계산 비용을 제어하면서도 충분한 모델 용량을 유지해야 한다. 또한 장문맥 처리, 추론, 코딩, 도구 사용 등 다양한 작업에 우수한 성능을 제공하는 통합 모델을 구축하는 것이 필요하다.
CARD 3 · METHOD
3 / 5
어떻게 풀었나
세분화된 희소성을 가진 MoE 아키텍처(총 3,140억 개 매개변수, 토큰당 132억 개 활성화)를 도입하고, 그룹 미분 잠재 주의(GDLA)와 다양한 최적화 기술(매니폴드 제약 하이퍼연결, 전문가별 PolyNorm 활성화, 다중 토큰 예측)을 통합했다. 12.5조 개의 토큰으로 사전 학습 후 지도 미세 조정, 강화학습 기반 여섯 명의 전문가 교사, 다중 교사 온정책 증류를 포함한 다단계 후처리 파이프라인을 적용했다.
CARD 4 · RESULTS
4 / 5
결과와 의의
모티프 3는 선도적인 오픈 가중치 모델들과 경쟁력 있는 성능을 보여주며, 장시간 에이전트 작업, 수학 추론, 과학 지식, 환각 민감도 평가에서 강력한 결과를 달성했다.
!
이 연구는 희소 전문가 혼합을 활용하여 계산 효율성을 유지하면서 다양한 분야에서 고성능을 제공하는 대규모 언어 모델의 설계와 학습 방법론을 제시한다. 특히 장문맥 처리와 다중 도메인 작업에 대한 확장 가능한 접근 방식을 제공함으로써 실무적 AI 시스템 개발에 기여한다.
— 의의