CARD 2 · PROBLEM
2 / 5
어떤 문제를 풀고 있나
개방형 가중치 대규모 언어 모델은 증가하고 있지만, 이들의 서빙은 여전히 데이터센터 인프라를 가정하고 있어 개인 기계에서의 효율적 배포가 어렵다. 엣지 환경에서 실행 패턴이 동적으로 변하고 하드웨어 자원의 구성이 기계마다 다르다는 현실적 제약 속에서 혼합전문가 모델을 실용적으로 서빙할 방법이 필요하다.
CARD 3 · METHOD
3 / 5
어떻게 풀었나
FreeToken은 모델 레이아웃, 전문가 배치, CPU-GPU 실행, 에이전트 상태 재사용, 런타임 메모리 관리를 포함한 전체 서빙 스택을 공동 설계하며, 고정된 오프로딩 전략 대신 실제로 이용 가능한 자원에 계산과 모델 상태를 지속적으로 매핑하는 대역폭-적응형 실행을 핵심으로 한다. 이를 통해 노트북의 8GB GPU부터 워크스테이션 GPU까지 다양한 엣지 하드웨어에서 20개 이상의 혼합전문가 모델과 실제 코딩·도구 사용 에이전트를 지원한다.
CARD 4 · RESULTS
4 / 5
결과와 의의
노트북에서 35B 모델, 게이밍 데스크톱에서 284B 모델, 단일 워크스테이션 GPU에서 753B GLM-5.2 모델을 실용적으로 서빙할 수 있으며, 이는 기존에 비해 제공 가능한 모델 규모를 획기적으로 확대한 결과이다.
!
개인용 컴퓨터를 실질적인 최첨단 규모 지능의 플랫폼으로 전환함으로써, 사용자가 이미 소유한 기계에서 개방형 가중치 모델을 실용적인 로컬 소프트웨어로 배포 가능하게 한다. 이는 엣지 AI의 대민화와 분산화에 중요한 기여를 한다.
— 의의