CARD 2 · PROBLEM
2 / 5
어떤 문제를 풀고 있나
대화형 월드 모델은 사용자 행동을 따르고, 방문한 장소를 기억하며, 실시간으로 스트리밍해야 하는데, 짧은 시간 범위의 제어와 무제한의 메모리 사이에 구조적 긴장이 존재한다.
CARD 3 · METHOD
3 / 5
어떻게 풀었나
ReWorld는 훈련 중에는 두 가지를 분리하고 추론 시에는 이를 제한한다. 혼합된 헤드별 어텐션 윈도우로 대부분의 헤드를 최근 과거에 한정하고, 소수의 글로벌 헤드는 전체 이력을 주시하며, 무작위 헤드 라우팅으로 특정 헤드의 역할 고착을 방지한다. 추론 시에는 고정된 예산 하에서 자세 인덱싱된 랜드마크 은행으로 지원되는 제한된 KV 캐시를 활용한다. 메트릭-스케일 정렬 데이터 엔진은 언리얼 렌더링, 게임 로밍, 실제 영상 등 8가지 소스를 물리적 행동 척도에 통일하고, LoRA 어댑터에 제한된 디스틸레이션으로 샘플링을 4단계로 압축한다.
CARD 4 · RESULTS
4 / 5
결과와 의의
ReWorld는 회전 오류 11.95°의 최고 제어 충실도와 최고의 카메라 움직임 일관성을 달성하며, 1분 길이의 왕복 롤아웃(64초, 384개 잠재 변수)에서 고정된 12청크 캐시로도 시작 장면을 재생성한다. 6개의 최근 대화형 월드 모델을 제치고 제어 충실도, 장기 회상, 비디오 품질의 3축 벤치마크에서 최우수 성능을 달성한다.
!
장기 메모리를 유지하면서 실시간 대화형 스트리밍을 가능하게 함으로써, 게임엔진 환경부터 실제 세계에 이르기까지 다양한 도메인의 월드 모델 응용을 확대한다. 고정 캐시 예산에서도 멀티 스텝 모드와 실시간 모드를 모두 지원하는 설계는 체화 AI와 대화형 시뮬레이션의 실용성을 높인다.
— 의의