CARD 2 · PROBLEM
2 / 5
어떤 문제를 풀고 있나
기존 다중모달 대형언어모델은 밀집된 위치 결정 궤적을 자동 회귀 방식으로 직렬화하여 디코딩 지연이 튜브 길이에 비례하고 시간에 따른 위치 결정 오류가 누적되는 문제가 있습니다.
CARD 3 · METHOD
3 / 5
어떻게 풀었나
시간 블록 이후 시간 조건부 공간 블록을 병렬로 디코딩하는 병렬 튜브 디코딩(PTD)을 제안하며, 분리된 블록 어텐션으로 공유 비디오-쿼리 문맥에 접근하면서도 상자 간 종속성을 제거하고, 위치 인식 정책 최적화로 시간 경계와 공간 기하학을 개선합니다.
CARD 4 · RESULTS
4 / 5
결과와 의의
VidSTG에서 튜브 완성 지연을 79배 감소, 공간 디코딩 처리량을 92배 증가시키며 그라운딩 정확도도 향상되었고, 4B 백본으로도 VidSTG와 HC-STVG에서 우수한 성능을 보이며 시간 그라운딩, 그라운드된 VideoQA, 비디오 객체 추적으로 제로샷 일반화됩니다.
!
병렬 튜브 생성은 비디오 위치 결정의 자동 회귀 방식을 대체하는 효율적이고 효과적인 대안으로, 추론 속도와 정확성을 동시에 달성하여 실시간 비디오 이해 응용에 중요한 의미를 갖습니다.
— 의의