CARD 2 · PROBLEM
2 / 5
어떤 문제를 풀고 있나
에이전트의 성능은 기초 모델뿐 아니라 메모리 관리, 계획 전략, 행동 프로토콜, 도구 조율 등을 포함하는 '하네스(harness)'에 의해 좌우되는데, 현재 하네스 설계는 수작업으로 이루어져 작업별로 특화되어 있어 확장성이 떨어진다.
CARD 3 · METHOD
3 / 5
어떻게 풀었나
JIT-Agent는 주어진 작업에 맞게 에이전트 하네스를 즉시 생성하도록 훈련된 모델로, 하네스를 네 가지 모듈로 구성된 기계 생성 가능한 구조물로 형식화하고, 작업별 하네스 커스터마이징, 실행 안정성을 위한 하네스 수리, 그리고 과거 하네스 구성 저장소로부터 성능 신호를 학습하는 자체 진화 기능을 제공한다.
CARD 4 · RESULTS
4 / 5
결과와 의의
JIT-Agent의 지원을 받은 DeepSeek-V4-Flash는 DeepSearchQA에서 GPT-5.6 대비 +9.1, OdysseyBench에서 +4.3 포인트 향상을 달성했으며, GLM-5.2는 최대 +20.2 포인트 향상을 보였다. 또한 OpenCode, Claude Code 같은 성숙한 에이전트 런타임과 비교해 성능 경쟁력을 유지하면서 DeepSeek V4, Mimo-V2.5, Qwen3.6 등 다양한 모델 계열에서 지속적으로 성능을 개선했다.
!
이 연구는 하네스 지능을 모델 스케일링과 독립적인 에이전트 능력의 훈련 가능하고 전이 가능하며 복합적인 차원으로 확립함으로써, 에이전트 개발에서 새로운 패러다임을 제시한다. 하네스 설계를 자동화하는 첫 모델로서 임의의 LLM에 적용 가능한 범용적 해법을 제공한다.
— 의의