CARD 2 · PROBLEM
2 / 5
어떤 문제를 풀고 있나
기존 소프트웨어 엔지니어링 벤치마크들이 포화되고 있으며, 약 60%의 평가 인스턴스에서 결함 있는 테스트(지나치게 좁거나 넓은 테스트)가 발견되고 있다. 또한 frontier 모델들이 학습 데이터에서 정확히 복사한 패치를 재현할 수 있어 평가의 신뢰성이 저하되고 있다.
CARD 3 · METHOD
3 / 5
어떻게 풀었나
전문가가 엄격히 선별한 다중언어 코드 리팩토링 벤칙마크를 구축했으며, 7개 프로그래밍 언어(Python, Java, TypeScript, Go, C, C++, Rust)에서 추출한 170개의 실제 커밋을 기반으로 한다. 다단계 검증 과정을 통해 문제 설명을 재작성하고 테스트 스위트를 수동으로 검토하여 질 문제를 직접 해결했다.
CARD 4 · RESULTS
4 / 5
결과와 의의
평균 11.4개 수정 파일과 261.6줄의 코드를 포함하는 대규모 리팩토링 작업으로, frontier 모델들의 최고 성능이 41.2%의 해결율에 불과하여 벤치마크의 도전적이고 미포화 특성을 확인했다.
!
더욱 현실적이고 신뢰할 수 있는 AI 코딩 에이전트 평가를 가능하게 하며, 기존 벤치마크의 질 문제를 직접 해결함으로써 향후 AI 코딩 시스템 발전의 핵심 지표가 될 수 있다.
— 의의