CARD 2 · PROBLEM
2 / 5
어떤 문제를 풀고 있나
과학 소프트웨어의 결함은 프로그램 동작뿐만 아니라 과학적 결론의 증거까지 훼손할 수 있음에도, 기존 코딩 에이전트 평가는 집계된 작업 성공률에만 집중하여 과학 소프트웨어 수정 실패의 원인을 파악하기 어렵다.
CARD 3 · METHOD
3 / 5
어떻게 풀었나
20개 과학 영역의 98개 GitHub 저장소에서 119개 작업을 수집하여 SWE-bench Science 벤치마크를 구축했으며, 각 작업을 Issue-driven, Expert-exploratory, Engineering-integration의 세 가지 패러다임으로 분류했다. 또한 명시적 과학 지식을 제거한 상태에서의 ablation 실험을 수행하여 과학 지식이 수리에 미치는 영향을 분석했다.
CARD 4 · RESULTS
4 / 5
결과와 의의
최고 성능 에이전트인 Claude Code with Opus-5도 pass@1이 50% 미만에 불과했으며, 과학 지식 부족, 탐색 오류, 불완전한 수리, 일반화 실패 등 네 가지 주요 실패 메커니즘을 식별했다. 실험 결과 과학 지식이 항상 도움이 되는 것은 아니며, 부정확한 지식은 anchoring을 유발하고 정확한 수리 성공률을 높이지 못함을 보였다.
!
본 연구는 과학 소프트웨어 엔지니어링 분야에서 코딩 에이전트의 능력과 한계를 체계적으로 평가할 수 있는 포괄적 벤치마크를 제공하며, 과학 도메인에 특화된 AI 에이전트 개발을 위한 방향성을 제시한다.
— 의의