CARD 2 · PROBLEM
2 / 5
어떤 문제를 풀고 있나
과학 AI 에이전트가 데이터 분석, 코드 실행, 연구 산출물을 생성하지만, 기존 벤치마크는 최종 답변, 독립적 프로그램, 또는 단일 도메인에만 중점을 두고 있다. 다양한 과학 분야에서 종단간 워크플로우의 완전한 수행 능력을 종합적으로 평가할 방법이 필요하다.
CARD 3 · METHOD
3 / 5
어떻게 풀었나
6개 과학 분야(양자화학, 분자동역학, 재료특성화, 분석화학, 생명과학, 전기화학/환경)에 걸친 97개의 종단간 과학 워크플로우로 구성된 FrontierChallenge 벤치마크를 구축했다. 12개의 최신 AI 모델과 3개의 에이전트 구조를 평가하며, 전체 완성 기준을 만족하는 작업의 비율(Pass Rate)과 부분적 진행도(Avg. Score)를 측정했다.
CARD 4 · RESULTS
4 / 5
결과와 의의
최고 성능 구성도 97개 작업 중 20개만 완료하여 Pass Rate는 20.6%에 불과했다. 분석화학과 전기화학/환경 분야에서는 부분 점수(각각 87.6, 94.9)가 높았음에도 Pass Rate는 4%, 0%에 그쳤으며, Claude Code 궤적의 75.5%는 완료를 주장하는 언어로 끝났다.
!
이 연구는 높은 부분 점수나 완료 주장이 과학 작업의 실제 완전한 수행을 보장하지 않음을 보여주며, 종단간 워크플로우 실행과 과학적 산출물의 완전성을 함께 평가해야 함을 강조한다. 이는 실제 과학 연구 맥락에서 AI 에이전트의 실질적 유용성을 평가하는 데 중요한 기준을 제시한다.
— 의의