CARD 2 · PROBLEM
2 / 5
어떤 문제를 풀고 있나
과학 발견을 위한 AI 시스템은 이질적인 양식의 과학적 증거를 추론하고, 과학 도구 및 환경과 상호작용하며, 장시간의 작업을 지속적으로 수행해야 한다. 그러나 이러한 다중 능력을 통합적으로 갖춘 모델의 개발이 미흡한 상황이다.
CARD 3 · METHOD
3 / 5
어떻게 풀었나
렌더링된 과학 문서, 이미지-텍스트 데이터, 다양한 과학 말뭉치를 활용한 과학 다중모달 사전학습으로 시작하여, 지도 미세조정, 확장 가능한 다중작업 강화학습, 검은색·흰색 상자 에이전틱 강화학습, 온폴리시 증류를 포함하는 통합 후학습 파이프라인을 적용했다. 또한 부분 롤아웃 오프폴리시 보정, 적응형 길이 정규화, 온라인 투기적 디코딩 등의 기법으로 학습 안정성과 효율성을 개선했으며, 397B 모델에서 시계열 모델링을 수치 예측까지 확장하고, 냉동된 397B 백본을 수정하지 않으면서 빠른 과학적 특화를 위해 메모리 디코더를 별도 경로로 도입했다.
CARD 4 · RESULTS
4 / 5
결과와 의의
Intern-S2-Preview-397B는 과학, 다중모달, 에이전틱, 범용 벤치마크 전반에서 경쟁력 있거나 선도적인 성능을 달성했으며, 시계열 모듈은 SciTS에서 과학 신호 이해와 예측을 개선하고, Intern-MemDec-4B 확장은 냉동 397B 백본 수정 없이 Biology-Instructions 평균 점수를 56.92에서 60.32로 향상시켰다.
!
이 모델은 다중모달 이해, 추론, 생성, 장기 에이전틱 작업을 통합적으로 수행하여 과학적 발견의 자동화를 가능하게 한다. 메모리 디코더와 같은 효율적인 확장 메커니즘은 기존 모델을 수정하지 않으면서 특정 과학 분야로의 빠른 적응을 실현한다.
— 의의