CARD 2 · PROBLEM
2 / 5
어떤 문제를 풀고 있나
애니메이션 더빙, 오디오 드라마, 영화, 광고, 게임, 팟캐스트 등 다양한 미디어 제작에서 참고 음성 없이 음성을 설계하고, 자연어로 화자 스타일을 제어하며, 음향 환경과 효과를 지원하고, 설계된 음성을 재사용할 수 있는 다중 화자 음성 및 오디오 생성 기술이 필요하다.
CARD 3 · METHOD
3 / 5
어떻게 풀었나
데이터와 모델 양측면에서 문제를 해결하였다. SwanData-Caption으로 원본 음성 및 오디오 데이터를 정제하고 합성 커버리지를 추가하며 다양하고 정확한 다단계 캡션을 주석 처리하였다. SwanTale 모델에서는 SwanVAE를 통해 고품질 다중 음향 모달리티 생성을 지원하고, 보상 조건부 품질 제어 및 Engram 조건화, Unified MoE를 적용하여 다중 작업 및 다중 음향 모달리티 모델링을 수행하였으며, 커리큘럼 학습과 GRPO 사후 학습을 통해 점진적 역량 강화를 이루었다.
CARD 4 · RESULTS
4 / 5
결과와 의의
SwanTale은 영샷 및 지시 작업의 여러 핵심 평가 지표에서 최고 성능을 달성하였으며, 양 작업 모두에서 최고의 표현력 점수를 얻었다. 다중 화자 음성과 오디오를 포함하는 복잡한 지시 생성 작업을 성공적으로 지원한다.
!
이 연구는 실제 미디어 제작 환경에서 필요한 음성 및 오디오 생성의 유연성과 표현력을 획기적으로 향상시킨다. 영샷과 지시 두 가지 작업을 동시에 지원함으로써 창작자들의 음성 설계 자유도를 크게 확대한다.
— 의의