Audio-028, Raon-Speech Technical Report, Preprint 2026
Abstract 본 논문에서는 영어 및 한국어 음성의 이해, 질의응답, 생성을 위한 최고 수준의 90억 파라미터 음성 언어 모델(Speech Language Model; SpeechLM)인 Raon-Speech 와, 자연스러운 실시간 대화를 지원하는 고성능 풀듀플렉스 확장 모델 Raon-SpeechChat 을 제안한다. Raon-Speech는 사전학습된 대규모 언어 모델(LLM)의 강력한 텍스트 능력을 유지하면서, 음성을 이해하고 생성할 수 있는 SpeechLM으로 성공적으로 확장한다. Raon-Speech는 엄선된 영어 및 한국어 음성·텍스트 데이터 138만 시간으로 학습되며, 다음의 세 단계 학습 과정을 거친다. (1) 음성 모듈 정렬, (2) 지식 증류를 활용한 엔드투엔드 SpeechLM 사전학습, (3) 다중 과업 선호도 최적화 기반 후속 학습. 영어 및 한국어 음성과 텍스트를 포함하는 42개 벤치마크에서, Raon-Speech는 Qwen2.5-Omni와 Fun-Audio-Chat을 비롯한 최근의 유사 규모 오디오 파운데이션 모델 8개와 비교했을 때 음성 중심 과업에서 가장 강력한 종합 성능을 보였으며, 동시에 우수한 텍스트 질의응답 성능을 유지하였다. 이를 기반으로 한 Raon-SpeechChat은 시간 정렬된 실제 및 합성 대화 데이터 11만 9천 시간을 이용한 지속 학습을 통해 자연스러운 풀듀플렉스 대화를 지원한다. 학습은 다음의 상호보완적인 세 단계로 구성된다. (1) 인과적 인코더 적응, (2) 풀듀플렉스 사전학습, (3) 음성 및 역할 제어를 위한 풀듀플렉스 미세조정. 여러 풀듀플렉스 벤치마크에서 Raon-SpeechChat은 FDB v1.0이 평가하는 턴테이킹 및 사용자 끼어들기에 민감한 행동에서 가장 뚜렷한 강점을 보였으며, 더 광범위한 풀듀플렉스 평가에서도 경쟁력 있는 성능을 유지하였다. 저자들은 모든 모델 체크포인트, 학습 및 추론 파이프라인, 그리고 인터랙티브 데모를 오픈소스로 공개한다. 1. 서론 음성은 인간의 인지에서 중심적인 역...