Audio-028, Raon-Speech Technical Report, Preprint 2026

이미지
QA 입/출력 예시  모델입력 모델출력 시간 이전 어시스턴트 텍스트 출력 유저입력 이전 어시스턴트 음성출력 텍스트 출력 음성 출력 t0 [user speech emb_0] [initial codec emb_0] [SIL] [assistan codec emb_1] t1 [user speech emb_1] [assistan codec emb_1] [SIL] [assistan codec emb_2] t2 [user speech emb_2] [assistan codec emb_2] [SIL] [assistan codec emb_3] t3 [user speech emb_3] [assistan codec emb_3] 조선은 [assistan codec emb_4] t4 조선은 [user speech emb_4] [assistan codec emb_4] [PAD] [assistan codec emb_5] t5 [user speech emb_5] [assistan codec emb_5] [PAD] [assistan codec emb_6] t6 [user speech emb_6] [assistan codec emb_6] 1392년에 [assistan codec emb_7] t7 1392년에 [user speech emb_7] [assistan codec emb_7] [PAD] [assistan codec emb_8] t8 [user speech emb_8] [assistan codec emb_8] [PAD] [assistan codec emb_9] t9 [user speech emb_9] [assistan codec emb_9] 건국되었습니다. [assistan codec emb_10] t10 건국되었습니다. [user speech emb_10] [assistan codec emb_10] [PAD] [assistan codec emb_11] t11 [user speech emb_11] [assistan codec emb_11] [PAD] [assistan codec e...

Audio-027, KAME: Tandem Architecture for Enhancing Knowledge in Real-Time Speech-to-Speech Conversational AI, ICASSP 2026

이미지
◼ Comment 이 논문도 방법은 MoshiRAG랑 비슷한데, 먼저 나온 논문이다. 일단 학습 데이터는 어떻게 만들었는지 자세히는 안 써있지만 일반 QA(MMLU-pro, GSM8K, HSSBench) 를 기반으로 대화 데이터를 합성하고 여기서 중간중간 llm 결과 (simulator로 부름)를 받아온 데이터를 만들었음 모델 학습 유저 중간 중간 입력에 대해 만든 llm 백그라운드 모델 결과를 그냥 embedding 단에서 더해서 학습하게 함 단점 백그라운드 결과의 각 토큰을 그대로 쓰다보니 moshirag가 언급한 컨텍스트가 길어지는 문제가 해결되지 않음 그리고 trigger이 없고, reflector 또한 없기 때문에, 그냥 첫 응답시 그냥 과거 정보로 추출한 백그라운드 결과를 사용함 그러다가 새로운 백그라운드 결과가 들어오면 그걸 처음부터 다시 사용 이런식이다 보니 중복된 결과가 많이 들어올거 같은 문제가 들음 음성모델 응답또한 실제로 제대로 나오는지 의문? 그냥 정답 자체는 계속 정보가 들어오니 언젠간 나올거 같긴한데, 자연스러운 대화가 아닐거 같음 ABSTRACT 실시간 음성-대-음성(Speech-to-Speech, S2S) 모델은 자연스럽고 지연 시간이 짧은 대화 응답을 생성하는 데 뛰어나지만, 깊이 있는 지식과 의미적 이해가 부족한 경우가 많다. 반면 자동 음성 인식, 텍스트 기반 대규모 언어 모델(LLM), 그리고 텍스트-대-음성 합성을 결합한 캐스케이드 시스템은 더 우수한 지식 표현 능력을 제공하지만, 높은 지연 시간으로 인해 자연스러운 상호작용의 흐름을 방해한다. 본 논문에서는 이러한 두 패러다임 사이의 격차를 해소하기 위한 새로운 하이브리드 아키텍처를 제안한다. 제안하는 프레임워크는 즉각적인 응답성을 확보하기 위해 사용자의 음성을 S2S Transformer로 처리하는 동시에, 해당 질의를 강력한 백엔드 LLM으로 전달한다. 이후 LLM이 생성한 텍스트 응답을 실시간으로 주입하여 S2S 모델의 음성 생성을 유도한다. 이를 통해 캐스케이드 ...