글

Audio-031, Multimodal Duplex Interaction Agent, Preprint 2026

Abstract 본 연구에서는 MiniCPM-o 4.5 를 기반으로 하며, 비동기 에이전트 루프(asynchronous agent loop)를 통해 실시간 상호작용에 추가로 적응시킨 네이티브 멀티모달 듀플렉스 상호작용 모델 Gander 를 제안한다. 기존의 턴 기반 시스템과 달리, Gander는 스트리밍되는 사용자 입력을 지속적으로 처리함으로써 일상적인 대화뿐만 아니라 복잡한 워크플로 중심의 에이전트 시나리오에서도 자연스러운 full-duplex 상호작용 을 가능하게 한다. 사용자는 진행 중인 응답을 중단할 수 있으며, 모델 또한 상황에 따라 선제적으로 중간 피드백을 제공하거나 후속 질문을 할 수 있다.  이러한 기능을 네이티브하게 지원하기 위해, Gander는 두 가지 핵심 아키텍처 설계를 채택한다. Cerebellum-Brain 협업 프레임워크 : Cerebellum은 실시간 상호작용과 대화 응답성을 담당하고, Brain은 복잡한 추론과 상위 수준의 에이전트 작업을 담당한다. 두 구성 요소는 툴 호출(tool calling)과 에이전트 오케스트레이션 런타임(agent orchestration runtime)을 통해 지속적으로 상호작용한다.  Cerebellum은 스트리밍 Thinker-Talker 아키텍처 를 기반으로 구축된다. 이 구조에서는 사용자 입력과 모델 출력을 청크(chunk) 수준에서 시간 순서대로 정렬된 하나의 토큰 스트림으로 평탄화(flatten)하여, 낮은 지연시간과 지속적인 상호작용을 위한 통합 표현을 제공한다.  우리는 Gander를 대화 능력, 상호작용 능력, 이해 능력, 툴 보조 작업 수행 능력 의 측면에서 평가한다. 내부 인간 평가 결과, Gander는 자연스럽고 표현력 있는 음성 대화를 유지하는 것으로 나타났으며, 벤치마크 결과에서는 효과적인 턴 테이킹 능력과 음성 질의응답 및 관련 이해 과제에서 유망한 성능을 보였다. 또한 Gander는 배경 소음 간섭, 다자간 상호작용, 백채널(backchannel) ...

Audio-030, MiniCPM-o 4.5: Towards Real-Time Full-Duplex Omni-Modal Interaction, Preprint 2026

이미지
◼ Comment 최근에는 MiniCPM을 기반으로 연구들이 진행되고 있어서 한번 이해하고 넘어가보자 일단 이 모델은 단순히 텍스트-오디오 Full duplex 모델만 지원하는 형태가 아니고, 비전도 이해하는 모델이다  비전도 스트리밍 사이즈는 9B 아키텍쳐 주요 요소 (1) visual 및 audio 입력을 streaming 방식으로 처리하는 multimodal encoder,  (2) omni-modal understanding과 text generation을 수행하는 LLM backbone,  (3) discrete speech token을 autoregressive하게 생성하는 interleaved speech token decoder와 speech token을 audio waveform으로 변환하는 streaming flow-matching decoder를 포함하는 speech decoder이다.  Vision Encoding은 본문 참고 Audio Encoding 오디오가 들어오면, 초당 50개의 feature continuous embedding을 뽑는다. 이 50개를 two-layer MLP 태워서 10개의 continuous embedding을 만들어서 LLM에 넣는다. 10Hz 느낌 근데 오디오 인코더는 앞의 컨텍스트를 볼텐데 몇초씩 윈도우 슬라이딩을 하는건가? (이건 안나와있음) Text Encoding Qwen3 8B가 텍스트 토큰을 생성하고 생성된 각 text token에 대응하는 LLM hidden state를 speech decoder에 넘긴다 25 speech token/sec을 생성함 (아래에서 이어서 설명) 여기서 텍스트 토큰 생성과 speech 토큰 생성 시간을 고려하면, 텍스트 생성은 초당 3-4 텍스트 토큰이 생성되야함.  학습데이터가 텍스트와 speech 토큰을 시간으로 얼라인 하는 포맷인거 같음 (word align 같은) Speech Token Generation 위에서 말한...

NL-377, LLM Agents Already Know When to Call Tools - Even Without Reasoning, Preprint 2026

https://chatgpt.com/share/6a9532c4-9bfc-83ee-b862-74d3ccc63dba Reference https://arxiv.org/pdf/2605.09252

NL-366, SMART: Self-Aware Agent for Tool Overuse Mitigation, Findings of ACL 2025

https://chatgpt.com/share/6a8fd187-4b18-83ee-8bd6-246bf9221440 Reference https://arxiv.org/pdf/2502.11435

NL-366, ToolLLM: Facilitating Large Language Models to Master 16000+ Real-world APIs, ICLR 2024

https://chatgpt.com/share/6a8e92f5-4d98-83ee-bc7e-fa26870b2656 [User] 친구 생일 선물을 고르고 싶어. 친구가 헤일리 스타인펠드를 좋아해. 최근 작품을 참고해서 관련 굿즈를 추천해줘. [Available APIs] - actor_info(name) - movie_details(title) - merchandise_search(keyword) (인퍼런스시 top-5 api retriver에서 찾아오는 개념) [Assistant] Thought: 먼저 배우의 최근 작품을 알아봐야겠다. API: actor_info Args: {"name": "Hailee Steinfeld"} [API Observation] {"recent_movies": ["Spider-Man: Across the Spider-Verse", ...]} [Assistant] Thought: 최근 작품의 캐릭터 정보를 확인해야겠다. API: movie_details Args: {"title": "Spider-Man: Across the Spider-Verse"} [API Observation] {"role": "Gwen Stacy / Spider-Woman", ...} Reference https://arxiv.org/pdf/2307.16789  

NL-365, ToolkenGPT: Augmenting Frozen Language Models with Massive Tools via Tool Embeddings, NeurIPS 2023

https://chatgpt.com/share/6a8e8886-9598-83ee-9162-83a2599dac94 Reference https://arxiv.org/pdf/2305.11554

Audio-029, PersonaPlex: Voice and Role Control for Full Duplex Conversational Speech Models, ICASSP 2026

이미지
◼ Comment 연구의 시작은 Full-duplex 모델의 어시스턴트 음성이 항상 고정되어 있기 때문에, 원하는 화자의 목소리를 입히고 싶어하는 듯 근데 생성된 오디오 토큰에 persona TTS을 입히면 안되나? 방법론은 그냥 프롬프트 넣는다는 것인데, 학습없이 사용하면 이게 잘 안되나봄? 그래서 voice prompt / text prompt 을 넣고 이것에 맞게 모델이 음성을 생성하도록 학습했다는 것 이때 user audio 채널은 440Hz 사인파를 넣었다고 함. (zero 값 대신 사용하는 듯) 따라서 학습 데이터가 필요하고 이는 합성 데이터로 만듬 기본적으로 대화 스크립트는 Qwen-3-32B, GPT-OSS-120B을 사용해서 만듬 서비스 도메인을 샘플링하고, 해당 도메인에서 시나리오 선택하고 설명을 줘서 만듬 예) 레스토랑에서 환불하는 시나리오 QA을 만들기 위한 텍스트 LLM prompt는  “당신은 현명하고 친근한 선생님입니다. 질문에 답하거나 조언을 제공할 때 명확하고 흥미롭게 설명하세요.” 로 고정함 Customer service을 만들기 위한 텍스트 LLM prompt는 시나리오에 맞는 프롬프트가 있음 TTS는 VoxCeleb, Libriheavy, LibriTTS, CommonAccent, Fisher 등을 이용해서 화자별 음성을 가져옴 (single-speaker voice sample) 대화 음성을 위해서는 Multi-speaker TTS (Dia)을 사용했다고 하는데, 이 모델은 speaker A, B 레퍼런스 보이스를 받아서 대화를 자연스럽게 만들 수 있다고 함 질의 응답 시나리오 오디오는 chatterbox TTS을 사용했다고 하는데, 이거는 single-speaker TTS로 사용한듯 학습 데이터는 105,410 대화, 1,840 시간의 고객 서비스 대화와 39,322개의 대화로 구성된 410시간의 일반적인 QA 이러한 모델을 평가하는 벤치마크가 없음 기존에는 FDB는 그냥 full-duplex 벤치마크로 ...