Audio-031, Multimodal Duplex Interaction Agent, Preprint 2026
Abstract 본 연구에서는 MiniCPM-o 4.5 를 기반으로 하며, 비동기 에이전트 루프(asynchronous agent loop)를 통해 실시간 상호작용에 추가로 적응시킨 네이티브 멀티모달 듀플렉스 상호작용 모델 Gander 를 제안한다. 기존의 턴 기반 시스템과 달리, Gander는 스트리밍되는 사용자 입력을 지속적으로 처리함으로써 일상적인 대화뿐만 아니라 복잡한 워크플로 중심의 에이전트 시나리오에서도 자연스러운 full-duplex 상호작용 을 가능하게 한다. 사용자는 진행 중인 응답을 중단할 수 있으며, 모델 또한 상황에 따라 선제적으로 중간 피드백을 제공하거나 후속 질문을 할 수 있다. 이러한 기능을 네이티브하게 지원하기 위해, Gander는 두 가지 핵심 아키텍처 설계를 채택한다. Cerebellum-Brain 협업 프레임워크 : Cerebellum은 실시간 상호작용과 대화 응답성을 담당하고, Brain은 복잡한 추론과 상위 수준의 에이전트 작업을 담당한다. 두 구성 요소는 툴 호출(tool calling)과 에이전트 오케스트레이션 런타임(agent orchestration runtime)을 통해 지속적으로 상호작용한다. Cerebellum은 스트리밍 Thinker-Talker 아키텍처 를 기반으로 구축된다. 이 구조에서는 사용자 입력과 모델 출력을 청크(chunk) 수준에서 시간 순서대로 정렬된 하나의 토큰 스트림으로 평탄화(flatten)하여, 낮은 지연시간과 지속적인 상호작용을 위한 통합 표현을 제공한다. 우리는 Gander를 대화 능력, 상호작용 능력, 이해 능력, 툴 보조 작업 수행 능력 의 측면에서 평가한다. 내부 인간 평가 결과, Gander는 자연스럽고 표현력 있는 음성 대화를 유지하는 것으로 나타났으며, 벤치마크 결과에서는 효과적인 턴 테이킹 능력과 음성 질의응답 및 관련 이해 과제에서 유망한 성능을 보였다. 또한 Gander는 배경 소음 간섭, 다자간 상호작용, 백채널(backchannel) ...