Audio-031, Multimodal Duplex Interaction Agent, Preprint 2026

Abstract

본 연구에서는 MiniCPM-o 4.5를 기반으로 하며, 비동기 에이전트 루프(asynchronous agent loop)를 통해 실시간 상호작용에 추가로 적응시킨 네이티브 멀티모달 듀플렉스 상호작용 모델 Gander를 제안한다. 기존의 턴 기반 시스템과 달리, Gander는 스트리밍되는 사용자 입력을 지속적으로 처리함으로써 일상적인 대화뿐만 아니라 복잡한 워크플로 중심의 에이전트 시나리오에서도 자연스러운 full-duplex 상호작용을 가능하게 한다. 사용자는 진행 중인 응답을 중단할 수 있으며, 모델 또한 상황에 따라 선제적으로 중간 피드백을 제공하거나 후속 질문을 할 수 있다. 

이러한 기능을 네이티브하게 지원하기 위해, Gander는 두 가지 핵심 아키텍처 설계를 채택한다.

  1. Cerebellum-Brain 협업 프레임워크: Cerebellum은 실시간 상호작용과 대화 응답성을 담당하고, Brain은 복잡한 추론과 상위 수준의 에이전트 작업을 담당한다. 두 구성 요소는 툴 호출(tool calling)과 에이전트 오케스트레이션 런타임(agent orchestration runtime)을 통해 지속적으로 상호작용한다. 

  2. Cerebellum은 스트리밍 Thinker-Talker 아키텍처를 기반으로 구축된다. 이 구조에서는 사용자 입력과 모델 출력을 청크(chunk) 수준에서 시간 순서대로 정렬된 하나의 토큰 스트림으로 평탄화(flatten)하여, 낮은 지연시간과 지속적인 상호작용을 위한 통합 표현을 제공한다. 

우리는 Gander를 대화 능력, 상호작용 능력, 이해 능력, 툴 보조 작업 수행 능력의 측면에서 평가한다. 내부 인간 평가 결과, Gander는 자연스럽고 표현력 있는 음성 대화를 유지하는 것으로 나타났으며, 벤치마크 결과에서는 효과적인 턴 테이킹 능력과 음성 질의응답 및 관련 이해 과제에서 유망한 성능을 보였다. 또한 Gander는 배경 소음 간섭, 다자간 상호작용, 백채널(backchannel) 커뮤니케이션을 포함한 다양한 도전적인 상호작용 환경을 지원한다. 

현재의 평가는 대표적인 대화 및 툴 보조 설정에 초점을 맞추고 있지만, 보다 광범위한 장기 에이전트 작업(long-horizon agent tasks) 및 더욱 다양한 배포 환경은 향후 연구를 위한 유망한 방향으로 남아 있다. 우리는 커뮤니티의 후속 연구와 개발을 촉진하기 위해 Gander와 함께 모델, 코드, 데이터를 공개한다. 

1. Introduction

대규모 언어 모델(LLM)은 주로 질의응답과 대화에 사용되는 언어 인터페이스(Yang et al., 2025)에서 점차 더 복잡한 작업을 수행할 수 있는 범용 에이전트(Anthropic, 2024; Singh et al., 2025; Yao et al., 2022)로 빠르게 발전하고 있다. 도구 사용, 환경과의 상호작용, 다단계 계획 및 실행을 통합함으로써, LLM 기반 에이전트(Team et al., 2026; Zeng et al., 2026)는 단순히 텍스트 응답을 생성하는 것을 넘어 외부 환경을 인식하고, 추론하며, 그에 대해 행동할 수 있다. 이러한 새로운 에이전트 패러다임은 LLM의 역할을 확장하여, 코딩과 도구 보조 문제 해결부터 워크플로 자동화에 이르기까지 다양한 응용을 가능하게 한다.

Figure 1 | Gander는 워크플로 지향 환경의 다단계 작업을 위해 실시간 상호작용형 커뮤니케이션과 비동기 에이전트 루프를 결합한다.

에이전트 능력이 빠르게 발전하고 있음에도 불구하고, 인간-AI 상호작용은 여전히 일반적으로 텍스트 기반의 턴 단위 커뮤니케이션을 중심으로 구성되어 있다. 이 방식에서는 사용자가 지시를 제공하면 모델이 개별적인 상호작용 주기마다 응답한다. 이러한 패러다임은 인간 간 의사소통의 유연하고 협력적인 특성과는 다르다. 인간 간 의사소통에서는 참여자들이 지속적으로 정보를 주고받고, 동시에 듣고 말하며, 맥락적 단서를 관찰하고, 진행 중인 상호작용을 유연하게 시작하거나 중단하거나 방향을 바꿀 수 있다. 따라서 보다 자연스럽고 효과적인 인간-AI 협업을 위해서는 AI 시스템이 기존의 요청-응답 방식에서 벗어나 상호작용 전반에 걸쳐 지속적으로 참여할 수 있어야 한다.

이러한 패러다임을 실현하기 위해서는 다음의 세 가지 상호보완적인 능력이 필요하다.

  1. 음성, 비전, 텍스트로부터 정보를 인식하고 이해하는 능력

  2. 자연스러운 실시간 커뮤니케이션을 지원하는 지속적이고, 저지연이며, 양방향적인 상호작용 능력

  3. 맥락적 추론, 계획, 도구 사용, 작업 실행을 위한 에이전트 능력

이러한 능력들은 함께, 동적인 환경에서 인간과 복잡한 작업을 협업하면서 인식하고, 소통하고, 추론하고, 행동할 수 있는 상호작용형 에이전트의 기반을 제공한다.

앞서 설명한 형태의 인간-AI 협업을 실현하려면 두 가지 중요한 질문이 제기된다. 첫째, 자연스러운 실시간 상호작용을 VAD(Xu et al., 2026b)나 ASR(An et al., 2025; Radford et al., 2023)과 같은 기존의 인식 및 상호작용 모듈을 조합하는 방식으로 어느 정도까지 달성할 수 있으며, 상호작용성을 어느 정도까지 모델 자체의 내재적 능력으로 모델링해야 하는가? 둘째, 시스템이 실시간 상호작용에 필요한 저지연 응답성을 제공하면서 동시에 복잡한 에이전트 작업에 필요한 장기적 추론 능력을 어떻게 유지할 수 있는가?

이러한 질문에 답하기 위해, 우리는 실시간 멀티모달 상호작용과 에이전트 추론을 결합하도록 설계된 비동기 에이전트 루프를 갖춘 듀플렉스 상호작용 모델 Gander를 제안한다.

  1. 우리는 상호작용성을 외부 오케스트레이션 파이프라인에서 전적으로 처리하는 것보다 상호작용 모델 내부에서 직접 모델링하는 것이 유리할 수 있다고 본다. 실제 인간-AI 상호작용에는 사용자의 자발적인 끼어들기, 에이전트 주도의 개입, 배경 소음이 있는 상황에서의 상호작용, 다자간 대화, 그리고 백채널 행동(예: “uh-huh”, “right”, “I see”와 같은 짧은 맞장구)이 포함된다. VAD(Silero, 2024)와 같이 독립적으로 설계된 모듈에 의존하는 파이프라인에서는 이러한 행동을 안정적으로 조정하기 어려울 수 있다.

더 중요한 점은, 상호작용성을 모델의 내재적 능력으로 모델링하면 대화 제어와 모델의 기반 능력을 하나의 통합된 프레임워크 안에서 함께 발전시킬 수 있다는 것이다. 이러한 원칙에 따라 Gander는 스트리밍 오디오-비주얼 입력과 모델이 생성한 텍스트 스트림을 시간적으로 정렬된 청크로 분할하고, 이를 하나의 통합된 자기회귀 시퀀스로 구성하여 공동으로 처리한다. 각 청크 내에서 모델은 명시적으로 들을지 말지를 예측하며, 이를 통해 상호작용 상태를 동적으로 제어하고 실시간으로 인식과 생성을 조정하는 방법을 학습한다.

  1. 실시간 대화형 상호작용과 복잡한 에이전트 워크플로는 서로 다른 계산 및 추론 요구사항을 가진다. 일상적인 대화에서는 즉각적인 응답과 지속적인 맥락 적응이 중요하지만, 복잡한 워크플로에는 더 긴 범위의 추론, 반복적인 계획, 도구 사용, 지속적인 실행이 포함될 수 있다. 이 두 가지를 하나의 단일 모델에서 모두 처리하려 하면 응답성과 추론 능력 사이에 긴장이 발생할 수 있다.

이 문제를 해결하기 위해, Huang et al. (2026), Lab (2026), Wu et al. (2025)의 접근을 따라, 우리는 실시간 상호작용과 비동기 장기 추론을 분리하는 최근의 접근과 개념적으로 유사한 Cerebellum-Brain 형태의 분리형 아키텍처를 채택한다. Gander에서 Cerebellum은 실시간 멀티모달 상호작용, 지속적인 인식, 반응성 높은 대화 제어를 담당하며, Brain은 복잡한 계획과 에이전트 작업 실행을 담당하는 더 높은 용량의 추론 모듈로 동작한다.

Cerebellum은 실시간 상호작용 맥락을 지속적으로 유지하면서, 필요할 때 tool call을 통해 Brain을 선택적으로 호출하고, 누적된 텍스트 맥락, 음성 전사 결과, 시각 프레임을 전달한다. Brain은 이후 비동기적으로 더 깊은 추론을 수행하며, 중간 요약, 계획, 또는 최종 결과를 Cerebellum에 반환할 수 있다. Cerebellum은 이러한 출력을 현재 진행 중인 상호작용에 통합한다.

중요한 점은 Brain이 Gander 내부에서 추가적인 학습을 필요로 하지 않는 플러그 앤 플레이 구성 요소로 설계되었다는 것이다. 따라서 핵심 상호작용 모델을 다시 학습하지 않고도 서로 다른 추론 백엔드나 더 강력한 추론 백엔드를 통합할 수 있다. 이러한 설계는 실시간 상호작용 모델을 유지하면서 추론 능력을 향상시킬 수 있는 모듈식 경로를 제공한다.

재현성을 위해, 우리는 MiniCPM-o 4.5(Cui et al., 2026)를 상호작용 모델의 초기화 모델로 사용하여 Gander를 구성하고, 최근의 스트리밍 음성 언어 시스템(Team, 2026; Xu et al., 2025b)과 관련된 Thinker-Talker 아키텍처와 Codex 기반 추론 백엔드를 채택한다. Figure 1에 나타난 것처럼 대화, 상호작용, 멀티모달 이해, 에이전트 데이터로 학습함으로써, Gander는 대화, 멀티모달 이해, 실시간 상호작용, 도구 보조 에이전트 작업 전반에서 경쟁력 있는 성능을 보인다. 또한 시각적 맥락을 이용해 모호한 지시 대상을 해소하는 것과 같은 유용한 맥락 의존적 행동도 보여준다.

듀플렉스 상호작용 에이전트의 상호보완적인 능력을 평가하기 위해, 우리는 최근의 실시간 상호작용 시스템(Hurst et al., 2024; OpenAI, 2026)에서 사용된 평가 방식을 따르며, Full-Duplex-Bench, SpokenQA, WorldSense와 같은 기존 벤치마크의 결과와 함께 대화의 자연스러움에 대한 내부 인간 평가 및 프로젝트 웹사이트의 정성적 상호작용 예시를 보고한다. 우리는 커뮤니티의 연구를 촉진하기 위해 데이터, 코드, 모델을 공개한다.

본 연구의 기여는 다음과 같이 요약된다.

(1) 우리는 비동기 에이전트 루프를 갖춘 듀플렉스 상호작용 모델 Gander를 제안한다. 이 모델은 추론 능력을 모듈 방식으로 확장할 수 있도록 지원하며, 실시간 상호작용과 장기적인 에이전트 추론을 연결한다.

(2) Tool call 피드백과 청크 기반 스트리밍을 사용하는 Cerebellum-Brain 협업 프레임워크를 기반으로, Gander는 끼어들기, 선제적 상호작용, 배경 간섭에 대한 강건성, 다자간 상호작용, 백채널 커뮤니케이션, 추론, 도구 보조 작업 실행을 포함한 폭넓은 상호작용 능력을 보여준다.

(3) 우리는 듀플렉스 상호작용 에이전트에 대한 공개 연구와 후속 개발을 촉진하기 위해 Gander의 모델 가중치, 코드, 데이터를 공개한다.



















Reference

댓글