Audio-030, MiniCPM-o 4.5: Towards Real-Time Full-Duplex Omni-Modal Interaction, Preprint 2026
Abstract 최근 멀티모달 대규모 언어 모델(MLLM)의 발전으로 AI의 능력은 정적인 오프라인 데이터 처리에서 실시간 스트리밍 상호작용으로 확장되었지만, 여전히 인간 수준의 멀티모달 상호작용과는 큰 격차가 존재한다. 핵심적인 병목은 더 이상 모달리티의 범위나 지연 시간 자체가 아니라, 상호작용 패러다임 그 자체에 있다. 첫째, 지각과 응답은 여전히 번갈아 수행되는 단계로 분리되어 있어, 모델이 생성 중 새롭게 들어오는 입력을 반영하여 적시에 조정하는 것을 방해한다. 둘째, 현재 대부분의 모델은 여전히 반응적으로 동작하며, 변화하는 멀티모달 환경에서 능동적으로 행동하기보다는 사용자의 명시적인 요청에만 응답한다. 우리는 인간과 유사한 멀티모달 상호작용을 향한 최신 시도인 MiniCPM-o 4.5를 제시하며, 이는 실시간 full-duplex omni-modal interaction을 통해 이러한 격차를 완화한다. MiniCPM-o 4.5는 실시간으로 동시에 보고, 듣고, 말할 수 있으며, 실시간 장면에 대한 지속적인 이해를 바탕으로 리마인더를 제공하거나 코멘트를 하는 등의 능동적인 행동도 수행한다. MiniCPM-o 4.5의 핵심 기술은 Omni-Flow로, omni-modal 입력과 출력을 하나의 공유된 시간축을 따라 정렬하는 통합 스트리밍 프레임워크이다. 이러한 구성은 기존의 turn-based 상호작용을 full-duplex의 시간 정렬된 프로세스로 변환하여, 지각과 응답을 동시에 수행할 수 있게 하고 동일한 프레임워크 내에서 능동적 행동이 나타날 수 있도록 한다. 총 9B 파라미터를 갖는 MiniCPM-o 4.5는 vision-language 능력에서 Gemini 2.5 Flash에 근접하며, 해당 규모의 오픈소스 모델 중 state-of-the-art 성능을 달성한다. 또한 omni-modal understanding에서 Qwen3-Omni-30B-A3B를 능가하고, 훨씬 높은 계산 효율성과 함께 더 나은 speech generation 성능을 제공...