Audio-030, MiniCPM-o 4.5: Towards Real-Time Full-Duplex Omni-Modal Interaction, Preprint 2026

◼ Comment

  • 최근에는 MiniCPM을 기반으로 연구들이 진행되고 있어서 한번 이해하고 넘어가보자
  • 일단 이 모델은 단순히 텍스트-오디오 Full duplex 모델만 지원하는 형태가 아니고, 비전도 이해하는 모델이다 
    • 비전도 스트리밍
    • 사이즈는 9B
  • 아키텍쳐 주요 요소
    • (1) visual 및 audio 입력을 streaming 방식으로 처리하는 multimodal encoder, 
    • (2) omni-modal understanding과 text generation을 수행하는 LLM backbone, 
    • (3) discrete speech token을 autoregressive하게 생성하는 interleaved speech token decoder와 speech token을 audio waveform으로 변환하는 streaming flow-matching decoder를 포함하는 speech decoder이다. 
  • Vision Encoding은 본문 참고
  • Audio Encoding
    • 오디오가 들어오면, 초당 50개의 feature continuous embedding을 뽑는다.
    • 이 50개를 two-layer MLP 태워서 10개의 continuous embedding을 만들어서 LLM에 넣는다. 10Hz 느낌
    • 근데 오디오 인코더는 앞의 컨텍스트를 볼텐데 몇초씩 윈도우 슬라이딩을 하는건가? (이건 안나와있음)
  • Text Encoding
    • Qwen3 8B가 텍스트 토큰을 생성하고
    • 생성된 각 text token에 대응하는 LLM hidden state를 speech decoder에 넘긴다
      • 25 speech token/sec을 생성함
      • (아래에서 이어서 설명)
    • 여기서 텍스트 토큰 생성과 speech 토큰 생성 시간을 고려하면, 텍스트 생성은 초당 3-4 텍스트 토큰이 생성되야함. 
      • 학습데이터가 텍스트와 speech 토큰을 시간으로 얼라인 하는 포맷인거 같음 (word align 같은)
  • Speech Token Generation
    • 위에서 말한대로 생성된 text token이랑 그 직전 hidden state 을 넘겨서 speech 생성하는 식
      • text token + 대응 LLM hidden state를 작은 0.3B speech decoder에 전달
    • 여기서 사용하는 토큰은 cosyvoice에서 언급하는 s3 token이라고 함
      • s3=semantic token이라 보면되는듯
      • 걍 cosyvoice tokenizer 썼다고 이해하면 될거 같은데
  • 입력은 A(audio), V(video) stream이 들어고 이것이 continuous embedding이 들어오고
    • 출력은 텍스트 토큰이 기본적으로 나오고
    • 이를 활용하여 qwen talker 태우듯이, 오디오 토큰을 따로 뽑음 (Cosyvoice)
    • 이를 오디오로 복원하는 형태
    • 이렇게 텍스트와 오디오가 병렬적으로 진행되는데, 이것에 대한 align은 toekn-align해서 맞추는 형태
    • 근데 인퍼런스시에는 이 속도 align이 안맞을 수 있기 때문에 TAIL을 도입함
      • TAIL(Time-Aligned Interleaving)은 **텍스트 생성 속도와 실제 음성 재생 속도가 어긋나는 문제를 줄이기 위한 방식**이다. 각 시간 chunk마다 고정된 text:speech 비율을 쓰는 대신, 지금까지의 **누적 speech playback 진행도**를 보고 이번 chunk에서 얼마나 많은 텍스트를 생성할지 조절한다. 예를 들어 1초 동안 생성한 텍스트를 실제로 말하는 데 1.3초가 걸려 음성이 뒤처졌다면, 다음 1초 chunk에서는 텍스트를 덜 생성해 speech가 현재 시간축을 따라잡도록 한다. 이렇게 해서 텍스트가 음성보다 계속 앞서 나가면서 오래된 내용을 늦게 말하는 현상을 줄인다. 
  • 그 외 몇개 ablation 실험한거 있는데 본문 참고

Abstract

최근 멀티모달 대규모 언어 모델(MLLM)의 발전으로 AI의 능력은 정적인 오프라인 데이터 처리에서 실시간 스트리밍 상호작용으로 확장되었지만, 여전히 인간 수준의 멀티모달 상호작용과는 큰 격차가 존재한다. 핵심적인 병목은 더 이상 모달리티의 범위나 지연 시간 자체가 아니라, 상호작용 패러다임 그 자체에 있다. 첫째, 지각과 응답은 여전히 번갈아 수행되는 단계로 분리되어 있어, 모델이 생성 중 새롭게 들어오는 입력을 반영하여 적시에 조정하는 것을 방해한다. 둘째, 현재 대부분의 모델은 여전히 반응적으로 동작하며, 변화하는 멀티모달 환경에서 능동적으로 행동하기보다는 사용자의 명시적인 요청에만 응답한다. 우리는 인간과 유사한 멀티모달 상호작용을 향한 최신 시도인 MiniCPM-o 4.5를 제시하며, 이는 실시간 full-duplex omni-modal interaction을 통해 이러한 격차를 완화한다. MiniCPM-o 4.5는 실시간으로 동시에 보고, 듣고, 말할 수 있으며, 실시간 장면에 대한 지속적인 이해를 바탕으로 리마인더를 제공하거나 코멘트를 하는 등의 능동적인 행동도 수행한다. MiniCPM-o 4.5의 핵심 기술은 Omni-Flow로, omni-modal 입력과 출력을 하나의 공유된 시간축을 따라 정렬하는 통합 스트리밍 프레임워크이다. 이러한 구성은 기존의 turn-based 상호작용을 full-duplex의 시간 정렬된 프로세스로 변환하여, 지각과 응답을 동시에 수행할 수 있게 하고 동일한 프레임워크 내에서 능동적 행동이 나타날 수 있도록 한다. 총 9B 파라미터를 갖는 MiniCPM-o 4.5는 vision-language 능력에서 Gemini 2.5 Flash에 근접하며, 해당 규모의 오픈소스 모델 중 state-of-the-art 성능을 달성한다. 또한 omni-modal understanding에서 Qwen3-Omni-30B-A3B를 능가하고, 훨씬 높은 계산 효율성과 함께 더 나은 speech generation 성능을 제공한다. 효율적인 아키텍처 설계와 추론 최적화에 힘입어, 이 모델은 12GB 미만의 RAM을 사용하는 edge device에서도 실시간 full-duplex omni-modal interaction을 수행할 수 있다. 더 중요하게는, MiniCPM-o 4.5는 유망한 흐름의 대표적인 사례로 볼 수 있다(Figure 2). 멀티모달 파운데이션 모델은 인간과 유사한 상호작용 패러다임을 향해 나아가고 있으며, 가까운 미래에는 동적으로 변화하는 omni-modal 세계와 상호작용할 수 있을 것으로 기대된다.

1 Introduction

멀티모달 대규모 언어 모델(MLLM)의 발전으로 이미지, 음성, 비디오, 텍스트를 아우르는 점점 더 풍부한 상호작용이 가능해졌으며, AI 시스템은 보다 자연스러운 형태의 의사소통에 가까워지고 있다 [1, 2, 3, 4] (Figure 2). 

인간과 유사한 상호작용을 향한 주요 과제는 이제 더 이상 모달리티의 범위나 응답 지연 시간 자체가 아니라, 그 기반이 되는 상호작용 패러다임이다. 현재 모델에서는 지각과 응답이 여전히 번갈아 수행되는 단계에 제한되어 있어, Figure 3에 나타난 것처럼 생성 중 새롭게 들어오는 정보를 지속적으로 반영하여 적시에 조정하기 어렵다. 또한 모델의 행동은 계속해서 엄격하게 요청에 의해 주도되며, 변화하는 멀티모달 환경으로부터 능동적으로 시작되지는 않는다.

이 문제를 해결하려면 turn-based의 수동적인 응답 생성에서 벗어나 지속적이고 능동적인 상호작용으로 나아가야 한다. 

  • 첫째, 지각과 응답은 시간에 따라 token-level에서 지속적으로 결합되어 있어야 하며, 이를 통해 듣기, 보기, 말하기, 쓰기가 직렬화된 파이프라인으로 강제되는 대신 병렬로 진행될 수 있어야 한다. 
  • 둘째, 상호작용은 순수하게 반응적인 방식보다는 문맥에 의해 더 많이 주도되어야 한다. 명시적인 사용자 트리거를 기다리는 대신, 보다 인간과 유사한 모델은 실시간 장면 설명을 제공하거나 리마인더를 제시하는 것처럼 지속적으로 주어지는 문맥을 바탕으로 적절한 행동을 스스로 시작할 수 있어야 한다. 이는 특히 장시간에 걸친 지원과 ambient interaction에서 중요하다.

우리는 인간과 유사한 멀티모달 상호작용을 향한 최신 시도인 MiniCPM-o 4.5를 제시한다. 이 모델은 실시간으로 동시에 보고, 듣고, 말할 수 있으며, 실시간 장면에 대한 지속적인 이해를 바탕으로 리마인더를 제공하거나 코멘트를 하는 등의 능동적인 행동도 수행한다. 이 모델의 핵심 기술은 Omni-Flow로, 멀티모달 입력과 출력을 하나의 공유된 시간축을 따라 정렬하는 통합 스트리밍 프레임워크이다. Omni-Flow는 상호작용을 서로 구분된 여러 turn의 연속으로 취급하는 대신, 지각과 응답이 병렬로 전개되고 지속적으로 주어지는 문맥으로부터 능동적인 행동이 동일한 상호작용 루프 안에서 발생할 수 있는 연속적인 full-duplex 프로세스로 정의한다. 학습 과정에서 풍부한 omni-modal 지식을 충분히 활용하기 위해 MiniCPM-o 4.5는 token-level continuous connection을 갖는 end-to-end 멀티모달 아키텍처를 기반으로 구축된다. 또한 출력 음성이 동시에 변화하는 환경 문맥과 긴밀하게 정렬되도록 time-aligned interleaving speech generation 전략을 설계한다.

기존 인프라 및 애플리케이션과의 더 나은 호환성을 위해 MiniCPM-o 4.5는 기존의 turn-based 상호작용 역시 지원하며, full-duplex omni-modal streaming mode와 기존 사용 방식(MiniCPM-o 2.6 및 MiniCPM-V 4.5와 유사하지만 성능이 향상된 방식) 사이를 유연하게 전환할 수 있다. 광범위한 평가 결과, 이 모델은 vision-language 및 omni-modal 능력에서 선도적인 성능을 달성한다. 총 9B 파라미터를 갖는 MiniCPM-o 4.5는 vision-language 능력에서 Gemini 2.5 Flash에 근접하며, 해당 규모의 오픈소스 모델 중 state-of-the-art 성능을 달성한다. 또한 omni-modal understanding에서 Qwen3-Omni-30B-A3B를 능가하고, 더 높은 품질의 speech generation도 제공한다. End-to-end continuous connection의 장점을 활용하여 MiniCPM-o 4.5는 text와 reference audio를 모두 포함하는 multimodal system prompt를 입력으로 받을 수 있으며, 이를 통해 voice cloning과 같은 고급 speech generation 기능을 지원한다. 또한 MiniCPM-o 4.5는 강력한 OCR, 낮은 hallucination, 다국어 지원을 포함하여 MiniCPM 계열의 강력한 vision 능력도 유지한다.

본 연구의 기여는 다음 세 가지이다. 

  • (1) 우리는 최초의 full-duplex omni-modal LLM인 MiniCPM-o 4.5 9B를 제시한다. 이 모델은 12GB 미만의 RAM을 사용하는 edge device에서도 효율적으로 실행될 수 있다. 
  • (2) 광범위한 평가를 통해 MiniCPM-o 4.5가 vision-language 능력에서 Gemini 2.5 Flash에 근접하며, 해당 규모의 오픈소스 모델 중 state-of-the-art 성능을 달성함을 보인다. 또한 훨씬 높은 계산 효율성을 유지하면서 omni-modal understanding과 speech generation 품질에서 Qwen3-Omni-30B-A3B를 능가한다. 
  • (3) 우리는 지속적인 full-duplex 및 능동적인 멀티모달 상호작용이 보다 인간과 유사한 interactive intelligence로 나아가기 위한 핵심 단계임을 제시하고, full-duplex interaction modeling을 위해 멀티모달 입력과 출력을 공유된 시간축을 따라 정렬하는 Omni-Flow 프레임워크를 제안한다.

omni streaming full-duplex 모델인거 같음. vision-language 성능은 gemini 2.5 flash에 근접하다고 함.

omni-modal understanding / speech generation은 qwen3-omni-30b-a3b보다 좋다고 함

2 End-to-End Omni-Modal Architecture

MiniCPM-o 4.5는 Omni-Flow 하에서의 full-duplex 상호작용과 기존의 turn-based 추론을 모두 지원하는 end-to-end omni-modal 아키텍처를 기반으로 한다. 

Figure 4에 나타난 것처럼, 이 아키텍처는 세 가지 주요 구성요소로 이루어진다. 

  • (1) visual 및 audio 입력을 streaming 방식으로 처리하는 multimodal encoder, 
  • (2) omni-modal understanding과 text generation을 수행하는 LLM backbone, 
  • (3) discrete speech token을 autoregressive하게 생성하는 interleaved speech token decoder와 speech token을 audio waveform으로 변환하는 streaming flow-matching decoder를 포함하는 speech decoder이다. 
  • Multimodal encoder부터 LLM backbone, speech token decoder까지의 모든 학습 가능한 구성요소는 총 약 9B개의 파라미터로 이루어져 있으며, token-level에서 미분 가능하게 연결되어 있다. 이를 통해 학습 중 modality 전반에 걸쳐 end-to-end gradient propagation과 joint optimization이 가능하다. 상세한 아키텍처 설정은 Appendix A에 제시한다.

Visual Encoding. 

  • MiniCPM-o 4.5는 임의의 aspect ratio를 갖는 고해상도 이미지를 인코딩하고 resampler module을 통해 compression rate를 향상시키기 위해 LLaVA-UHD [5]의 image partitioning strategy를 사용한다. Full-duplex streaming mode에서는 최대 해상도로 448×448을 사용하고, 그 외의 경우에는 2240×2240을 사용한다. 구체적으로 각 이미지를 먼저 여러 slice로 나눈 뒤, 각 slice를 SigLIP ViT [6] (0.4B)를 통해 1024개의 token으로 인코딩하고, resampler module을 통해 64개의 token으로 압축한다. 이를 통해 16× token compression ratio를 얻으며, 이는 일반적으로 사용되는 4× compression [7, 3, 4]보다 높은 값으로, 훨씬 더 효율적인 visual processing을 가능하게 한다.
  • 비디오 프레임이 계속 들어오고, 그때그때 이미지를 LLaVA-UHD 방법으로 continuous embedding 만드는거라 보면 됨 
  • 이미지를 여러개 slice로 쪼개고 slice당 64개 visual embeddings
  • visual encoding에서는 컨텍스트 개념이 없이 이미지 장당으로 처리하는 듯

Audio Encoding. 

  • Whisper Medium [8] encoder(0.3B)는 입력 audio를 chunk-based streaming 방식 [9]으로 인코딩하여 초당 50개의 feature token을 생성한다. 이후 two-layer MLP projector를 사용해 5× temporal compression을 수행하며, 그 결과 LLM backbone에는 초당 10개의 audio token이 입력되어 token budget을 줄인다.
  • 오디오가 들어오면, 초당 50개의 feature continuous embedding을 뽑는다.
  • 이 50개를 two-layer MLP 태워서 10개의 continuous embedding을 만들어서 LLM에 넣는다. 10Hz 느낌
  • 근데 오디오 인코더는 앞의 컨텍스트를 볼텐데 몇초씩 윈도우 슬라이딩을 하는건가? (이건 안나와있음)

Text Decoding. 

  • LLM backbone(Qwen3-8B [10])은 text output과 speech generation을 위한 hidden state를 생성한다. LLM backbone은 text domain의 token만 생성하므로, 실시간 full-duplex interaction 동안 초당 3~4번의 decoding step, 즉 사람의 speech speed 정도만 필요하다. 반면 최근 연구 [11, 12]처럼 backbone이 직접 speech token을 생성해야 하는 경우에는 일반적으로 초당 약 25개의 token을 생성해야 하므로 efficiency가 크게 저하될 수 있으며, core language capability 또한 감소하는 경향이 있다 [13, 14]. 본 연구의 설계는 speech token 생성을 아래에서 설명하는 lightweight speech decoder에 위임함으로써 이러한 문제를 피한다.
  • Qwen3 8B가 텍스트 토큰을 생성하고
  • 생성된 각 text token에 대응하는 LLM hidden state를 speech decoder에 넘긴다
    • 25 speech token/sec을 생성함
    • 아래에서 이어서 설명
  • 여기서 텍스트 토큰 생성과 speech 토큰 생성 시간을 고려하면, 텍스트 생성은 초당 3-4 텍스트 토큰이 생성되야함. 
    • 학습데이터가 텍스트와 speech 토큰을 시간으로 얼라인 하는 포맷인거 같음 (word align 같은)

Speech Token Generation. 

  • Speech generation에는 정확한 pronunciation뿐 아니라 context와 instruction에 의해 결정되는 prosody와 style도 필요하다. 우리는 LLM backbone의 contextual understanding capability를 활용하여 이를 해결한다. Lightweight Llama speech token decoder(약 0.3B)에 전달되는 각 text token에 대해, LLM backbone의 hidden state를 MLP layer를 통해 reshape한 뒤 speech decoder의 representation과 더하여 추가적인 S3 [15] token generation을 수행한다. Prosodic decision이 LLM backbone에 의해 미리 인코딩되므로, 작은 speech decoder는 자신의 capacity를 speech modeling에 집중할 수 있다. 또한 input text token과 output speech token을 time-aligned 방식으로 interleave하여, Section 3.4에서 자세히 설명하는 것처럼 output speech가 동시에 주어지는 environment context와 긴밀하게 결합되도록 한다.
  • 위에서 말한대로 생성된 text token이랑 그 직전 hidden state 을 넘겨서 speech 생성하는 식
    • text token + 대응 LLM hidden state를 작은 0.3B speech decoder에 전달
  • 여기서 사용하는 토큰은 cosyvoice에서 언급하는 s3 token이라고 함
    • s3=semantic token이라 보면되는듯
    • 걍 cosyvoice tokenizer 썼다고 이해하면 될거 같은데

Waveform Synthesis. 

  • Streaming flow-matching decoder [16, 12]는 multimodal system prompt에 포함된 reference audio를 기반으로, 생성된 S3 speech token을 audio waveform으로 변환한다.

부분표현
Visual inputcontinuous embedding
Audio inputcontinuous embedding
Text input/outputdiscrete text token
Speech outputdiscrete S3 speech token
최종 audiocontinuous waveform

3 Omni-Flow

기존의 상호작용 패러다임에서는 지각과 응답이 번갈아 수행되는 단계로 제한되어 있으며, 그 결과 Figure 3에 나타난 것처럼 I/O가 차단되고 수동적으로 응답하는 문제가 발생한다. 모델이 지각과 발화를 동시에 수행할 수 있도록, 우리는 omni-modal 입력 및 출력 스트림을 하나의 공유된 시간축을 기준으로 조정하는 Omni-Flow 프레임워크를 제안한다. Time-division multiplexing 기법에서 영감을 받아, Omni-Flow는 연속적인 상호작용을 길이 tt의 세밀한 시간 윈도우로 나눈다. 각 윈도우 내에서 모델은 새롭게 도착한 신호를 반영하는 동시에 다음 출력을 생성하며, 기존의 turn-taking 방식을 시간적으로 국소적인 업데이트들의 스트림으로 변환한다. 이는 Figure 4에 나타나 있다. tt가 충분히 작아질수록 지각과 응답은 시간적으로 더욱 긴밀하게 결합되며, 자연스럽게 full-duplex 동작에 가까워진다.

3.1 Time-Aligned Streams

우리는 상호작용 과정에서 시간적으로 정렬되는 세 가지 스트림을 정의한다. env-visual은 환경에 대한 실시간 시각적 관찰을 전달하고, env-audio는 사용자의 음성이 존재하는 경우 이를 포함하여 주변의 음향 장면을 전달하며, out-stream은 assistant의 text 및 speech 출력을 나타낸다.

이러한 관점에서는 사용자 요청을 더 이상 특별한 conversational role로 취급하지 않는다. 대신 사용자 요청은 지속적으로 관찰되는 world state의 일부가 되며, 주로 env-audio를 통해 입력된다. 마찬가지로 모델은 응답하기 전에 명시적인 사용자 요청을 trigger로 필요로 하지 않는다. 대신 out-stream은 지속적으로 들어오는 지각 정보와 결합된 상태로 변화한다.

따라서 모델은 항상 켜져 있는(always-on) 멀티모달 환경 속에 위치하게 되며, 모델은 무엇을 출력할 것인지뿐만 아니라, 스스로 출력할지 여부와 언제 출력할지도 결정해야 한다.

3.2 통합 직렬화 (Unified Serialization)

이러한 스트림들이 주어졌을 때, 우리는 이들을 표준 causal language model에 입력할 수 있는 하나의 통합 시퀀스로 구성한다. kk번째 시간 청크(time chunk)에 대해, env-visual과 env-audio에서 들어오는 입력은 각각 시각 토큰 시퀀스 vkv^k와 오디오 토큰 시퀀스 aka^k로 인코딩되며, out-stream의 업데이트는 출력 토큰 시퀀스 oko^k로 표현된다. 출력이 생성되지 않아야 하는 경우, oko^k는 특수한 [listen] 토큰 하나만을 포함한다.

우리는 시간적으로 정렬된 이러한 토큰들을

gk=[vk;ak;ok]g^k = [v^k; a^k; o^k]

로 묶고, 연속된 그룹들을 하나의 시퀀스로 이어 붙여 전체 상호작용을 직렬화한다.

각 청크 내에서 모델은 먼저 새롭게 도착한 지각 토큰들을 처리한 다음 출력 토큰을 생성한다. 따라서 모든 출력은 가장 최근의 관측 정보에 조건화된다. 청크 크기 tt를 줄이면 모델이 지각 정보를 갱신하는 빈도가 증가하며, 이를 통해 변화하는 환경과 더욱 긴밀하게 정렬된 상태를 유지할 수 있다.

또한 모델이 각 시간 구간마다 출력 여부를 스스로 결정하기 때문에, 자연스럽게 능동적인(proactive) 행동을 지원할 수 있으며 외부 VAD [17] 모듈에 대한 의존도도 줄어든다.

3.3 설계 트레이드오프 (Design Tradeoffs)

Omni-Flow에는 모델의 안정성과 반응성에 직접적인 영향을 미치는 여러 가지 설계 선택지가 존재한다. 따라서 우리는 시간적 세분성(temporal granularity), 경계의 명시성(boundary explicitness), 제어 방식(control formulation)의 세 가지 측면에서 ablation 실험을 수행한다.

시간적 세분성은 각 시간 청크의 길이를 의미하며, 1.0초, 0.2초, 0.1초를 비교한다. 경계의 명시성은 연속된 그룹 사이를 명시적인 특수 토큰으로 구분하는지 여부를 의미한다. 제어 방식은 모델이 발화 여부를 어떻게 결정하는지를 나타낸다. Listen-Speak (LS) 방식에서는 모델이 콘텐츠를 생성하기 전에 먼저 listen/speak 중 하나를 나타내는 이진 제어 토큰을 예측한다. Listen-Text (LT) 방식에서는 모델이 하나의 공유 출력 공간에서 [listen] 또는 일반 텍스트 토큰을 직접 예측한다. 결과는 Table 1에 제시되어 있다.

시간적 세분성은 지연 시간과 모델링 용량 사이의 핵심적인 트레이드오프를 결정한다. 청크 크기를 줄이면 시간적인 반응성은 향상되지만, 동시에 각 청크 내에서 제어와 생성을 수행하는 데 사용할 수 있는 모델링 예산은 줄어든다. 청크가 지나치게 짧아지면 모델은 각 시간 구간에서 안정적인 결정을 내리고 일관된 출력을 생성하기에 충분한 정보를 확보하지 못하게 되며, 그 결과 성능이 크게 저하된다. 본 실험 설정에서는 1.0초의 청크 크기가 가장 좋은 균형을 제공한다.

경계를 명시적으로 표현하는 것은 일관되게 유리하다. 그룹 사이의 경계를 명시적으로 표시하는 방식이 더 좋은 성능을 보인다. 이는 새롭게 관측된 입력과 새롭게 생성된 출력을 구분하는 것이 단순하지 않은 문제이며, 이러한 구조를 명시적으로 제공함으로써 모델이 부담해야 하는 학습 난이도를 줄일 수 있음을 시사한다.

상호작용 제어와 콘텐츠 생성을 분리하면 보다 안정적인 모델링이 가능하다. LS는 LT보다 더 좋은 성능을 보이며, 이는 발화할지 여부를 결정하는 것과 무엇을 말할지를 결정하는 것을 분리해야 함을 나타낸다. 두 가지 결정을 하나의 예측 단계에 결합하면 full-duplex 상호작용을 학습하기가 더 어려워진다.

  • 3.2을 보면 이미지/오디오/텍스트가 하나의 1d grid로 들어오게끔 되어있는데 이걸 몇 초 단위로 판단할지에 대한 실험을 했다는것임
  • 결과론적으로 너무 빠르게 하면 반응은 빨라지나 정보가 너무 적어서 성능이 떨어져서 1초가 안정적이란 이야기
  • Grid 사이사이 스페셜 토큰으로 아래처럼 explicit 처리하면 바운더리가 더 잘 구분된다는것
    • <chunk> V A output </chunk> <chunk> V A output </chunk>
  • LT는
    • [listen] 또는 "그 선수가 슛을 했네요" 이 둘중 하나 선택
    • 즉 토큰으로 listen할지 말할지를 한꺼번에 결정
  • LS는
    • 1단계: [listen] vs [speak] 
    • 2단계: [speak]라면 실제 텍스트 생성 "그 선수가 슛을 했네요"
    • 이렇게 [speak]토큰을 추가하여 명확히 구분하는거 같음
  • LS가 더 성능이 좋다고함

3.4 Time-Aligned Interleaving for Timely Speech Generation

Omni-Flow는 모델의 출력을 들어오는 입력과 함께 변화하는 스트림으로 표현한다. 그러나 발화되는 출력과 가장 최근에 관측된 문맥 사이의 시간적 정렬을 유지하는 것은 여전히 쉽지 않다. 이러한 어려움은 텍스트 생성 시간과 음성 재생 시간 사이의 불일치에서 발생한다. 만약 mm초 구간 동안 생성된 텍스트를 실제로 발화하는 데 mm초보다 훨씬 긴 시간이 걸린다면, 음성 스트림은 모델의 변화하는 상태에 비해 점점 뒤처지게 된다. 그 결과, 특정 시점에 들리는 오디오는 훨씬 이전에 생성된 텍스트에 해당할 수 있으며, 진행 중인 상호작용에 비해 응답이 시간적으로 오래된 상태가 된다. 이 문제는 각 텍스트 토큰을 실제로 발화하는 데 걸리는 시간이 가변적이며 문맥에 따라 달라진다는 점 때문에 더욱 복잡해진다.

  • Figure 5: 스트리밍 음성 생성 전략의 비교. 기존 방법은 (a) 텍스트를 음성보다 크게 앞서 생성하거나, (b) 고정된 text-speech 비율에 의존하기 때문에, 실제로 발화되는 내용이 변화하는 환경보다 뒤처질 수 있다. 우리는 Time-Aligned Interleaving(TAIL)을 제안하며, 이는 텍스트와 음성을 적응적으로 인터리빙하여 각 시간 청크에서 생성된 텍스트가 대략 동일한 길이의 음성 재생 시간에 대응하도록 한다.

기존의 스트리밍 음성 생성 방법 [11, 7, 18, 16]은 일반적으로 Figure 5의 (a)와 (b)에 제시된 두 가지 전략 중 하나를 사용한다. 일부 방법은 먼저 비교적 긴 구간의 텍스트를 생성한 뒤, 그 텍스트로부터 음성을 합성한다. 다른 방법들은 고정된 text-to-speech 토큰 비율을 사용하여 텍스트와 음성을 인터리빙한다.

두 전략 모두 고품질 음성을 생성할 수 있지만, 생성된 음성을 상호작용의 시간축과 명시적으로 정렬하지는 않는다. 전자의 경우 텍스트가 실제 음성 재생보다 훨씬 앞서 나갈 수 있으며, 후자의 경우 텍스트 토큰 수와 음성 길이 사이에 거의 고정된 대응 관계가 있다고 가정한다. Full-duplex 상호작용에서는 두 설계 모두 모델이 현재 환경과 더 이상 정렬되지 않은 오래된 내용을 계속 말하게 만들 수 있다.

이를 해결하기 위해 우리는 Time-Aligned Interleaving(TAIL)을 제안한다. TAIL은 각 단계에서 생성할 텍스트의 양을 적응적으로 조절하는 청크 단위의 음성 생성 전략이다. 각 청크를 독립적으로 고정된 음성 길이에 맞추는 대신, TAIL은 전체 상호작용 동안 누적된 음성 재생 진행 상황을 고려한다.

어느정도 이렇게 다하고 있는듯, word align 등으로 텍스트와 음성간의 말하는 속도를 맞춰서 학습

kk번째 청크에서 모델은 새롭게 생성된 내용을 실제로 발화한 뒤 음성 스트림이 현재 시간 경계 ktkt에 가까워지도록 생성할 텍스트의 양을 조절한다. 이전 청크들에서 이미 약간의 음성 재생 지연이 발생했다면, 현재 청크에서는 더 적은 수의 텍스트 토큰을 생성하여 음성 스트림이 시간축을 따라잡도록 할 수 있다. 이러한 방식으로 TAIL은 텍스트가 오디오보다 지나치게 앞서 나가는 것을 방지하고, 발화되는 응답이 모델의 가장 최근 상태에 가깝게 유지되도록 한다.

우리는 full-duplex 스트리밍 학습 데이터에서 각 텍스트 토큰의 시작 시간과 종료 시간을 수집하여 TAIL의 supervision 데이터를 구성한다. 시작 시간이

[(k−1)t,  kt)[(k-1)t,\; kt)

구간에 포함되는 텍스트 토큰들과, 이에 대응하는 음성 토큰들을 kk번째 Omni-Flow 청크에 할당한다.

이러한 데이터 형식을 통해 모델은 과거의 상태에 의존하는 인터리빙 패턴을 학습한다. 즉, 각 청크에 포함되는 텍스트 토큰의 개수는 누적된 음성 재생의 시간 정렬 상태에 따라 달라질 수 있다.

Look Ahead Speech Generation

음성을 생성하기 위해서는 여전히 제한적인 미래 텍스트 문맥이 필요할 수 있다. 예를 들어, “the”의 발음은 뒤에 어떤 단어가 오는지에 따라 달라질 수 있으며, “the apple”과 “the car”가 그 예이다.

따라서 TAIL은 제한된 look-ahead 메커니즘을 사용한다. 청크 kk의 마지막 몇 개 텍스트 토큰에 해당하는 음성 토큰의 생성을 청크 k+1k+1까지 미루고, 나머지 토큰들은 청크 kk에서 발화한다.

이를 통해 텍스트 스트림이 실제 음성 재생보다 지나치게 앞서 나가지 않으면서도, 발음과 운율(prosody)을 결정하는 데 필요한 국소적인 미래 문맥을 확보할 수 있다. 결과적으로 TAIL은 Omni-Flow의 시간 정렬 구조를 유지하면서 지속적이고 적시성 있는 음성 생성을 가능하게 한다.

여기서 기존과 다른점은

  • Speech token은 LLM의 같은 grid에서 생성되는 게 아니라, 별도의 Interleaved Speech Token Decoder에서 생성된다.
  • 하지만 speech token AA들 자체는 병렬 생성이 아니라 autoregressive하게 생성된다. 논문에서 speech decoder가 “autoregressively generates discrete speech tokens”라고 명시한다.
  • LLM이 Text token TT와 그에 대한 hidden state hTh_T를 생성하면, 이를 speech decoder가 받아 S3 speech token 생성에 활용한다.
  • 하나의 text token 또는 text 구간에 대해 여러 개의 speech token이 나올 수 있다. Text는 약 3–4 token/s, speech는 25 token/s라서 rate가 다르다.
  • LLM
  • T1 ("안녕") + h1
  •         ↓
  • Speech Decoder
  • A1 → A2 → A3 → A4 → ...

  • LLM
  • T2 ("하세요") + h2
  •         ↓
  • Speech Decoder
  • A5 → A6 → A7 → ...
  • 물론 여기서 look ahead가 있기 때문에 정확히 time이 일치하진 않음

4 데이터 (Data)

4.1 음성 데이터 (Speech Data)

우리는 폭넓은 능력 범위를 확보하기 위해 대규모 자연 음성 데이터를 수집하고, 제어 가능하면서 자연스러운 음성 생성을 위해 고품질 대화 데이터를 수집한다.

대규모 자연 음성 데이터 (Large-scale Natural Speech Data).
우리는 다양한 출처에서 수집한 수백만 시간 규모의 라벨이 없는 음성 데이터를, 여러 오픈소스 구성요소 [19, 20, 21, 22, 23]를 통합한 파이프라인을 통해 처리한다. 이를 통해 zero-shot TTS, ASR, 그리고 멀티턴 멀티스피커 대화를 위한 학습 데이터셋을 구축한다. 이 다양한 코퍼스에는 서로 다른 화자, 억양, 대화 패턴이 폭넓게 포함된다.

음성 대화 데이터 (Spoken Dialog Data).
먼저 텍스트 기반 LLM을 사용하여 다양한 seed query로부터 구어체이면서 instruction-following 형태의 대화를 생성한다. 이후 이 대화들 중 일부를 전문 성우가 스튜디오 환경에서 다시 녹음한다.

녹음 세션에서 성우들은 대본을 그대로 읽는 방식이 아니라 대화체 스타일로 발화한다. 이 과정에서 구조화된 내용과 즉흥적인 표현 사이의 균형을 유지하며, 일관된 화자 정체성을 유지한 상태에서 감정, 말하기 속도, 강조 방식 등을 다양하게 변화시킨다.

이렇게 구축된 코퍼스는 instruction-following TTS, 질의응답(question answering), 그리고 멀티턴 자연 대화를 포함한다.

4.2 비전-언어 데이터 (Vision-Language Data)

이 절에서는 MiniCPM-o 4.5의 비전-언어 데이터를 소개한다. MiniCPM-V 4.5의 데이터 시스템을 기반으로, 더 다양한 태스크 유형과 실제 환경 시나리오를 포괄할 수 있도록 데이터 규모를 더욱 확장하고 품질을 개선하였다.

고품질 지식 및 정렬 데이터 (High-Quality Knowledge and Alignment Data).
CapsFusion [24] 파이프라인에서 사용하는 생성 모델을 업데이트하여 더 많은 정보를 포함하는 이미지 캡션을 합성하고, 이미지-텍스트 관련성 추정 방법을 개선하여 필터링 과정도 추가로 정교화하였다.

복잡한 문서 및 OCR 데이터 (Complex Document and OCR Data).
문서 지식을 보다 효과적으로 활용하기 위해, MiniCPM-V 4.5에서 사용한 통합 문서 지식 및 OCR 학습 방식을 relevance-aware masking 전략으로 확장한다. 구체적으로, 텍스트 영역을 무작위로 마스킹하는 대신 문서 이미지 내의 그림과 차트에 더 관련성이 높은 영역을 우선적으로 마스킹한다.

이를 통해 모델이 시각적으로 근거가 있는 콘텐츠에 더 집중하도록 유도하는 동시에, 주로 텍스트 문맥만으로 해결할 수 있는 학습 사례의 비율을 줄인다.

실제 환경 시나리오 데이터 (Real-World Scenarios Data).
실제 사용자 상호작용의 미묘한 특성을 포착하는 것은 데이터 구축 과정에서 중요한 목표 중 하나이다. 이를 위해 보다 자연스럽고 다양한 질의 패턴을 도입한다.

또한 짧고 직접적인 답변 형태의 샘플을 상세한 chain-of-thought 스타일의 추론 과정으로 다시 작성하여 모델 응답의 깊이와 가독성을 크게 향상시킨다. 추가로 reward model 기반 필터링 파이프라인을 적용하여 전반적인 데이터 품질과 인간 선호와의 정렬을 보장한다.

밀집 비디오 인지 데이터 (Dense Video Perception Data).
모델의 비디오 인지 능력과 프레임 간 추론 능력을 강화하기 위해 dense video captioning 데이터셋을 구축한다. 이 데이터셋은 시간에 따라 발생하는 사건, 사람의 행동, 복잡한 장면 전환에 대해 연속적이고 세밀한 설명을 제공한다.

텍스트 전용 데이터 (Text-only Data).
강력한 언어 능력을 유지하기 위해 MiniCPM 4.1 [25]의 post-training 데이터셋에서 고품질 text-only instruction 데이터도 함께 사용한다.

4.3 Omni-Modal Full-Duplex 데이터

Omni-modal full-duplex 데이터는 대규모 웹 데이터와 더 작은 규모의 고품질 instruction 샘플로 구성된다. 각 학습 샘플에는 전체 시각 입력, 오디오 입력, 출력 텍스트, 출력 음성이 포함되며, 각 정보에는 시간 인덱스(time index)가 태깅되어 있다.

대규모 웹 오디오-비디오 데이터 (Large-scale Web Audio-video Data).
실제 환경에서 발생하는 다양한 full-duplex 시나리오를 폭넓게 포괄하기 위해 대규모 웹 오디오-비디오 데이터를 수집한다.

단일 화자의 발화가 대부분을 차지하는 구간이나 오디오와 비디오 사이의 관련성이 낮은 구간은 제거한다. 품질을 추가로 향상시키기 위해 OCR 기반 자막 제거 [26], talking-head 탐지 [27], 그리고 ASR로부터 얻어진 transcript에 대한 필터링을 적용한다. 이를 통해 잘못된 shortcut을 유발할 수 있는 데이터와 정보량이 적거나 노이즈가 많은 구간을 줄인다.

Full-Duplex 태스크 데이터 (Full-Duplex Task Data).
보다 정밀한 상호작용이 요구되는 목표 full-duplex 능력을 지원하기 위해 여러 시나리오를 수작업으로 구성하고, 이에 대응하는 instruction-following 데이터를 주석화한다.

이러한 고품질 태스크 샘플을 바탕으로 MiniCPM-o 4.5는 연속적인 장면 설명(continuous scene description)이나 능동적인 알림(proactive reminding)과 같은 고급 기능을 지원한다.

5 학습

본 절에서는 MiniCPM-o 4.5의 전반적인 학습 파이프라인을 소개한다. 옴니모달 능력을 발전시키는 데 있어 핵심 과제 중 하나는 개별 모달리티가 지닌 기본적인 강점을 유지하면서도, 모달리티 전반에 걸쳐 효율적이고 원활하게 일반화할 수 있도록 하는 것이다. 이를 위해 우리는 음성을 멀티모달 시스템에 점진적으로 통합할 수 있도록 신중하게 단계화된 학습 파이프라인을 설계하였다.

MiniCPM-V 4.5의 사전학습 체크포인트를 기반으로, 먼저 음성 사전학습을 수행하여 기본적인 오디오 이해 및 음성 생성 능력을 구축한다. 이후 공동 사전학습을 수행하여 통합된 교차 모달 표현을 형성한다. 이어서 지도 미세조정을 통해 텍스트, 음성, 이미지, 비디오 전반에서 자연스러운 지시 수행과 고품질 상호작용을 가능하게 한다. 마지막으로 강화학습을 적용하여 추론 능력을 추가로 향상시키고 환각을 완화한다. 2604.27393v1

5.1 음성 사전학습

MiniCPM-o 4.5는 사전학습된 Whisper 인코더와 MiniCPM-V 4.5의 사전학습 체크포인트를 이용해 초기화하며, 오디오 프로젝터, LLM-to-speech 프로젝터, 음성 디코더를 포함한 음성 관련 모듈은 무작위로 초기화한다. 백본의 시각 및 언어 능력을 보존하기 위해 사전학습된 구성 요소는 동결하고 새롭게 추가된 모듈만 업데이트한다.

이 단계에서는 Whisper 특징을 LLM의 은닉 공간에 정렬하고, 음성 디코더가 LLM 백본의 은닉 상태를 의미적·운율적 정보가 반영된 음성 토큰으로 변환하도록 학습한다. 2604.27393v1

5.2 공동 사전학습

두 번째 단계에서는 모든 파라미터의 동결을 해제하고, 비전-언어, 음성, 옴니모달 데이터가 균형 있게 혼합된 데이터로 공동 사전학습을 수행한다. 최적화를 안정화하기 위해 서로 다른 모달리티 조합을 서로 다른 데이터 병렬 랭크에 할당하여, 모든 학습 단계에서 고정된 데이터 비율이 유지되도록 한다.

기존의 턴 기반 샘플뿐 아니라, 혼합 데이터에는 선제적 상호작용 및 풀듀플렉스 상호작용 데이터도 포함되며, 여기서는 텍스트 토큰이 공유된 시간축상에서 음성 및 시각 신호와 정렬된다. 통합된 다음 토큰 예측 목적함수로 학습함으로써, 모델은 기본적인 시각 이해 능력을 유지하면서 실시간 옴니모달 상호작용 능력을 습득한다. 2604.27393v1

5.3 공동 지도 미세조정

공동 지도 미세조정 단계에서는 옴니모달 능력을 활성화하고 지시 수행 능력을 강화한다. 이 단계는 두 개의 과정으로 구성된다. 먼저 폭넓은 능력 적응을 위한 대규모 지시 튜닝을 수행하고, 이후 세밀한 행동 특성을 조정하기 위해 고품질 인간 주석 데이터를 이용한 튜닝을 수행한다.

추론 과정에서 품질과 효율성 간의 유연한 절충을 가능하게 하기 위해, 서로 다른 해상도와 프레임 레이트를 갖는 옴니모달 데이터로 데이터를 증강한다. 최대 프레임 해상도는 0.2–0.4 메가픽셀 범위에서 무작위로 설정하며, 프레임 레이트는 1–5 FPS 범위에서 균등하게 샘플링한다. 2604.27393v1

5.4 강화학습

우리는 강화학습을 통해 MiniCPM-o 4.5의 성능을 추가로 향상시킨다. 먼저 GRPO [28]를 적용하여 추론 및 지시 수행 능력을 향상시키며, 정답 정확도와 형식 보상 등의 보조 보상을 함께 사용한다. 정확도 보상의 경우, 올바른 응답에 대한 재현율을 높이기 위해 규칙 기반 검증과 효율적인 판정 모델 [29]을 결합한다. 2604.27393v1

토큰 효율성을 향상시키기 위해 Kimi-K1.5 [30]에서 변형한 평활 길이 보상을 도입한다.

여기서 \(r_i\)는 정답 여부를 나타내는 지시자이며, \(\ell_i\), \(\ell_{\min}\), \(\ell_{\max}\)는 동일한 프롬프트에 대한 응답들을 기준으로 계산된다. \(\min(0,s_i)\) 항은 짧은 오답 응답에 보상이 주어지는 것을 방지하며, \(\tau\)는 길이 차이가 작을 때 보상의 크기를 축소한다. 또한 일반적인 보상 모델을 사용하여 응답 품질을 향상시키고 의도하지 않은 코드 혼용을 억제한다. 수렴 효율성을 위해 처음 480번의 학습 스텝에서는 길이 보상을 적용하지 않는다. 2604.27393v1

마지막으로 시각적 상황에서의 환각을 줄이기 위해 RLAIF-V [31]를 적용한다. 이미지-텍스트 데이터에서 학습된 환각 완화 효과가 옴니모달 풀듀플렉스 상호작용에도 효과적으로 전이되어, 스트리밍 환경에서도 환각이 감소함을 확인하였다. 2604.27393v1

6 평가

본 절에서는 MiniCPM-o 4.5와 기타 베이스라인 모델들을 종합적으로 평가한다. 2604.27393v1

6.1 모달리티 및 도메인

MiniCPM-o 4.5는 네 가지 모달리티 능력 그룹에 걸쳐 평가한다. 구체적으로 비전-언어 이해, 음성 이해 및 생성, 텍스트 능력, 옴니모달 스트리밍 상호작용이다. 비전-언어 이해는 다시 STEM 및 일반 멀티모달 추론, 문서 및 OCR 이해, 다중 이미지 추론, 환각, 비디오 이해의 다섯 가지 대표 도메인으로 구분한다. 음성 평가는 음성 이해와 음성 생성을 모두 포함한다. 텍스트 평가는 옴니모달 학습 이후에도 모델이 LLM 백본의 언어 능력을 유지하는지를 측정한다. 옴니모달 및 스트리밍 상호작용 평가는 턴 기반 옴니모달 이해와 풀듀플렉스 스트리밍 상호작용을 모두 포함한다. 2604.27393v1

비전-언어 이해. 비전-언어 이해는 다섯 가지 대표 도메인에서 평가한다.

(1) STEM 및 일반 멀티모달 추론. 일반적인 비전-언어 이해 능력 평가에는 다양한 멀티모달 태스크를 포괄하는 OpenCompass [32], MMBench V1.1 [33], MMVet [34], MMStar [35]를 포함한다. STEM 중심의 추론 능력을 평가하기 위해 과학 지식, 수학적 추론, 다이어그램 이해를 다루는 MMMU [36], MathVista [37], AI2D [38]를 사용한다. 또한 멀티태스크 일반화와 멀티모달 지시 수행 능력을 평가하기 위해 MMT-Bench [39]와 MM-IFEval [40]을 포함한다.

(2) 문서 및 OCR 이해. 이 도메인은 시각적으로 풍부한 문서 및 장면 이미지에 포함된 텍스트를 인식하고 추출하며, 이를 바탕으로 추론하는 능력을 평가한다. 텍스트 내용, 시각적 레이아웃, 문서 구조를 공동으로 모델링해야 하는 OCRBench [41], TextVQA [42], DocVQA [43], OmniDocBench [44]를 사용한다.

(3) 다중 이미지 이해. 이 도메인은 여러 이미지에 걸쳐 정보를 통합하고 비교하는 능력을 측정한다. 이미지 간 추론, 시각적 비교, 다중 이미지 정보 통합을 평가하는 Mantis-Eval [45], MUIRBench [46], MMSI-Bench [47]를 사용한다.

(4) 환각. 이 도메인은 모델의 응답이 시각 입력에 충실한지를 평가한다. 멀티모달 생성에서의 시각적 일관성과 환각을 측정하는 HallusionBench [48]와 MMHal-Bench [49]를 사용한다.

(5) 비디오 이해. 이 도메인은 비디오에서의 시공간 추론과 움직임 이해 능력을 평가한다. 다양한 길이의 비디오를 포괄하는 Video-MME [50], LVBench [51], MLVU [52], LongVideoBench [53], MotionBench [54]를 사용한다. 2604.27393v1

음성 이해 및 생성. 음성 평가는 자동 음성 인식, 음성 번역, 오디오 이해, 음성 질의응답, 음성 생성을 포함한다. 음성 이해의 경우 AISHELL-1 [55], AISHELL-2 [56], WenetSpeech [57], LibriSpeech [58], GigaSpeech [59], VoxPopuli [60] 등의 표준 ASR 벤치마크를 사용한다. 음성 번역은 CoVoST 2 [61], 멀티태스크 오디오 이해는 MMAU와 MELD [62], 음성 질의응답은 VoiceBench [63], Speech TriviaQA [64], Speech Web Questions [65], Speech CMMU [66]를 사용한다. 음성 생성의 경우 SeedTTS Test [67], LongTTS [68], Expresso [69], ESD [70]를 이용하여 음성 품질, 명료도, 화자 유사도, 장문 생성, 감정/스타일 제어를 평가한다. 2604.27393v1 2604.27393v1

텍스트 능력. 옴니모달 학습 후에도 핵심 텍스트 능력이 유지되는지를 평가하기 위해 MiniCPM-o 4.5를 언어 백본인 Qwen3-Instruct-8B [10]와 비교한다. 벤치마크는 지시 수행, 세계 지식, 다국어 이해, 추론, 코드 생성 능력을 포괄한다. 구체적으로 지시 수행에는 IFEval [71], 지식 및 다국어 이해에는 MMLU [72]와 CMMLU [73], 추론 및 수학에는 BBH [74], MATH-500 [75], GSM8K [76], 코드 생성에는 HumanEval [77]과 MBPP [78]를 사용한다. 2604.27393v1

옴니모달 및 스트리밍 상호작용. 비디오와 오디오 입력 스트림이 자연스럽게 시간적으로 정렬되어 있는 Daily-Omni [79], WorldSense [80], Video-Holmes [81], JointAVBench [82], AVUT-Human [83], FutureOmni [84], 오디오를 포함한 Video-MME-Short [50]를 사용하여 옴니모달 이해 능력을 평가한다. 풀듀플렉스 스트리밍 환경에서는 모델이 유입되는 스트림을 지속적으로 인식하면서 동시에 적시에 응답을 생성해야 한다. 실시간 옴니모달 풀듀플렉스 상호작용을 평가하기 위한 벤치마크가 제한적이므로, 오디오를 포함하지 않는 풀듀플렉스 벤치마크인 LiveSports-3K-CC [27]의 결과를 보고한다. 비전, 음성, 텍스트 스트림을 동시에 처리하는 정성적 데모는 데모 웹사이트에서 제공한다. 2604.27393v1

6.2 비전-언어 결과

표 2와 표 3에서 볼 수 있듯이, MiniCPM-o 4.5는 instruct 모드와 thinking 모드 모두에서 광범위한 비전-언어 태스크에 걸쳐 강력한 성능을 보인다. 2604.27393v1

표 2: 비전-언어 결과(Instruct 모드)

벤치마크Gemini 2.5 FlashInternVL3.5Qwen3-VLQwen3-OmniMiniCPM-o 4.5
크기-8B8B30B-A3B9B
STEM 및 일반
OpenCompass78.575.876.575.777.6
MMBench EN v1.186.679.584.584.987.6
MMBench CN v1.186.080.084.784.187.2
MathVista75.378.477.275.980.1
MMVet81.483.173.774.874.4
MMMU76.373.469.669.167.6
MMStar75.869.370.968.573.1
AI2D87.784.085.785.287.6
MMT-Bench (val)70.066.760.970.469.7
MM-IFEval75.856.359.465.766.3
문서 및 OCR
OCRBench864840896880876
TextVQA (val)74.378.282.984.183.8
DocVQA (val)93.092.396.195.494.7
OmniDocBench (EN) ↓0.2140.3220.2550.2160.109
OmniDocBench (CN) ↓0.2900.4160.3190.3630.162
환각
HallusionBench59.154.561.159.763.2
MMHal-Score4.63.84.74.64.7
MMHal-Hallrate ↓23.934.729.931.624.3
다중 이미지
Mantis-Eval72.870.574.278.379.7
MUIRBench74.555.864.461.972.0
MMSI-Bench12.1–11.314.216.6
비디오
Video-MME (자막 제외)75.666.071.470.570.4
LVBench62.2–58.050.250.9
MLVU (M-Avg)77.870.278.175.276.5
LongVideoBench (val)–62.166.466.966.0
MotionBench–62.359.561.761.4

2604.27393v1

표 3: 비전-언어 결과(Thinking 모드)

벤치마크Gemini 2.5 FlashGPT-5Qwen3-VLQwen3-OmniMiniCPM-o 4.5
크기--8B30B-A3B9B
STEM 및 일반
OpenCompass79.979.777.378.578.2
MMBench EN v1.187.185.585.388.289.0
MMBench CN v1.187.385.685.587.787.6
MathVista79.481.981.480.081.0
MMVet81.277.669.874.873.6
MMMU77.781.874.175.670.2
MMStar76.575.775.374.973.6
HallusionBench63.565.265.462.862.6
AI2D88.789.584.986.188.5
MMT-Bench (val)70.772.768.170.969.7
MM-IFEval75.783.173.569.968.2
문서 및 OCR
OCRBench853807819859879
TextVQA (val)73.877.877.880.879.8
DocVQA (val)92.891.395.394.292.3

2604.27393v1

종합 능력. MiniCPM-o 4.5는 널리 사용되는 8개의 비전-언어 벤치마크를 종합한 OpenCompass [32]에서 instruct 모드 기준 평균 77.6점, thinking 모드 기준 78.2점을 달성한다. 9B 파라미터에 불과함에도 InternVL3.5-8B [85], Qwen3-VL-8B [4]와 같은 유사 규모 모델뿐 아니라 Qwen3-Omni-30B [7]와 같은 더 큰 모델보다 일관되게 높은 성능을 보이며, Gemini 2.5 Flash [86]와 GPT-5 [87]를 포함한 선도적인 상용 모델에 근접한 성능을 달성한다. 2604.27393v1

OCR 및 문서 분석. MiniCPM-o 4.5는 문서 파싱에서 가장 높은 성능을 보인다. 영어와 중국어 모두에서 OmniDocBench [44]에 대해 강력한 결과를 달성하며, Qwen3-Omni-30B-A3B와 같이 파라미터 규모가 더 큰 범용 모델들을 크게 앞선다. OCRBench [41], TextVQA [42], DocVQA [43]에서도 최상위권 모델과 대등한 성능을 보인다. 2604.27393v1

다중 이미지 이해. 다중 이미지 데이터셋의 범위와 품질을 개선한 결과, 표 2와 같이 MiniCPM-o 4.5는 Mantis-Eval [45]과 MMSI-Bench [47]에서 모든 베이스라인 모델을 능가한다. MUIRBench [46]에서도 경쟁력 있는 점수를 기록한다. 이러한 결과는 실제 응용에서 중요한 이미지 간 이해 능력이 뛰어남을 보여준다. 2604.27393v1

6.3 음성 결과

오디오 이해. 표 4와 같이 MiniCPM-o 4.5는 광범위한 오디오 이해 능력을 보여준다. ASR에서는 중국어와 영어 벤치마크 모두에서 선도적인 시스템에 근접한 성능을 유지하며, GigaSpeech와 VoxPopuli에서는 가장 높은 성능을 달성한다.

더 중요한 점은 이러한 강점이 의미론적 음성 태스크까지 확장된다는 것이다. MiniCPM-o 4.5는 CoVoST 2 en→zh, MELD, VoiceBench AlpacaEval, Speech TriviaQA에서 가장 높은 성능을 보인다. 이는 모델이 음성 조건부 표현을 활용하여 번역, 오디오 추론, 지시 수행, 지식 집약적 음성 질의응답을 수행할 수 있음을 보여준다. 한편 Speech Web Questions와 Speech CMMU에서 남아 있는 성능 격차는 검색형 사실 질의응답과 중국어 음성 지식 질의응답이 여전히 어려운 과제임을 보여준다. 2604.27393v1

표 4: 오디오 이해 벤치마크 결과

ASR 벤치마크는 낮을수록 좋다. *VoiceBench AlpacaEval 점수는 1점부터 5점까지의 척도로 평가한다.

벤치마크Kimi-AudioQwen3-OmniMiniCPM-o 4.5
크기9B30B-A3B9B
자동 음성 인식
AISHELL-1 ↓0.60.60.9
AISHELL-2 ↓2.62.32.5
WenetSpeech test-net ↓6.34.75.9
WenetSpeech test-meeting ↓5.45.95.7
LibriSpeech test-clean ↓1.31.21.4
LibriSpeech test-other ↓2.42.52.8
GigaSpeech test ↓9.48.78.5
VoxPopuli V1-En ↓8.06.46.2
음성 번역
CoVoST 2 en→zh36.646.649.9
CoVoST 2 zh→en18.329.426.4
멀티태스크 오디오 이해
MMAU68.477.576.9
MELD59.156.860.2
음성 질의응답
VoiceBench AlpacaEval*4.464.744.81
Speech TriviaQA41.962.975.5
Speech Web Questions46.474.970.2
Speech CMMU67.047.859.2

2604.27393v1

음성 생성. 표 5에서 볼 수 있듯이, MiniCPM-o 4.5는 음성 명료성과 표현 제어 측면에서 뚜렷한 강점을 보인다. SeedTTS Test-ZH와 SeedTTS Test-EN에서 가장 낮은 CER/WER을 달성하여 안정적인 이중언어 음성 생성 능력을 보여준다. LongTTS에서는 베이스라인 모델보다 훨씬 낮은 영어 WER을 기록하여 장문 영어 생성의 안정성이 더 높음을 보여주며, 중국어 CER에서는 CosyVoice2와 근접한 성능을 유지한다. 또한 Expresso와 ESD에서도 가장 높은 성능을 보여, 표현력 있는 음성 합성에서 더 강력한 감정 및 스타일 제어 능력을 나타낸다. 2604.27393v1

표 5: 음성 생성 결과

CER과 WER은 낮을수록 좋다. N/A는 지원되지 않음을 의미하며, *는 평가에 중립적인 참조 음성을 사용했음을 의미한다.

모델SeedTTS Test-ZH CER ↓SeedTTS Test-ZH SIM-oSeedTTS Test-EN WER ↓SeedTTS Test-EN SIM-oLongTTS EN WER ↓LongTTS ZH CER ↓Expresso*ESD*
CosyVoice21.4574.82.5765.214.805.2717.953.4
Qwen3-Omni1.41N/A3.39N/A17.3318.99N/AN/A
MiniCPM-o 4.50.8674.52.3864.93.376.5829.882.1

2604.27393v1

6.4 텍스트 결과

표 6에서 볼 수 있듯이 MiniCPM-o 4.5는 대부분의 텍스트 전용 태스크에서 백본 LLM보다 높은 성능을 보이며, 특히 복잡한 추론, 수학, 코딩, 지시 수행 태스크에서 강점을 나타낸다. 이는 텍스트 데이터와 멀티모달 데이터의 전략적인 균형을 통해 모델이 강력한 멀티모달 능력을 습득하는 동시에 기존의 텍스트 능력도 유지할 수 있음을 시사한다. 2604.27393v1 2604.27393v1

표 6: 텍스트 벤치마크 결과

모델IFEval-PLSBBHCMMLUMMLUHumanEvalMBPPMath500GSM8K평균
Qwen3-8B-Instruct83.069.478.781.786.675.984.093.481.6
MiniCPM-o 4.584.781.179.677.086.676.777.094.582.1

2604.27393v1

6.5 옴니모달 및 스트리밍 결과

옴니모달 이해. 표 7과 같이 MiniCPM-o 4.5는 강력한 옴니모달 이해 능력을 보여준다. 총 7개 벤치마크 가운데 Daily-Omni, WorldSense, Video-Holmes, JointAVBench, AVUT-Human의 5개 벤치마크에서 가장 높은 성능을 달성한다. 비교적 작은 파라미터 규모에도 불구하고 FutureOmni와 오디오를 포함한 Video-MME-Short에서도 경쟁력 있는 성능을 유지한다. 2604.27393v1

표 7: 심플렉스 설정에서의 옴니모달 벤치마크 결과

벤치마크Gemini 2.5 FlashQwen3-OmniMiniCPM-o 4.5
크기-30B-A3B9B
Daily-Omni79.370.780.2
WorldSense52.654.055.7
Video-Holmes51.350.464.3
JointAVBench55.653.160.0
AVUT-Human65.474.278.6
FutureOmni55.662.156.1
Video-MME-Short (오디오 포함)85.581.384.7

2604.27393v1

풀듀플렉스 결과. 표 8에서는 모델이 시각 스트림을 지속적으로 입력받는 동안 적절하게 응답할 수 있는지를 평가한다. MiniCPM-o 4.5는 LiveSports-3K-CC에서 54.4의 승률을 달성하여 LiveCC와 StreamingVLM보다 각각 12.9점, 8.8점 높은 성능을 기록한다.

이러한 향상은 Omni-Flow가 연속적인 시각 상호작용에 효과적임을 시사한다. 즉, 인식과 응답을 공유된 시간축에 따라 구성함으로써 모델은 지연되거나 단편적인 시각적 문맥에 의존하는 대신, 계속 변화하는 장면을 바탕으로 응답을 더 효과적으로 생성할 수 있다. 2604.27393v1 2604.27393v1

표 8: 시각 전용 풀듀플렉스 벤치마크 결과

벤치마크LiveCCStreamingVLMMiniCPM-o 4.5
크기8B8B9B
LiveSports-3K-CC41.545.654.4

2604.27393v1

6.6 분석

길이 보상에 대한 절제 실험. 응답 효율성과 태스크 성능 간의 절충 관계를 살펴보기 위해 길이 보상 설계에 대한 절제 실험을 수행한다. 경량 강화학습 실험을 수행하고 MMBench, MathVista, MMMU, AI2D, OCRBench, HallusionBench, MMStar에서의 평균 결과를 보고한다. Kimi K1.5 방식의 길이 보상 [30]과 본 논문에서 제안하는 평활 길이 보상을 비교한다.

표 9에서 볼 수 있듯이 Kimi K1.5 방식의 보상은 thinking 모드에서 응답 길이를 50.7%까지 크게 줄이는 반면, 벤치마크 평균 점수도 73.5에서 73.0으로 감소시킨다. 이에 비해 제안 방법은 thinking 태스크의 응답 길이를 35.3%로 보다 완만하게 줄이면서 벤치마크 평균 점수를 74.3까지 향상시킨다. Instruct 모드에서는 두 방법 모두 응답 길이를 약 20% 줄이는 한편, 제안 방법이 가장 높은 평균 성능을 유지한다. 2604.27393v1

표 9: 서로 다른 길이 보상 전략의 성능

길이 보상벤치마크 평균 Thinking벤치마크 평균 Instruct평균 길이 감소 Thinking평균 길이 감소 Instruct
길이 보상 없음73.570.9––
Kimi K1.5 방식 [30]73.070.150.7%20.2%
제안 방법74.370.935.3%20.5%

2604.27393v1

그림 6: 서로 다른 길이 페널티 방법을 사용했을 때의 학습 세트 정확도. 2604.27393v1

그림 6의 학습 곡선은 이러한 설계 간 차이를 추가로 설명한다. Kimi K1.5 방식의 보상은 학습 후반부에서 학습 정확도의 증가가 뚜렷하게 둔화되고 심지어 약간 저하되는 양상을 보인다. 이는 지나치게 공격적인 길이 보상이 정확도 보상과 충돌하여 추가적인 최적화를 억제할 수 있음을 시사한다.

제안 방법은 보다 부드러운 보상 형성(reward shaping)을 통해 이러한 불안정성을 피한다. 상당한 수준의 응답 길이 감소를 달성하면서도 학습 궤적은 길이 보상을 사용하지 않은 베이스라인에 더욱 가깝게 유지된다. 이러한 결과는 제안한 길이 보상이 더 나은 효율성-성능 절충을 제공함을 보여준다. 즉, 유용한 중간 추론 단계를 지나치게 불이익 처리하지 않으면서 불필요하게 긴 추론을 제거한다. 2604.27393v1

음성 생성 모드 비교. 표 10에서는 세 가지 음성 생성 모드, 즉 비인터리빙 생성, 제안하는 고정 텍스트 인터리빙, 그리고 동적 텍스트 인터리빙 전략인 TAIL을 비교한다.

표 10: 서로 다른 모드에서의 MiniCPM-o 4.5 음성 생성 품질

SeedTTS 테스트 세트에서의 결과를 보고한다.

인터리빙 모드ZH CER ↓ZH SIM-o ↑EN WER ↓EN SIM-o ↑
인터리빙 없음1.4474.12.7064.9
고정 텍스트0.8674.52.3864.9
동적 텍스트(TAIL)1.0474.13.9365.1

2604.27393v1

고정 텍스트 인터리빙은 가장 우수한 CER/WER을 달성한다. 이는 전체 텍스트를 모두 생성한 후 음성을 합성하는 방식과 비교하여, 청크 단위의 스트리밍 생성이 발음 정확도를 향상시킬 수 있음을 시사한다.

TAIL은 텍스트와 음성이 시간적으로 정렬된 상태를 유지해야 하는 보다 어려운 풀듀플렉스 환경을 위해 설계되었다. TAIL은 특히 영어 WER에서 인식 정확도를 다소 희생하지만 전반적으로 합리적인 수준의 음성 품질을 유지하며, 스트리밍 상호작용과 음성 생성 품질 사이에서 실용적인 절충점을 달성한다. 2604.27393v1

7 효율적인 실시간 추론

먼저 표준 vLLM [88] 환경에서 MiniCPM-o 4.5의 추론 효율성을 평가한다. 표 11에서 볼 수 있듯이, 단일 NVIDIA RTX 4090에서 Qwen3-Omni-30B-A3B와 비교했을 때 MiniCPM-o 4.5는 처리량과 메모리 사용량 모두에서 뚜렷한 이점을 보인다.

BF16 환경에서는 Qwen3-Omni-30B-A3B가 메모리 부족(OOM)으로 실행되지 않는 반면, MiniCPM-o 4.5는 19GB의 메모리를 사용하면서 초당 154.3토큰의 처리량을 달성한다. INT4 환경에서는 MiniCPM-o 4.5가 초당 212.3토큰의 처리량을 달성하며, Qwen3-Omni-30B-A3B와 비교하여 더 낮은 첫 토큰 지연시간과 거의 절반 수준의 메모리 사용량을 보인다. 2604.27393v1

표 11: vLLM을 사용하여 단일 NVIDIA RTX 4090에서 측정한 MiniCPM-o 4.5와 Qwen3-Omni-30B-A3B의 추론 효율성 비교

첫 토큰 지연시간은 64프레임의 시각 입력을 사용하여 평가하였으며, 처리량과 메모리 사용량은 텍스트 전용 태스크에서 측정하였다. OOM은 메모리 부족(out-of-memory)을 의미한다.

모델데이터 타입처리량 ↑ (tokens/s)첫 토큰 지연시간 ↓ (s)메모리 ↓ (GB)
Qwen3-Omni-30B-A3BBF16OOMOOMOOM
MiniCPM-o 4.5BF16154.30.5919
Qwen3-Omni-30B-A3BINT4147.80.9820
MiniCPM-o 4.5INT4212.30.5811

풀듀플렉스 스트리밍 모드의 배포 효율성을 더욱 향상시키기 위해, 우리는 llama.cpp [89]를 기반으로 한 효율적인 추론 프레임워크인 llama.cpp-omni를 개발하였다. 이 프레임워크는 MiniCPM-o 4.5의 스트리밍 상호작용 패러다임에 맞게 설계되었으며, 다양한 하드웨어 플랫폼에서 원활한 실행을 지원한다.

실행 효율성뿐 아니라 macOS, Windows, Linux를 포함한 여러 운영체제에서의 호환성도 검증하였다. 또한 사용자가 자신의 하드웨어에서 MiniCPM-o 4.5를 빠르게 배포하고 실시간 음성, 비전-언어, 풀듀플렉스 옴니모달 상호작용 기능을 체험할 수 있도록 경량 데모 시스템도 제공한다.

표 12에서는 서로 다른 하드웨어 구성에서 각 추론 프레임워크의 **실시간 계수(real-time factor, RTF)**와 메모리 사용량을 비교한다. PyTorch 구현과 비교했을 때 llama.cpp-omni는 RTX 4090과 DGX Spark 모두에서 RTF를 크게 낮추며, INT4 양자화 환경에서는 더 적은 메모리를 사용한다. 이는 llama.cpp-omni가 효율적인 실시간 배포에 효과적임을 보여준다.

표 12: MiniCPM-o 4.5의 서로 다른 추론 프레임워크 간 추론 효율성 비교

서로 다른 하드웨어 구성에서 실시간 계수(RTF)와 메모리 사용량을 보고한다. RTF가 낮을수록 추론 효율성이 높다. OOM은 메모리 부족을 의미한다.

프레임워크데이터 타입RTX 4090 RTF ↓RTX 4090 메모리 ↓ (GB)DGX Spark RTF ↓DGX Spark 메모리 ↓ (GB)
PyTorchBF16OOMOOM2.4326
PyTorchINT41.26141.2714
llama.cpp-omni (제안 방법)FP160.27190.4619
llama.cpp-omni (제안 방법)INT40.21110.2011

8 결론

기여. 우리는 실시간 풀듀플렉스 옴니모달 상호작용을 위한 9B 규모의 오픈소스 MLLM인 MiniCPM-o 4.5를 제시한다. MiniCPM-o 4.5는 음성 응답을 생성하는 동시에 시각 및 청각 스트림을 지속적으로 인식함으로써 기존의 턴 기반 멀티모달 상호작용을 넘어 보다 인간과 유사한 상호작용 패러다임을 가능하게 한다. 또한 실제 엣지 환경에서 효율적으로 동작하며, 배포 시 12GB 미만의 RAM만을 필요로 한다. 동시에 비전-언어 능력에서는 Gemini 2.5 Flash에 근접하고, 동일 규모의 오픈소스 MLLM 가운데 최상위 수준의 이미지 및 비디오 이해 성능을 제공한다.

또한 MiniCPM-o 4.5의 핵심 기술로서 통합 옴니모달 스트리밍 프레임워크인 Omni-Flow를 제안한다. Omni-Flow는 멀티모달 입력과 출력을 공유된 시간축을 따라 정렬함으로써 풀듀플렉스 및 선제적 멀티모달 상호작용을 위한 일반적인 모델링 방식을 제공한다. 2604.27393v1

한계. MiniCPM-o 4.5는 실시간 풀듀플렉스 옴니모달 상호작용에 대한 아직 초기 단계의 연구이며, 여러 측면에서 한계를 지닌다. 첫째, 길고 동적인 실제 환경의 스트리밍 상호작용에서 기초 능력과 강건성은 여전히 추가적인 개선과 검증이 필요하다.

둘째, 옴니모달 스트리밍 모드에서의 음성 생성은 때때로 불안정할 수 있으며, 여기에는 잘못된 발음이나 의도하지 않은 영어와 중국어의 혼용 등이 포함된다.

셋째, 웹 데모를 통해 편리하게 접근할 수 있지만, 네트워크 상태가 불안정한 경우 사용자는 지연 시간이 증가하거나 출력의 일부가 누락되는 현상을 경험할 수 있다. llama.cpp-omni를 이용한 로컬 배포는 보다 원활한 실시간 상호작용을 지원할 수 있다.

마지막으로, 모델의 선제적 행동은 아직 비교적 단순한 수준에 머물러 있으며, 보다 풍부한 문맥 인식형 계획과 자발적인 지원 기능은 향후 연구 과제로 남아 있다. 2604.27393v1\

Reference

댓글