CV-010, Visually Dehallucinative Instruction Generation: Know What You Don’t Know, Preprint 2024

멀티모달 모델에게 “모르면 모른다고 말하기”를 가르칠 수 있을까? 멀티모달 언어 모델은 이미지에 없는 내용을 그럴듯하게 만들어내곤 한다. 기존 연구는 주로 이미지에 존재하지 않는 객체를 언급하는 문제에 집중해 왔다. 예를 들어 이미지에 개가 없는데도 모델이 “개가 소파 위에 앉아 있다”고 답하는 식이다. 하지만 이미지 속 객체를 정확히 인식하더라도 여전히 답할 수 없는 질문이 있다. 사진 속 기차는 전체 노선을 몇 마일 운행하는가? 사진 속 타자는 다음 공을 파울로 칠 것인가? 이 사진은 정확히 어떤 방식으로 편집되었는가? 이런 질문은 이미지에 답의 근거가 없다. 그럼에도 모델은 “10마일”, “그렇다”, “사진을 잘라냈다”처럼 구체적인 답을 만들어낼 수 있다. Visually Dehallucinative Instruction Generation: Know What You Don’t Know 는 이러한 현상을 I Know hallucination , 줄여서 IK hallucination 이라고 부른다. 핵심 아이디어는 간단하다. 이미지로 답할 수 없는 질문에서는 억지로 답하지 말고, “알 수 없다”고 말하도록 학습하자. 다만 논문의 제목처럼 모델이 정말로 자신의 지식 범위를 파악하게 되었는지는 조금 더 신중하게 살펴볼 필요가 있다. 1. IK hallucination이란 무엇인가 논문은 다음과 같은 상황을 IK hallucination으로 정의한다. 적절한 답이 “I don’t know”인 질문에 대해 모델이 그 외의 답을 생성하는 경우 기존 visual hallucination 평가가 주로 객체의 존재 여부를 다뤘다면, 이 논문은 한 단계 더 나아가 질문에 답할 충분한 시각적 근거가 존재하는가 를 다룬다. ( arXiv ) 예를 들어 사진 한 장만 보고 특정 열차의 전체 운행 거리를 묻는다면, 이미지 인식 능력이 아무리 좋아도 답할 수 없다. 이때 좋은 모델은 가장 그럴듯한 숫자를 생성하는 대신, 이미지로는 확인할 수 없다고 답해야 한다. 논문은 이러한 사례...

Audio-028, Raon-Speech Technical Report, Preprint 2026

이미지
◼ Comment 이 논문은 인터리빙 스타일로(SpeechChat) 학습된 KRAFTON에서 나온 논문이다. 모델 초기 Qwen3-VL-8B-Instruct을 베이스로 한다 신기한건, instrcut 모델에 한국어-영어 pretraining을 하고, post-training을 한다는 점이다. 모델은 Raon-Speech와 Raon-SpeechChat이 있는데, 이 둘에 사용된 모듈이 다르다. Raon-Speech  오디오 입력은 continuous embedding을 받는다 pretrained AuT 모델로 초기화한 speech encoder을 사용한다. 여기에 2-layer MLP layer 태워서 text embedding가 차원맞춰서 입력으로 넣음 오디오 출력은 Mimi codec이 사용된다. Mimi codec은 원래 RVQ기반이고 32개의 residual codebook을 사용하지만, 여기서는 앞의 16개만 사용한다고 함 모델은 1개의 semantic token을 예측하고, 이후 depth transformer에서 acoustic token 15개를 예측하는것 LLM hidden state -> speech generation expert (SGE) -> semantic token c1 SGE는 4-layer의 Transformer 형태임 semantic token c1 -> RCP -> acoustic token 15개 예측 c1 -> RCP -> acoustic token c2 c1, c2 -> RCP -> acoustic token c3 이런식으로 순차적 예측 RCP는 5-layer Transformer로 Residual하게 작동하는것 화자 컨트롤하기 위해, LLM 입력 시퀀스에 목표 화자 음성을 인코딩을 넣고 이것을 따르게함 Raon-Speech 학습 세가지 학습 단계로 구성됨 1. 음성 이해 정렬 backbone LLM 고정. 즉 Qwen3-VL-Instruct는 고정함 즉 학습되는 ...