Audio-023, AQUA-Bench: Beyond Finding Answers to Knowing When There Are None in Audio Question Answering, ICASSP 2026
◼ Comment
- 오디오 벤치마크 AQUA을 제안하는건데, 기존 데이터시드에서 만든거고 IDK와 관련된 벤치마크라 보면됨
- 정확히는 IDK는 아니고, 정답없음? 응답할 수 없음?에 해당하는 벤치마크이다.
- 일단 공개된 데이터 시드가 있고 이를 LLM으로 QA 데이터세트를 만든다
- Animal Sound는 ESC-50, Music Instrument는 Music Instrument Sounds, Vocal Sound는 VocalSound, 그리고 추가로 MMAU를 사용한다.
- AAD: 거기에서 정답에 해당하는 것을 None of the above로 바꾸기
- IASD: 보기를 감정+None of the above 카테고리로 바꿔서, 질문 및 오디오입력과 상관없게 바꾸기
- IAQD: 보기를 감정+None of the above 이긴한데 입력 오디오만으로도 맞출 수 없는 케이스
- 정답 못맞추는 질문을 gpt-4o 로 만듬
- 그리고 공개 모델들로 평가를 진행
- 딱히 큰 분석이라기보다는 그냥 결과를 나열한것에 가까운데 모델마다 다른 경향을 보이긴함
- 기본적으로 AAD에서 보기에 정답이 없으면 다른 잘못된 보기를 고르는 경향이 강함
- IASD에서는 그래도 정답없음을 잘 고름
- IAQD에서는 일부 모델은 괜찮고 일부 모델은 별로임
- 평가 프롬프트에 "나열된 답변 중 어느 것도 맞지 않는다고 생각하면 None of the above를 선택하라"을 추가하니 전반적 성능 향상됨
- CoT 식으로 step-by-step으로 답변해라고 하니 성능 향상함
- 즉 모델에는 잠재적으로 맞출 수 있는 능력이 있긴 하다
- 응답에 대한 정답체크는 일단 답변을 생성하고 파싱해서 정답 체크
- llm judge가 필요해보임
ABSTRACT
최근 오디오 인식 대형 언어 모델의 발전은 오디오 질의응답에서 강력한 성능을 보여주었다. 그러나 기존 벤치마크는 주로 답할 수 있는 질문을 다루며, 오디오로부터 신뢰할 수 있는 답을 추론할 수 없는 “답할 수 없는 질문”의 문제를 간과한다. 이러한 경우는 실제 환경에서 흔히 발생한다. 예를 들어 질문이 오해를 유발하거나, 잘못 구성되어 있거나, 주어진 정보와 호환되지 않을 수 있다.
이러한 공백을 해결하기 위해, 우리는 Audio Question Unanswerability Assessment를 위한 벤치마크인 AQUA-Bench를 제안한다. AQUA-Bench는 세 가지 시나리오를 체계적으로 평가한다.
- 첫째, Absent Answer Detection은 정답 선택지가 없는 경우를 평가한다.
- 둘째, Incompatible Answer Set Detection은 선택지들이 질문과 범주적으로 맞지 않는 경우를 평가한다.
- 셋째, Incompatible Audio Question Detection은 질문이 오디오와 관련이 없거나 오디오에 충분히 근거하지 않는 경우를 평가한다.
이러한 사례들을 평가함으로써, AQUA-Bench는 모델 신뢰성을 엄격하게 측정할 수 있는 기준을 제공하며, 더 강건하고 신뢰할 수 있는 오디오-언어 시스템의 개발을 촉진한다. 우리의 실험은 모델들이 표준적인 답변 가능 과제에서는 뛰어난 성능을 보이지만, 답할 수 없는 질문에서는 종종 뚜렷한 어려움을 겪는다는 것을 보여준다. 이는 현재 오디오-언어 이해에서 중요한 사각지대가 존재함을 시사한다.
Index Terms
답할 수 없는 질문, 오디오 질의응답, 오디오 인식 대형 언어 모델
1. INTRODUCTION
오디오 인식 대형 언어 모델(Audio-aware Large Language Models, ALLMs) [1–25]은 최근 다양한 오디오 관련 과제에서 강력한 성능을 보여주고 있다. 이러한 모델의 능력을 평가하는 것은 실제 응용에서 모델을 개발하고 배포하는 방향을 잡는 데 필수적이다 [26–42]. 기존 평가 프로토콜 중에서, 다지선다형 오디오 질의응답(Audio Question Answering, AQA)은 Dynamic-SUPERB [43, 44]와 MMAU [45] 같은 벤치마크에서 표준적이고 널리 사용되는 형식이 되었다. 이 형식은 모델이 오디오를 이해하고 그에 대해 추론하는 능력을 평가하는 편리한 방법을 제공한다.
그러나 이러한 벤치마크는 모든 질문이 답할 수 있으며, 항상 정답 선택지가 존재한다고 암묵적으로 가정한다. 그 결과, 모델 행동의 중요한 측면, 즉 답할 수 없는 질문을 인식하고 적절히 처리하는 능력을 간과한다. 실제 상황에서는 오디오 데이터가 제시된 질문과 관련이 없을 수 있다. 또한 사용자 질문이 잘못 구성되어 있거나, 호환되지 않는 답변 선택지와 함께 제시될 수도 있다. 이러한 경우 신뢰할 수 있는 모델이라면 유효한 답을 제시할 수 없음을 인식하고 추측을 피해야 한다. 이러한 능력이 없으면 모델은 확신을 가지고 잘못된 응답을 제공할 수 있으며, 이는 신뢰성을 떨어뜨리고 민감한 응용에서 위험을 초래할 수 있다.
이러한 공백을 해결하기 위해, 우리는 AQUA-Bench(Audio Question Unanswerability Assessment)를 제안한다. AQUA-Bench는 ALLM이 답할 수 없는 질문을 탐지하고 적절히 응답할 수 있는지를 평가하기 위해 설계된 새로운 벤치마크이다. 이전 연구 [46–49]에서 영감을 받아, AQUA-Bench는 세 가지 유형의 답변 불가능 사례를 정의한다.
- (1) Absent Answer Detection, AAD: 정답이 의도적으로 제거된 경우.
- (2) Incompatible Answer Set Detection, IASD: 답변 선택지가 질문 유형과 호환되지 않는 경우.
- (3) Incompatible Audio Question Detection, IAQD: 오디오가 질문에 답하기에 충분한 정보를 포함하지 않는 경우.
이를 평가하기 위해, 우리는 서로 다른 오디오 유형에 기반한 세 가지 테스트 과제를 구성한다. 여기에는 생물음향 이벤트, 악기 소리, 인간의 비언어적 소리가 포함된다. 또한 MMAU [45]와 같이 널리 사용되는 벤치마크를 수정하여 답변 불가능 버전을 만들었으며, 우리의 구성 방법은 대부분의 기존 다지선다형 오디오 관련 instruction 벤치마크를 답변 불가능 변형으로 바꾸는 데 추가로 적용될 수 있다.
평가 과정에서는 먼저 정답이 존재하는 원래 질문을 테스트한 뒤, 이에 대응하는 세 가지 유형의 답변 불가능 사례를 평가한다. 이를 통해 답할 수 있는 질문에서 모델이 얼마나 잘 수행하는지를 먼저 확인한 다음, 답할 수 없는 질문을 처리하는 능력을 조사할 수 있다. 우리의 실험은 기존 모델들이 표준 벤치마크에서는 높은 정확도를 달성하지만, 답변 불가능 사례에서는 어려움을 겪는다는 것을 보여준다. 이는 이러한 질문을 처리하는 능력이 제한적임을 드러낸다. 따라서 오디오 이해에서 중요하지만 아직 충분히 탐구되지 않은 측면을 강조한다.
요약하면, 본 연구의 기여는 세 가지이다.
- (1) 우리는 모델이 답할 수 없는 오디오 질문을 어떻게 처리하는지 평가하기 위한 벤치마크인 AQUA-Bench를 제안하고, 세 가지 대표 설정인 Absent Answer Detection(AAD), Incompatible Answer Set Detection(IASD), Incompatible Audio Question Detection(IAQD)을 정식화한다.
- (2) 우리는 동물 소리, 악기 소리, 음성적 소리 등 다양한 오디오 유형을 포함하는 테스트 세트를 구성하고, MMAU와 같은 기존 벤치마크를 확장한다.
- (3) 광범위한 실험을 통해, 현재 ALLM들이 답할 수 있는 질문에서는 뛰어난 성능을 보이지만 답할 수 없는 질문을 인식하는 데에는 자주 실패한다는 중요한 사각지대를 드러낸다. 이는 더 신뢰할 수 있고 믿을 만한 시스템의 필요성을 강조한다.
2. METHOD
2.1. Task Formulation
표준 다지선다형 오디오 질의응답(Audio Question Answering, AQA) 과제는 오디오 클립 (A)와 질문 (Q)가 주어졌을 때, 후보 집합 (C)에서 정답을 선택하도록 모델에 요구한다. 목표는 정답 선택지 (c_i \in C)를 예측하는 것이다. 우리는 세 가지 범주에 초점을 맞춘다. 동물 소리, 악기 소리, 그리고 음성적, 즉 비언어적 인간 소리이다. 사용되는 instruction template은 예를 들어 “오디오에서 어떤 동물이 소리를 내고 있는가?”, “어떤 악기 소리가 들리는가?”, “어떤 비언어적 인간 소리가 들리는가?”와 같은 형태이다.
다지선다형 형식에 맞추기 위해, 각 instruction 뒤에는 (a)–(e) 형태의 후보 답변이 따라온다. 다양성을 높이기 위해, 우리는 각 과제 유형마다 15개의 템플릿을 사용하며, 단순 분류를 넘어서는 MMAU 벤치마크도 포함한다.
AQUA-Bench는 여기에 답할 수 없는 사례를 도입하여 이 문제 설정을 확장한다. 입력 오디오는 그대로 유지되지만, 모델의 목표는 두 가지가 된다. 질문이 답할 수 있는 경우에는 올바른 (c_i)를 출력해야 한다. 반대로 질문이 답할 수 없는 경우에는 “None of the above”와 같은 지정된 응답을 출력해야 한다.
우리는 풀 수 있는 AQA 인스턴스를 체계적으로 수정하여 답할 수 없는 사례를 생성한다. 이를 통해 벤치마크가 오디오 이해 능력뿐 아니라, 유효하지 않은 질문을 거부하는 중요한 능력까지 평가하도록 한다. Figure 1은 AQUA-Bench의 전체 개요를 보여준다.
2.2. Unanswerable Case Design
이전 연구 [46–49]에 동기를 받아, AQUA-Bench는 세 가지 답변 불가능 시나리오를 정의한다. 각각은 ALLM 추론에서 서로 다른 실패 양상을 겨냥한다. 구체적인 설명은 아래와 같다.
Absent Answer Detection (AAD):
- 제공된 선택지 안에 정답이 없을 때, 모델이 이를 탐지할 수 있는지를 평가한다.
- 예를 들어, 개가 짖는 녹음과 “이 소리를 내는 동물은 무엇인가?”라는 질문이 주어졌다고 하자.
- 선택지가 (a) Cat, (b) Bird, (c) Lion, (d) Frog, (e) None of the above라면, 정답인 dog는 선택지에 없다.
- 따라서 모델은 추가된 선택지인 “None of the above”를 선택해야 한다.
- 실제로 우리는 후보 집합에서 ground truth 정답을 의도적으로 제외하고, “None of the above”를 정답 선택지로 추가한다.
Incompatible Answer Set Detection (IASD):
- 질문과 후보 답변 사이의 불일치를 모델이 인식할 수 있는지를 테스트한다.
- 예를 들어, 바이올린 오디오 클립과 “이것은 어떤 종류의 악기인가?”라는 질문이 주어졌는데, 선택지가 (a) Happy, (b) Sad, (c) Surprised, (d) Angry라면, 이 선택지 집합은 호환되지 않는다.
- 이 단어들은 악기가 아니라 감정을 설명하기 때문이다. 실제로 우리는 원래 오디오와 질문은 유지하되, 답변 집합을 미리 정의된 distractor category, 예를 들어 색상, 감정, 직업 등에서 샘플링한 선택지로 교체하고, 여기에 “None of the above”를 추가하여 IASD 항목을 구성한다.
- 이를 통해 모델이 범주적 비호환성을 식별하도록 만든다.
Incompatible Audio Question Detection (IAQD):
- 질문이 오디오와 관련이 없거나, 오디오에 존재하지 않는 정보를 요구할 때 모델이 이를 탐지할 수 있는지를 평가한다.
- 예를 들어, 개가 짖는 소리만 주어졌는데 “개의 색깔은 무엇인가?”라고 묻는 경우는 비음향적 속성을 묻는 것이다.
- 또는 기타 소리만 주어졌는데 “누가 기타를 연주하고 있는가?”라고 묻는 경우는 오디오에 근거하지 않은 정보를 요구하는 것이다.
- 이러한 질문은 미리 정의된 의미적 distractor category, 예를 들어 색상, 장소, 감정, 객체 등을 사람이 설계한 질의에 매핑하여 구성한다.
- 이 질의들은 자연스럽지만 답할 수 없도록 만들어진다.
- 이 설계는 질문이 오디오와 호환되지 않을 때 모델이 그럴듯하지만 근거 없는 답을 생성하지 않도록 저항할 수 있는지를 평가한다.
단순 분류를 넘어 다양한 하위 과제를 포함하는 MMAU [45]의 경우, AAD와 IASD는 위의 전략을 따라 적용하지만, IAQD 인스턴스는 GPT-4o [1]를 사용해 생성한다. 구체적으로, 원래 항목을 모델에 제공하고, 질문을 답할 수 없는 버전으로 재구성하도록 요청하며, “Unanswerable”을 포함한 다섯 개의 선택지를 함께 제공하게 한다. 이를 통해 새 질문이 문법적으로 타당하고, 자연스러우며, MMAU의 범위와 일관되도록 한다.
요약하면, 우리의 방법은 오디오 분류 과제와 기존 오디오 벤치마크를 AAD, IASD, IAQD 형태로 체계적으로 변환한다. AAD와 IASD는 통제된 교체를 통해 구성된다. 반면 IAQD는 기반 과제가 분류 중심일 때는 유사한 전략을 따를 수 있다. 그러나 다양한 과제 형식을 포함하는 고급 추론 벤치마크의 경우, IAQD는 일반적으로 의미적으로 호환되지 않는 질문을 생성하기 위해 LLM을 필요로 한다. 더 많은 실제 질문 예시와 공개 데이터셋은 저자들의 웹사이트에서 확인할 수 있다.
- 3가지 버전의 데이터로 확장을 하는데, 한개는 정답을 None of the aboves로 만드는 방법. 두 개는 대답을 애초에 할 수 없는 버전임
- 즉 2개의 데이터 모두 None of the aboves을 선택해야 그나마 좋은 상황이긴함
2.3. Dataset Construction
동물 소리의 경우, 우리는 ESC-50 데이터셋 [50]을 사용하며, dog, rooster, pig, cow, frog, cat, hen, bird, sheep, crow와 같은 클래스를 선택한다. 악기 소리의 경우, Music Instrument Sounds 데이터셋 [51]을 사용하며, piano, acoustic guitar, drum set, violin, flute, saxophone, clarinet, trumpet, keyboard, harmonica를 포함한다. 음성적 소리의 경우, VocalSound 데이터셋 [52]을 사용하며, laughter, sighs, coughs, throat clearing, sneezes, sniffs와 같은 범주를 포함한다. 추가로, 널리 사용되는 평가 벤치마크인 MMAU [45]를 직접 포함한다.
2.4. Evaluation Protocol
우리는 2단계 평가 프로토콜을 채택한다. 먼저, 각 벤치마크의 원래 답변 가능 subset에서 모델을 테스트하며, 핵심 오디오 이해 능력을 측정하기 위해 accuracy를 보고한다. 다음으로, 세 가지 답변 불가능 subset인 AAD, IASD, IAQD를 conditional accuracy(CA)를 사용하여 평가한다.
구체적으로, 답변 불가능 사례에 대한 모델의 예측은, 해당 사례에 대응하는 답변 가능한 원래 문제를 모델이 올바르게 맞힌 경우에만 집계된다. 이를 통해 성능이 원래 과제에서의 오류에 의해 혼동되지 않고, 실제로 답변 불가능성을 인식하는 능력을 반영하도록 한다.
3. EXPERIMENTAL SETUPS
본 연구에서는 잘 알려져 있고, 완전히 오픈소스이며, 문서화가 충분히 이루어진 모델들을 baseline으로 사용한다. 여기에는 Qwen-Audio-Chat [53], Qwen2-Audio-Instruct [54], Qwen2.5-Omni [11], SALMONN [55]의 7B 및 13B 변형, LTU [2], LTU-AS [3], GAMA [56], Audio Flamingo 2 [24], Audio Flamingo 3(AF3) [9], Audio-Reasoner [57], Phi4-Multimodal-Instruct [21], BALSa-MA [14]가 포함된다.
또한 Gemini-Flash-2.5 [22], Gemini-Pro-2.5 [22], GPT-4o-Audio [1]를 포함한 proprietary commercial system들과도 비교한다. 특히 Qwen2.5-Omni [11], Audio Flamingo 3 [9], Audio-Reasoner [57]를 포함한 일부 baseline은 오디오와 텍스트에 대한 강한 공동 추론 능력을 갖도록 설계되어 있다.
대부분의 ALLM은 instruction following에 맞춰 튜닝되어 있으며, 미리 정의된 선택지 중 하나를 고르는 방식보다는 자유 형식의 응답을 생성하도록 설계되어 있다 [2, 3, 53–55]. 평가를 일관되게 만들기 위해, 우리는 생성된 출력에서 관련 답변을 추출하는 구조화된 절차를 적용한다.
- 일단 답변을 생성하고 파싱해서 정답 체크
- 근데 이러면 보기에 있는게 정확히 생성되어야 하는데, 좀 애매한거 같은데? llm judge로 판단할 필요가 있어보이는데
모든 실험에서는 greedy decoding을 사용하며, 최대 출력 길이는 1024 tokens로 설정한다. 답변 추출을 위해서는 MMAU [45]에서 사용한 방식과 유사하게, 모델 응답에서 핵심 정보를 식별하도록 신중하게 설계된 regular expression을 사용한다.
추가로, 2.4절에서 정의한 평가 프로토콜을 따른다. 즉, 답변 가능한 과제에 대해서는 accuracy를 보고하고, AAD, IASD, IAQD 사례에 대해서는 conditional accuracy(CA)를 사용한다.
4. RESULT
4.1. Performance on Answerable Questions
모델들이 답할 수 없는 질문을 어떻게 처리하는지 평가하기 전에, 우리는 먼저 정답이 항상 존재하는 표준 과제에서 모델들의 성능을 측정한다. 이 초기 단계는 명확한 baseline을 설정하고, 모델들의 핵심 오디오 이해 능력을 확인할 수 있게 해준다.
Table 1의 Ori. 열에 제시된 것처럼, 우리의 결과는 많은 선도적인 ALLM들이 잘 구성된 질문에 답하는 데 매우 능숙하다는 것을 보여준다.
이는 특히 Animal Sound 범주에서 뚜렷하게 나타난다. 예를 들어 Qwen2.5-Omni와 BALSa-MA는 96.4%라는 뛰어난 정확도를 달성했다. 마찬가지로 Gemini-2.5-Pro와 같은 proprietary model도 강한 성능을 보였으며, 동물 소리를 93.8%의 비율로 올바르게 식별했다.
이러한 높은 정확도는 다른 범주에서도 이어지며, 모델들은 Vocal Sound와 Music Instrument Sound에서도 전반적으로 좋은 성능을 보였다. 더 깊은 추론을 요구하는 더 복잡한 MMAU 벤치마크에서도, Qwen2.5-Omni와 AF3 같은 최상위 모델은 각각 75.4%와 79.3%를 기록하며 견고한 결과를 보였다.
이는 현재 state-of-the-art 모델들이 오디오 콘텐츠를 처리하고 이를 텍스트 질의와 연결하는 강한 능력을, 표준적이고 풀 수 있는 시나리오에서는 이미 갖추고 있음을 확인해준다. 요약하면, 이러한 답변 가능 과제에서의 강한 성능은 ALLM의 발전된 수준을 보여준다.
그러나 이상적인 조건에서의 이러한 성공은 중요한 질문을 제기한다. 과연 이 모델들은 질문에 답할 수 없거나 답해서는 안 되는 경우를 인식할 수 있는가? 다음 하위 절들은 이 문제를 탐구하며, 풀 수 있는 문제와 풀 수 없는 문제에서의 성능 사이에 존재하는 상당한 격차를 드러낸다.
4.2. Degradation on Unanswerable Questions
선도적인 모델들이 표준 과제에서는 능숙한 성능을 보였지만, AQUA-Bench의 답변 불가능 질문을 마주했을 때는 성능이 크게 달라졌다. 이는 오디오 내용을 이해하는 능력과, 그 이해의 한계를 인식하는 능력 사이에 뚜렷한 성능 격차가 있음을 보여준다. 풀 수 있는 질문에서 뛰어난 성능을 보인 가장 발전된 모델들조차, 질문이 답할 수 없는 경우임을 식별하는 데 종종 어려움을 겪었다.
이러한 문제는 일부 상위 성능 모델의 사례에서 분명하게 드러난다. 예를 들어, Audio Flamingo 3는 Animal Sound AAD 과제에서 원래 과제의 77.5% 정확도에서 단 0.7%로 급격히 하락했다. 이는 정답 선택지가 제거되었을 때, “none of the above” 선택지가 제공되었음에도 불구하고 모델이 잘못된 선택지를 고르는 경향이 있었음을 의미한다. 마찬가지로 강력한 multimodal model인 Qwen2.5-Omni는 표준 Vocal Sound 과제에서 92.2%라는 인상적인 성능을 기록했지만, AAD 변형에서는 7.2%로 떨어졌다.
그러나 이러한 어려움이 모든 모델에서 동일하게 심각한 것은 아니며, 일부 모델은 고무적인 강건성을 보였다. 위의 모델들과 달리, BALSa-MA는 동일한 Animal Sound AAD 과제에서 74.9%의 정확도를 달성했다. 아직 개선의 여지는 있지만, 이는 누락된 답변을 인식하는 능력이 비교적 더 강하다는 것을 보여준다.
또한 일부 모델들은 특정 유형의 답변 불가능 질문에 능숙한 것으로 나타났다. 예를 들어, Audio Flamingo 3와 Qwen2.5-Omni는 MMAU IAQD 과제에서 각각 99.1%와 90.8%라는 매우 높은 점수를 기록했으며, 제공된 오디오와 질문이 근본적으로 관련이 없을 때 이를 올바르게 인식했다.
이러한 대비가 본 연구 결과의 핵심이다. 이는 전반적인 약점이 존재하더라도, 답변 불가능 질문을 처리하는 능력이 모델 설계와 문제 유형에 따라 크게 달라진다는 것을 보여준다. 어떤 모델은 한 시나리오, 예를 들어 누락된 정답 선택지와 같은 경우에는 취약할 수 있지만, 다른 시나리오, 예를 들어 관련 없는 질문에서는 강건할 수 있다. 이는 모델들이 일관되게 실패하는 것이 아니라, 구체적이고 서로 다른 blind spot을 가지고 있음을 시사한다.
이러한 차이를 이해하기 위해, 다음 절에서는 세 가지 답변 불가능 시나리오를 더 자세히 분석하고, 모델들이 어떤 영역에서는 성공하면서 다른 영역에서는 극적으로 실패하는 이유를 살펴본다.
간단히 말하면, 모델마다 다른 경향을 보인다는 것
4.3. Analysis of Unanswerable Scenarios
성능 저하의 원인을 이해하기 위해, 우리는 세 가지 서로 다른 답변 불가능 시나리오 각각에서 모델들이 어떻게 행동하는지를 분석한다. 이 분석은 모델들이 일괄적으로 실패하는 것이 아니라, 각 시나리오가 모델 설계와 학습에서 서로 다른 유형의 약점을 드러낸다는 것을 보여준다.
Absent Answer Detection 과제는 아마도 가장 직관적인 도전 과제이다. 모델에게 명확한 오디오 클립과 유효한 질문이 주어지지만, 정답만 선택지에서 빠져 있다. 이상적인 응답은 이 부재를 인식하는 것이다. 그러나 Table 1의 결과는 대부분의 모델이 바로 이 지점에서 가장 큰 어려움을 겪는다는 것을 보여준다. 우리는 모델들이 “forced-choice” 경향을 강하게 보인다는 것을 관찰했다. 즉, 모델들은 “none of the above” 대안을 선택하기보다, 제공된 선택지 중 하나를 고르는 경우가 많았다. 예를 들어 Qwen2.5-Omni는 원래 Animal Sound 과제에서 96.4%를 달성했지만, AAD 버전에서는 20.5%로 떨어졌다. 이는 정답이 존재하지 않는다는 확신보다, 잘못된 답에 대한 모델 내부의 확신이 더 높았음을 시사한다. 이러한 행동은 Audio Flamingo 3에서 더 뚜렷하게 나타났으며, 같은 과제에서 77.5%에서 0.7%로 하락했다.
- 보기에 정답이 없으면, 모델들은 정답없음을 골라야하는데 그렇지 않고 다른 잘못된 보기를 고르는 경향이 강하다
Incompatible Answer Set Detection 시나리오에서는 불일치가 더 추상적이다. 답변 선택지들이 질문과 전혀 관련 없는 의미 범주에 속한다. 이는 모델이 범주적 관계를 파악할 수 있는지를 테스트한다. 흥미롭게도, 모델들은 AAD에 비해 이 과제에서 훨씬 더 좋은 성능을 보였다. 예를 들어 Qwen2.5-Omni는 여러 IASD 과제에서 높은 점수를 기록했으며, Animal Sounds에서는 83.6%, Vocal Sounds에서는 87.1%를 달성했다. 마찬가지로 BALSa-MA는 Vocal Sound IASD 과제에서 97.4%라는 매우 높은 점수를 기록했다. 이러한 광범위한 성공은 현대 ALLM들이 의미 범주에 대한 강한 내부 이해를 가지고 있음을 시사한다. 즉, 모델들은 “happy”가 “어떤 동물이 이 소리를 내고 있는가?”라는 질문에 대한 유효한 답이 아니라는 점을 효과적으로 인식할 수 있다. 이 결과는 모델의 지식이 단순한 표면적 패턴 매칭에 그치지 않고, 의미 있는 개념을 중심으로 조직되어 있음을 보여준다.
- 보기가 질문과 상관없는 경우에는, 그래도 정답없음을 잘 고른다는 것
Incompatible Audio Question Detection 과제는 가장 복잡한 도전 과제이다. 이 과제는 모델이 오디오만으로 어떤 정보를 추론할 수 있고, 어떤 정보는 추론할 수 없는지를 판단하도록 요구한다. 예를 들어, 모델은 개의 짖는 소리만으로는 개의 색깔을 알 수 없다는 점을 알아야 한다. 이 과제에서의 성능은 모델들을 추론 능력에 따라 뚜렷하게 구분한다. 우리는 이러한 더 깊은 cross-modal understanding을 가진 것으로 보이는 고성능 모델군을 확인했다. Audio Flamingo 2와 Qwen2.5-Omni는 MMAU IAQD 과제에서 각각 99.1%와 90.8%라는 뛰어난 결과를 보였다. 이는 이 모델들이 강건한 world knowledge를 가지고 있으며, 오디오 modality의 한계 때문에 질문에 답할 수 없는 경우를 식별할 수 있음을 의미한다. 반대로 다른 모델들은 어려움을 겪었는데, 이는 일반적인 연관성에 근거해 추측하거나 hallucination된 답을 생성했기 때문일 가능성이 있다. IAQD 과제에서 나타난 양극화된 결과는, 이 과제가 진정으로 신뢰할 수 있는 AI 시스템을 만드는 데 필수적인 고급 추론 능력을 탐지하는 probe로서 효과적임을 보여준다.
- 보기가 질문과 관련있지만 주어진 오디오만으로 정답을 고를 수 없는 경우엔, 모델마다 경향이 다른 결과임. 일부는 성능 괜찮고 일부는 안좋음.
이러한 행동을 더 깊이 조사하기 위해, 우리는 prompt에 명시적인 지침을 포함하는 효과도 탐구했다. 예를 들어 AAD와 IASD 과제에는 “나열된 답변 중 어느 것도 맞지 않는다고 생각하면 None of the above를 선택하라”와 같은 지시를 추가했고, IAQD 과제에는 “오디오에 판단에 필요한 세부 정보가 부족하면 ‘Unanswerable’을 선택하라”와 같은 지시를 추가했다. 그 결과 모든 모델에서 전반적인 성능 향상을 관찰했다. 이 결과는 모델들이 답변 불가능 질문을 식별하는 잠재 능력은 가지고 있지만, 직접적인 지시가 없으면 이 능력을 적용하는 데 자주 실패한다는 것을 시사한다. 모델들의 기본 행동은 forced-choice bias를 보이며, 적절한 답이 없을 때조차 선택지를 고르는 경향이 있다. 지면 제한으로 인해, 우리는 이러한 결과를 데모 웹사이트에 제시한다.
- 평가 프롬프트 수정하니 좀더 성능 올라가긴함
4.4. Reasoning Models on Unanswerables
핵심 질문은 Audio Flamingo 3(AF3)와 Qwen2.5-Omni처럼 고급 추론 능력으로 잘 알려진 모델들이 답할 수 없는 질문에 대해 본질적으로 더 강건한가이다. 이를 조사하기 위해, 우리는 이 모델들과 BALSa-MA를 Chain-of-Thought(CoT) [58] prompting 전략으로 평가했다. 우리는 모델에게 먼저 제공된 오디오를 바탕으로 질문이 답변 가능한지 아닌지를 단계별로 추론하도록 지시했다.
Table 1의 결과는 세 모델 모두에서 상당한 향상이 나타났음을 보여준다. 여러 AAD 과제에서 처음에는 거의 0에 가까운 점수를 기록했던 AF3는 CoT를 사용했을 때 강하게 회복했다. Animal Sounds에서는 31.9%, Vocal Sounds에서는 69.1%에 도달했으며, MMAU에서는 68.6%를 달성했다. Qwen2.5-Omni 역시 큰 향상을 보였다. Animal Sound AAD 점수는 20.5%에서 59.1%로 상승했고, 전체 MMAU AAD 정확도는 28.3%에서 59.3%로 개선되었다. BALSa-MA는 명시적 추론 없이도 이미 강한 성능을 보였지만, CoT 하에서는 더 향상되어 대부분의 답변 불가능 설정에서 일관되게 90%를 넘었다.
이 결과는 두 가지 통찰을 전달한다.
- 첫째, 강한 추론 모델들은 실제로 답할 수 없는 질문을 식별하는 잠재 능력을 가지고 있지만, 명시적으로 유도되지 않으면 forced-choice 행동을 기본값으로 보이는 경향이 있다.
- 둘째, CoT는 모든 모델에 도움이 되지만, 그 효과는 AF3와 Qwen2.5-Omni에서 특히 두드러진다.
- “먼저 step-by-step으로 이 질문이 오디오에 기반해 답할 수 있는지 판단하라” 이런식으로 CoT 프롬프트를 주면 성능이 전반적으로 향상된다라는 것
- 따라서 잠재적인 능력이 모델에 있긴하다는 것
5. CONCLUSION
우리는 오디오 질의응답에서 답변 불가능성을 평가하기 위한 벤치마크인 AQUA-Bench를 제안한다. AQUA-Bench는 세 가지 시나리오, 즉 Absent Answer Detection, Incompatible Answer Set Detection, Incompatible Audio Question Detection을 통해 답변 불가능성을 평가한다.
실험 결과, ALLM들은 표준적인 답변 가능 과제에서는 뛰어난 성능을 보이지만, 뚜렷한 forced-choice bias를 겪는다는 것을 보여준다. 즉, 모델들은 답변을 삼가야 할 때에도 종종 답을 생성한다.
또한 우리는 명시적인 prompting과 reasoning이 이러한 숨겨진 능력의 상당 부분을 회복할 수 있음을 보였다. 따라서 AQUA-Bench는 중요한 blind spot을 드러내며, 정확하면서도 신뢰할 수 있는 오디오-언어 시스템을 구축하기 위한 원칙적인 도구를 제공한다.
Reference
댓글
댓글 쓰기