NL-358, AA-Omniscience: Evaluating Cross-Domain Knowledge Reliability in Large Language Models, Preprint 2025
◼ Comment
- 여기서 IDK에 대한 평가가 중요하다고 설명하고, 새로운 데이터를 만들었다고 함
- AA-Omniscience는 총 6,000개 질문으로 구성되어 있고, Business, Health, Law, Software Engineering, Humanities & Social Sciences, Science/Engineering/Mathematics 등 6개 도메인과 42개 카테고리를 다룬다.
- 질문은 “짧고 정확한 답”을 요구하도록 설계된다. 예를 들어 날짜, 이름, 숫자, 장소, 버전 번호 같은 답이다.
- 질문은 어렵고, 모호하지 않고, 특정 문서 페이지 같은 source-specific 지식에 의존하지 않도록 필터링된다.
- 데이터 시드는, 기존에 권위있는 출처데이터에서 LLM으로 질문을 생성하고, 이를 다시 paraphrase해서 목적에 만들었다고 보면됨
- 6000개중 공개된것은 600개만 오픈되어있고, AA-Index에서 만든것이기 때문에 활용해봄직할 듯
- 데이터 예시
- Which Privy Council case decided in 2020 addressed remoteness of damage in contract law?
- What JavaScript error type is thrown when using the delete operator on super.prop?
- 평가 프롬프트
- You are answering questions about {topic}, and in particular {category}. You will be given a question, answer with JUST the answer (no explanation). If you do not know the answer, or you need more context or tools to answer the question, be clear about this - it is better that you say this than get the wrong answer.
- 즉 질문에 대해 답변을 자유롭게 받고 이를 llm judge로 4가지 카테고리로 판단한다.
- 프롬프트
- Your job is to look at a question, a gold target, and a predicted answer, and then assign a grade of either CORRECT, INCORRECT, PARTIAL ANSWER, or NOT ATTEMPTED. First, I will give examples of each grade, and then you will grade a new example.
- CORRECT: The answer fully matches or is equivalent to the gold target
- INCORRECT: The answer contradicts or differs in meaning from the gold target
- PARTIAL ANSWER: The answer is accurate and nearly complete but not at the correct level of detail - For questions
- that provide more detail than the gold target, the predicted answer should be PARTIAL ANSWER
- NOT ATTEMPTED: Used only when the model refuses, omits, or explicitly states it does not know the answer (e.g. empty response), or needs more context or tools to answer the question
- judge 모델은 Google Gemini 2.5 Flash Preview (09-2025) with reasoning 사용했다고 함 (사람평가랑 align이 잘 되었다고함)
- 평가 지표
Abstract
기존의 언어 모델 평가는 주로 일반적인 능력을 측정하는 데 초점을 맞추고 있다. 그러나 다양한 도메인에서 이러한 모델을 신뢰성 있게 사용하려면, 사실적 정확성뿐만 아니라 모델이 자신이 모르는 것을 인식하는 능력도 필요하다.
우리는 AA-Omniscience를 제안한다. 이는 총 6,000개의 질문을 통해 사실적 기억 능력과 지식 보정 능력을 함께 측정하도록 설계된 벤치마크이다. 질문은 권위 있는 학술 및 산업 자료에서 파생되었으며, 6개 도메인 안의 경제적으로 중요한 42개 주제를 다룬다.
이 평가는 모델의 Omniscience Index를 측정한다. 이 지표는 -100에서 100 사이의 값을 가지며, 사실적 기억 능력을 평가하되, 환각을 함께 벌점화하고 불확실할 때 답변을 회피하는 것을 보상한다. 점수 0은 모델이 질문에 정답을 내는 빈도와 오답을 내는 빈도가 같은 수준임을 의미한다.
평가된 모델 중에서는 Claude 4.1 Opus가 가장 높은 점수인 4.8점을 기록했으며, 0점 이상을 받은 단 세 개의 모델 중 하나였다. 이러한 결과는 최신 프론티어 모델들에서도 사실성 및 보정 능력의 약점이 여전히 지속되고 있음을 보여준다.
또한 성능은 도메인별로 달랐으며, 6개 도메인에서 각각 서로 다른 세 연구소의 모델들이 선두를 차지했다. 이러한 성능 변동성은 지식이 중요한 작업에서는 단순한 일반 성능이 아니라, 실제 사용 사례의 요구에 맞춰 모델을 선택해야 함을 시사한다.
1 Introduction
전반적인 언어 모델 성능이 계속 향상되고 있음에도 불구하고, 프론티어 모델들은 여전히 사실적인 출력을 신뢰성 있게 생성하는 데 어려움을 겪고 있다. 오늘날 널리 사용되는 정확도 기반 평가 방식은 이러한 격차를 만드는 핵심 원인일 가능성이 높다. 대부분의 평가는 코딩(Jain et al., 2024; Tian et al., 2024), 언어 이해(Hendrycks et al., 2020), 도구 사용(Barres et al., 2025; Patwardhan et al., 2025)과 같은 모델 능력에 초점을 맞추며, 지표 역시 환각이나 지식 보정이 아니라 전반적인 정답 여부를 중심으로 설계되어 있다. 이러한 능력과 지표를 측정하는 것은 모델의 전반적인 지능을 어느 정도 보여주지만, 서로 다른 사용 사례에서 신뢰할 수 있는 모델을 선택하려는 사람들에게는 전체 그림을 제공하지 못한다.
지식은 실제 사용에서 매우 중요하다. 모델이 검색이나 도구 사용 능력을 갖추고 있더라도, 모델 내부에 내재된 지식은 도구 사용과 경쟁력 있는 성능을 낼 수 있으며, 동시에 효과적인 도구 사용의 전제 조건이 될 수도 있다. 한편으로, 더 뛰어난 내재 지식을 가진 모델은 자원과 시간이 많이 드는 도구에 덜 의존하며, 정말 필요할 때만 도구를 사용한다. 다른 한편으로, 신뢰할 수 있는 사실적 입력은 효율적인 도구 사용을 보완한다. 도구 사용 능력이나 문맥 이해가 부족하면 모델 출력의 품질이 낮아질 수 있기 때문이다(Cheng et al., 2024). 예를 들어, 모델이 효율적으로 검색하려면 문맥과 약어를 이해해야 하는데, 내재 지식이 부족한 모델에게는 이것이 어려울 수 있다(그림 2 참조).
언어 모델의 지식이 앞으로 어떻게 발전할지에 대해서는 업계 내에서도 견해가 다르지만(Karpathy, 2024), 다음 두 가지는 분명하다.
- (1) 더 작은 모델들이 실제 작업을 처리할 만큼 충분한 내재 지식과 도구 사용 효율성을 갖추기 전까지는, 내부 지식이 모델 유용성의 핵심 결정 요인으로 남을 것이다.
- (2) 특정 도메인과 작업에 관한 정보는 해당 영역에서 작동하는 모델에게 항상 도움이 될 것이다.
사실을 회상하지 못하는 것 외에도, 모델들은 종종 자신의 지식 한계를 인식하지 못하고, 불확실한 상황에서도 자신감 있게 틀린 답을 내놓는다. 잘못된 보정은 비효율적인 도구 사용으로도 이어진다. 모델이 필요하지 않을 때 도구를 호출하거나, 반대로 필요할 때 도구를 무시할 수 있기 때문이다.
최근 연구(Kalai et al., 2025)는 이러한 지속적인 환각 행동의 원인을 현재 평가 방식의 불일치에서 찾는다.
- 대부분의 벤치마크는 답변 회피보다 추측을 보상하며(Hendrycks et al. (2020); Rein et al. (2023)), 이는 사후 학습 과정에서 과도한 자신감을 강화한다.
- 이를 해결하기 위해서는 벤치마크가 단순한 정답 여부를 넘어, 모델의 보정 능력과 답변 회피 행동까지 측정해야 한다.
- 이 논문과 해당 논문 (kalai)가 핵심 레퍼런스로 보면 좋을듯
그림 2: 내재 지식이 낮은 모델과 강한 내재 지식 능력을 가진 모델 사이에서 나타나는 실제 채팅 애플리케이션 예시. 내재 지식이 제한된 모델은 더 나쁜 결과를 보인다.
본 논문은 AA-Omniscience를 소개한다. 이는 모델이 여러 도메인에 걸쳐 사실 정보를 정확히 회상하는 능력과, 자신의 지식이 부족할 때 올바르게 답변을 회피하는 능력을 함께 측정하도록 설계된 벤치마크 데이터셋이다. AA-Omniscience는 잘못된 추측에 벌점을 부여한다는 특징을 갖는다. 이는 정확도, 즉 정답을 맞힌 질문 수나, 모델이 답을 모를 때 잘못 추측한 비율인 환각률과 구별된다. 따라서 이 벤치마크는 사용자가 특정 도메인 작업에 적합한 모델을 선택하는 데 매우 관련성이 높다.
이 데이터셋은 총 6,000개의 질문으로 구성되며, 경제적으로 중요한 여러 도메인에 걸쳐 나뉘어 있다. 질문 세트의 전체 구성은 그림 3에 제시되어 있다.
질문은 질문 생성 에이전트를 사용해 만들어지며, 이 에이전트는 권위 있는 출처에서 질문을 도출하고, 유사도, 난이도, 모호성을 기준으로 질문을 필터링한다. 그 결과 AA-Omniscience는 더 많은 도메인으로 쉽게 확장될 수 있으며, 관련 정보를 반영해 지속적으로 업데이트될 수 있다.
AA-Omniscience는 기존의 지식, 사실성, 환각 벤치마크를 개선하며, 특히 다음 요소에 초점을 둔다.
• 실제 세계와의 관련성. AA-Omniscience는 ‘상식 퀴즈’식 지식이 아니라, 언어 모델 사용이 증가하고 있는 핵심 산업 및 학문 분야에 맞춰져 있다. 또한 입력이나 학습 데이터와의 모순을 기준으로 환각을 측정하는 방식(Bang et al., 2025)이 아니라, 권위 있는 출처의 정보를 바탕으로 지식 신뢰성을 측정한다.
• 도메인 전반의 일반성과 시간에 따른 확장 가능성. 기존의 사실 기반 벤치마크는 수작업 데이터셋 생성에 의존하기 때문에 노동집약적이다(Wei et al., 2024a). 반면 AA-Omniscience는 특수 목적의 질문 생성 에이전트를 사용해 생성된다. 이 에이전트는 신뢰할 수 있는 입력을 활용하여 입력 텍스트 안의 사실 명제에만 초점을 맞춘 질문을 만든다. 이 과정은 검토와 검증을 위한 수동 개입만 필요로 하며, 높은 수준과 난이도를 유지하면서도 새로운 주제와 도메인으로 질문 세트를 빠르게 확장할 수 있게 한다. 또한 이 평가는 최근 데이터를 반영해 기존 주제의 질문을 지속적으로 업데이트할 수 있으므로 관련성을 유지할 수 있다.
• 잘못된 추측보다 답변 회피를 보상. 현재 많은 평가는 모델이 불확실할 때 추측하도록 보상하며(Kalai et al., 2025), 이는 환각 경향을 지속시킨다. 반면, 본 논문의 Omniscience Index는 답변 회피와 비교해 잘못된 추측에 벌점을 부여한다. 이 지표는 실제 사용에서 기대되는 모델의 유용성과 점수를 정렬하며, 모델이 사실 질문에 얼마나 잘 답하는지뿐 아니라, 언제 답하지 말아야 하는지를 판단하는 능력까지 함께 보여준다.
• 프론티어 모델에게도 어려운 난이도. 기존 사실성 벤치마크의 포화 문제를 극복하기 위해, 질문은 현재 프론티어 모델들에게도 어려운 벤치마크가 되도록 필터링된다(Kwiatkowski et al., 2019).
• 문맥이나 도구에 독립적. AA-Omniscience의 답변은 여러 주제에 걸친 모델의 기본 지식 회상 능력을 측정한다. 이는 검색 도구나 사전 문맥에 명시적으로 의존하는 평가들과 다르다(Kasai et al., 2024).
본 논문의 핵심 기여는 다음과 같다.
• 새로운 벤치마크. AA-Omniscience를 제안하며, 지식 신뢰성에 대한 추가 평가를 촉진하기 위해 공개 질문 세트인 AA-Omniscience-Public도 오픈소스로 제공한다. 공개 질문 세트에 대한 자세한 내용은 Appendix B를 참조한다.
• 세분화된 벤치마킹 결과. 모델, 서로 다른 주제, 그리고 다양한 세부 수준에 걸친 포괄적인 결과와 각 지표를 제공한다.
• 포괄적이고 최신성을 유지하는 평가. 평가 결과는 artificialanalysis.ai에 게시되며 지속적으로 업데이트된다. 이를 통해 최신 벤치마크 업데이트와 Artificial Analysis가 다루는 최신 모델을 반영하여, 현재 지식 신뢰성의 상태를 전체적으로 파악할 수 있게 한다.
방법론을 번역하기보다는 구조만 정리하면, 이 논문 평가는 다음 흐름이다.
1. 테스트 데이터 예시
AA-Omniscience는 총 6,000개 질문으로 구성되어 있고, Business, Health, Law, Software Engineering, Humanities & Social Sciences, Science/Engineering/Mathematics 등 6개 도메인과 42개 카테고리를 다룬다. 질문은 “짧고 정확한 답”을 요구하도록 설계된다. 예를 들어 날짜, 이름, 숫자, 장소, 버전 번호 같은 답이다. 질문은 어렵고, 모호하지 않고, 특정 문서 페이지 같은 source-specific 지식에 의존하지 않도록 필터링된다.
논문에 나온 질문 예시는 이런 식이다.
Law 예시
원래 질문:
Which case addressed remoteness of damage in contract law?
수정 후:
Which Privy Council case decided in 2020 addressed remoteness of damage in contract law?
즉, “어떤 판례?”처럼 너무 넓은 질문을 “2020년에 Privy Council이 판단한 계약법상 손해의 원격성 판례”처럼 더 구체화한다.
Software Engineering 예시
원래 질문:
What error is thrown in the example of super.prop?
수정 후:
What JavaScript error type is thrown when using the delete operator on super.prop?
즉, 특정 문서 예시에 의존하는 질문을 JavaScript 지식 자체를 묻는 형태로 바꾼다.
삭제된 질문 예시
At a copper price of 70 cents per pound, what quantity in kilotons per year would the Bingham Canyon mine produce at full capacity?
이런 질문은 모호해서 제거된다.
What was the exact date that the Python 3.13 documentation was last modified?
이런 질문은 특정 source text의 메타데이터에 의존하므로 제거된다.
2. 실제 평가 프롬프트
평가 대상 모델에게는 context나 tool access를 주지 않는다. 즉, 검색 없이 모델 내부 지식만으로 답하게 한다. 대신 모델에게 “확실할 때만 답하고, 모르면 모른다고 하는 것이 틀린 답을 내는 것보다 낫다”는 지시를 준다.
논문 Appendix의 Answerer System Prompt는 대략 이런 형태다.
You are answering questions about {topic}, and in particular {category}. You will be given a question, answer with JUST the answer (no explanation). If you do not know the answer, or you need more context or tools to answer the question, be clear about this - it is better that you say this than get the wrong answer.
즉, 모델 출력은 설명 없이 답만 내야 한다. 그리고 모르면 abstain하도록 유도한다.
3. Judge 모델과 채점 방식
모델 답변은 별도의 grading model이 채점한다. 채점 label은 네 가지다.
| Label | 의미 |
|---|---|
| Correct | 정답과 완전히 같거나 의미상 동등함 |
| Partially correct | 거의 맞지만 요구된 세부 수준과 정확히 맞지는 않음 |
| Incorrect | 정답과 모순되거나 의미가 다름 |
| Not attempted | 답하지 않음, 모른다고 함, 추가 context/tool이 필요하다고 함 |
Judge 모델은 Google Gemini 2.5 Flash Preview (09-2025) with reasoning을 사용했다. 저자들은 이 모델이 테스트한 다른 judge 후보들, 즉 gpt-oss-120b, Qwen3-235B-A22B-Thinking, GPT-5보다 human grading과 더 잘 맞아서 선택했다고 말한다.
채점 프롬프트는 question, gold target, predicted answer를 보고 다음 중 하나를 고르게 한다.
A: CORRECT
B: INCORRECT
C: PARTIAL ANSWER
D: NOT ATTEMPTED
그리고 최종 출력은 A/B/C/D 한 글자만 반환하게 한다.
4. 평가 메트릭
핵심 메트릭은 Omniscience Index (OI)다.
[
OI = 100 \cdot \frac{c - i}{c + p + i + a}
]
여기서
(c): correct answers 수
(p): partially correct answers 수
(i): incorrect answers 수
(a): abstain한 질문 수
핵심은 정답은 +1, 오답은 -1, abstain은 0에 가깝게 처리한다는 것이다. 그래서 모델이 아무거나 찍어서 많이 틀리면 점수가 크게 깎인다. 반대로 모르는 문제에서 답을 회피하면 오답보다 낫다. OI는 -100에서 100 사이 값으로 스케일링된다.
추가로 보고하는 지표는 다음과 같다.
Accuracy
[
Accuracy = \frac{c}{c+p+i+a}
]
전체 문제 중 완전 정답 비율이다.
Hallucination rate
[
Hallucination\ rate = \frac{i}{p+i+a}
]
모델이 정답을 못 맞힌 상황에서, 부분정답이나 abstain이 아니라 틀린 답을 낸 비율로 볼 수 있다. 논문에서는 이 지표를 모델이 “모를 때 틀린 답을 할 가능성”을 보여주는 지표로 사용한다.
Cost to run
평가 대상 모델이 AA-Omniscience 전체를 푸는 데 들어간 input/output token 비용을 USD로 계산한다. reasoning token도 포함하지만, grading model 비용은 제외한다.
정리하면, 이 논문은 단순히 “많이 맞히는 모델”을 보려는 것이 아니라, 맞힐 수 있는 것은 맞히고, 모르는 것은 모른다고 할 수 있는 모델을 평가하려는 벤치마크다.
Reference
댓글
댓글 쓰기