Short-005, TyDi QA: A Multilingual Question Answering Benchmark (2020-Arxiv + 20.04-Google AI Blog)
■ 개요, Comment ◾구글에서 공개한 데이터세트로 다국어 QA에 대한 데이터를 공개하였다. ◾일반적인 MRC 데이터세트는 문제점이 있다. (밑의 설명 참고) ◾또한 영어에 관련된 데이터세트가 많기 때문에 모든 언어적 특성을 이해하는 일반적으로 모델링을 하기 위한 데이터세트라고 보면 된다. ◾리더보드 사이트도 오픈되어있으니 많은 연구가 이뤄질 것으로 생각된다. ◾한국어 데이터세트도 포함하니 활용하기 좋을 것 같다. ◾참고로 논문의 reference에 KorQuAD가 있어서 깜짝 놀랐다. 0. Abstract 다국어 모델링의 과정을 신뢰도를 높이기 위해서는 믿을만하고 가치있는 평가들을 만들어야 하는 챌린지가 있다. 이 논문에서는 TyDi QA을 소개하고 11개의 다양한 언어들과 204K QA 쌍을 만들었다고 한다. TyDi QA는 다양한 언어들의 특성을 가지고 있기 때문에 (이것으로) 모델링한 결과가 세계의 많은 언어들을 일반화하길 기대한다. 여기서는 데이터의 품질을 검증하고 예시로 언어적인 분석과 영어에서만 발견되는 것이 아닌 언어적 현상을 관찰한다고 한다. 리얼하게 정보를 찾는 것을 제공하기 위하여 (priming effects을 피하기 위하여) 답을 모르는 사람이 질문을 하고 이것에 대해 답변을 하면서 데이터를 수집하였다고 한다. (번역을 이용한 데이터 수집은 안했는데 이유는 논문 뒷 부분에 있음) 기본적인 베이스라인 모델을 제공한다. 1. Introduction 일반적으로 정보를 찾는 유저들은 자동 QA 시스템과 높은 품질을 가지는 검색 엔진, 디지털 어시스턴트들로 부터 도움을 받는다. 그들의 질문을 information-seeking이고 그들은 답변을 원하는 상태이고 답을 모르는 상황이다. 실제 사용자들에게 연구가 align(일치)이 되어야 하며 커뮤니티는 information-seeking의 데이터세트로 대응을 하였다. 이러한 데이터세트로는 WikiQA, MS MARCO, QuAD, NQ (Natur...