라벨이 MRC인 게시물 표시

Short-005, TyDi QA: A Multilingual Question Answering Benchmark (2020-Arxiv + 20.04-Google AI Blog)

이미지
■ 개요, Comment ◾구글에서 공개한 데이터세트로 다국어 QA에 대한 데이터를 공개하였다. ◾일반적인 MRC 데이터세트는 문제점이 있다. (밑의 설명 참고) ◾또한 영어에 관련된 데이터세트가 많기 때문에 모든 언어적 특성을 이해하는 일반적으로 모델링을 하기 위한 데이터세트라고 보면 된다. ◾리더보드 사이트도 오픈되어있으니 많은 연구가 이뤄질 것으로 생각된다. ◾한국어 데이터세트도 포함하니 활용하기 좋을 것 같다. ◾참고로 논문의 reference에 KorQuAD가 있어서 깜짝 놀랐다. 0. Abstract 다국어 모델링의 과정을 신뢰도를 높이기 위해서는 믿을만하고 가치있는 평가들을 만들어야 하는 챌린지가 있다. 이 논문에서는 TyDi QA을 소개하고 11개의 다양한 언어들과 204K QA 쌍을 만들었다고 한다. TyDi QA는 다양한 언어들의 특성을 가지고 있기 때문에 (이것으로) 모델링한 결과가 세계의 많은 언어들을 일반화하길 기대한다. 여기서는 데이터의 품질을 검증하고 예시로 언어적인 분석과 영어에서만 발견되는 것이 아닌 언어적 현상을 관찰한다고 한다. 리얼하게 정보를 찾는 것을 제공하기 위하여 (priming effects을 피하기 위하여) 답을 모르는 사람이 질문을 하고 이것에 대해 답변을 하면서 데이터를 수집하였다고 한다. (번역을 이용한 데이터 수집은 안했는데 이유는 논문 뒷 부분에 있음) 기본적인 베이스라인 모델을 제공한다. 1. Introduction 일반적으로 정보를 찾는 유저들은 자동 QA 시스템과 높은 품질을 가지는 검색 엔진, 디지털 어시스턴트들로 부터 도움을 받는다. 그들의 질문을 information-seeking이고 그들은 답변을 원하는 상태이고 답을 모르는 상황이다. 실제 사용자들에게 연구가 align(일치)이 되어야 하며 커뮤니티는 information-seeking의 데이터세트로 대응을 하였다. 이러한 데이터세트로는 WikiQA, MS MARCO, QuAD, NQ (Natur...

NL-039, Stochastic Answer Networks for Machine Reading Comprehension (2018-ACL)

이미지
0.  Abstract Stochastic answer network을 제안하고 MRC multi-step 추론을 하는 것이다. 이전 연구인 ReasonNet(강화학습을 사용한)과 비교해서 unique feature은 stochastic prediction dropout on the answer module(마지막 층)을 학습시에 한다. 일반적으로 마지막 layer에는 dropout을 안쓴다. 왜냐하면 classification에서는 항상 같은 수의 출력이 나와야하기 때문..근데 어떤 의미로 쓴 것일까? 모델이 confidence을 높이기 위해, 즉 calibration을 하기 위해 MCMC 기법(?)을 이용하여 dropout을 사용하는 논문이 있는 것으로 알고 있다. (이것과 비슷한 트릭일까?) 1. Introduction MRC에 대한 평가로 SQuAD 데이터를 사용하는게 일반적이다. Q: What collection does the V&A Theator & Performance galleries hold? P: The V&A Theator & Performance galleries opened in March 2009. ... They hold the UK’s biggest national collection of  material about live performance 이것을 맞추려면 They 가 The V&A Theator & Performance galleries 을 가리키고 있는 것을 알고 있어야 한다. 그리고 They가  material about live performance 을 hold 함을 추출하는 것을 알아내면 된다. 이렇게 추론을 하는 과정은 multi-step reasoning (multi-step strategy)임을 알 수가 있다. 이렇게 다단계 추련을 할 때, 첫 번째 모델은 fixed number of step...

NL-038, Attention-over-Attention Neural Networks for Reading Comprehension (2017-ACL)

이미지
SQuAD 리더보드 보면 AOA가 있는데 Attention-over-Attention의 약자라고 하고 이에 대한 논문이다. 2016년에 나온 것이라 기존 논문처럼 세세히 읽으면서 이 당시 문제점을 알고 정리하기 보다는, 전체적인 개요와 방법쪽으로 정리하겠음. 0. Abstract Cloze-style reading comprehension은 document와 query 사이의 문제를 해결하는 것이다. 여기서 cloze-style RC란 빈칸 채우기라 생각하면 된다. BERT 논문에서 이를 이용하여 pre-train 했던 기억을 떠올려보자... 여기서 question의 @placeholder가 passge의 어떤 @entity?와 같은지를 찾는 것이라 보면 된다. 즉 question 문장의 빈칸 채우기인데 passage에 후보들이 있는 개념 여기서 정답 후보들도 위의 책 내용에 있는 것이다. CNN 뉴스와 똑같은 형식. 약간 지금 MRC 이전에 약간 쉬운 버전으로 paragraph가 있고 question에 해당하는 후보가 주어지고 후보 중에 선택하는 느낌과 비슷하다. 물론 질문이 아니고 빈칸 채우기 식이지만... 여기서 attention-over-attention reader을 이용하여 cloze-style reading comprehension을 더 잘 푸려고 한다. 이 방법은 최종 answer prediction을 위해 document-level attention에 대한 attention 메커니즘에 초점을 맞춘다. 논문 모델의 장점은 간단하면서도 비슷한 연구들에 비해 성능이 좋다. 추가적으로 N-best re-ranking 전략으로 후보 정답자에 대한 validity를 double check을 함으로써 성능을 올렸다. 이 당시 SOTA를 찍었다고 함. verify처럼 검증하는 거겠지?? CNN(뉴스)과 Children's Book Test로 실험을 하였음. 1. Introduction ...