NL-055, DistilBERT, a distilled version of BERT: smaller, faster, cheaper and lighter (2019-Arxiv)
*Distilling 1. Pre-trained BERT 모델로 student 모델 초기화 2. Task data 로 Fine-tuned BERT 을 student 에 distilling 을 한다 . 3. 이 때는 teacher 의 predicted prob 을 이용한다 . 4. Fine-tuned 할 때는 distilling 을 이용안하는 듯하다 . ■ Comment Hugging Face라는 회사에서 낸 논문이데 HuggingFace는 다양한 BERT 버전을 사용하기 쉽게 코드화해서 배포한 것으로 유명하다. 세계적으로 다양한 언어로 구현된 BERT들이 있고 모델들 한국어 BERT로는 SKT의 BERT 가 들어가 있다. BERT뿐만 아니라 기존의 존재하는 코드를 파이토치로 쉽게 쓸 수 있게 해주고 다른 논문을 리프로듀싱하는 것도 있는 것 같다. 이 논문은 직접 학습시켜서 낸 논문이고 당연히 라이브러리화 되어 있다. 하지만 논문이 어디에 억셉된 것은 아니고 실제로 논문 내용을 봐도 상당히 간결하고 자세한 내용들은 없고 방법론은 기존의 방법론과 크게 차이 있어 보이지는 않는다. 0. Abstract 큰 스케일의 pre-trained model이 NLP에서 연구되고 있는데 이러한 큰 모델들을 계산 학습 혹은 인퍼런스 버짓이 정해진 제약이 있는 edge단에서 작동하는 것은 챌린지하다. 이 논문에서는 DistilBERT라고 하는 작고 general language representation 모델을 제안한다. 이는 많은 부분에서 finetune시 좋은 성능을 보여준다. 다른 이전의 연구들은 task-specific 모델에 맞는 distillation을 수행하지만 여기서는 Pre-training을 할 때 Knowledge distillation을 활용한다. 그 결과 BERT 사이즈는 40% 줄이고 lanugage understanding 능력은 99% 유지하고 60% 빠른 모델을 보여준다. Pre-training 시...