NL-188, G-Eval: NLG Evaluation using GPT-4 with Better Human Alignment, Preprint 2023
◼ Comment 이 논문도 LLM을 평가자로 쓰는 것이다. 기억할 결론은 GPT3.5보다 GPT4가 더 좋다 GPT4는 이전 SoTA 방식들보다 좋고 사람과 유사한 결과를 보여준다. CoT을 활용하면 평가 성능이 더 올라가며, 여기서는 autoCoT 기법을 보여준다. 또한 discrete하게 출력한 점수를 바로 사용하지 않고, 토큰 확률을 활용하여 실수형 score을 도출한다. 실수형 score로 인해, 중복되는 점수 분포를 제거한다. 실수형 점수가 평가 성능이 더 높다는 것도 보여준다. 또한 LLM을 평가자로 하면, 이 점수로 다시 본인을 향상시킬 수도 있다. 즉 self-improve? 에 활용될 수도 있는데 여기서 실험한건 아니고 이는 추후 연구로 남겨둔거 같다. 0 Abstract 자연어 생성(NLG) 시스템이 생성하는 텍스트의 품질을 자동으로 측정하는 것은 어려운 과제입니다. 기존의 참조 기반 지표인 BLEU나 ROUGE와 같은 메트릭은 창의성과 다양성이 필요한 작업에 대한 인간 판단과 상관 관계가 상대적으로 낮다는 사실이 밝혀졌습니다. 최근 연구들은 새로운 작업에 인간 참조가 없는 경우에도 적용할 수 있는 대규모 언어 모델(Large Language Models, LLM)을 참조 없는 메트릭으로서 NLG 평가에 활용하는 것을 제안하고 있습니다. 그러나 이러한 LLM 기반 평가자들은 여전히 중간 규모의 신경망 평가자들보다 인간 판단과의 일치도가 낮습니다. 이 연구에서는 체인 오브 생각(Chain-of-Thoughts, CoT)와 form-filling paradigm을 결합한 방식으로 대규모 언어 모델을 활용하여 NLG 출력물의 품질을 평가하는 G-EVAL 프레임워크를 제안합니다. 텍스트 요약 및 대화 생성이라는 두 가지 생성 작업에 대한 실험을 진행하였습니다. GPT-4를 백본 모델로 사용한 G-EVAL은 요약 작업에서 인간과의 스피어만 상관 관계가 0.514로 나타나며, 이는 이전 방...