글

라벨이 bigmodel인 게시물 표시

NL-188, G-Eval: NLG Evaluation using GPT-4 with Better Human Alignment, Preprint 2023

이미지
◼ Comment 이 논문도 LLM을 평가자로 쓰는 것이다. 기억할 결론은  GPT3.5보다 GPT4가 더 좋다 GPT4는 이전 SoTA 방식들보다 좋고 사람과 유사한 결과를 보여준다. CoT을 활용하면 평가 성능이 더 올라가며, 여기서는 autoCoT 기법을 보여준다. 또한 discrete하게 출력한 점수를 바로 사용하지 않고, 토큰 확률을 활용하여 실수형 score을 도출한다. 실수형 score로 인해, 중복되는 점수 분포를 제거한다. 실수형 점수가 평가 성능이 더 높다는 것도 보여준다. 또한 LLM을 평가자로 하면, 이 점수로 다시 본인을 향상시킬 수도 있다. 즉 self-improve? 에 활용될 수도 있는데 여기서 실험한건 아니고 이는 추후 연구로 남겨둔거 같다. 0 Abstract 자연어 생성(NLG) 시스템이 생성하는 텍스트의 품질을 자동으로 측정하는 것은 어려운 과제입니다.  기존의 참조 기반 지표인 BLEU나 ROUGE와 같은 메트릭은 창의성과 다양성이 필요한 작업에 대한 인간 판단과 상관 관계가 상대적으로 낮다는 사실이 밝혀졌습니다.  최근 연구들은 새로운 작업에 인간 참조가 없는 경우에도 적용할 수 있는 대규모 언어 모델(Large Language Models, LLM)을 참조 없는 메트릭으로서 NLG 평가에 활용하는 것을 제안하고 있습니다.  그러나 이러한 LLM 기반 평가자들은 여전히 중간 규모의 신경망 평가자들보다 인간 판단과의 일치도가 낮습니다. 이 연구에서는 체인 오브 생각(Chain-of-Thoughts, CoT)와 form-filling paradigm을 결합한 방식으로 대규모 언어 모델을 활용하여 NLG 출력물의 품질을 평가하는 G-EVAL 프레임워크를 제안합니다.  텍스트 요약 및 대화 생성이라는 두 가지 생성 작업에 대한 실험을 진행하였습니다.  GPT-4를 백본 모델로 사용한 G-EVAL은 요약 작업에서 인간과의 스피어만 상관 관계가 0.514로 나타나며, 이는 이전 방...

NL-184, Can Large Language Models Be an Alternative to Human Evaluations?, ACL 2023

이미지
◼ Comment 빠르게 번역기로 살펴보았는데, 나쁘지 않는 논문 같다 LLM이 좋은 zero-shot task인건 알겠는데, 평가자로 활용해도 되는가?에 대한 질문을 해결하는 논문이다. 결론으로는 LLM으로 평가해도 사람이 평가한 것과 유사하단 결과가 나온다. 2가지 테스크에 대해 실험을 한다. 1. open-ended story generation 스토리를 생성하는 모델 GPT2을 학습하여 테스트세트에 대해 스토리 생성을 시킨다. 사람이 생성한 스토리와 gpt2-generated 와 비교한다. 사전연구로 AMT로 고용한 사람들은 이를 구분하지 못한고 영어교사는 human-written이 더 좋다고 판단하는 연구가 있었다. 따라서 이 테스크를 설정했고 LLM은 human-written이 더 좋다고 평가한다는 것이다. 평가항목은 4가지다. 1.  Grammaticality : 스토리 조각의 텍스트가 문법적으로 얼마나 올바른가?  2.  Cohesiveness : 스토리 조각의 문장이 서로 얼마나 잘 맞나요?  3.  Likability : 스토리 조각이 얼마나 재미있나요?  4.  Relevance : 이제 스토리 조각이 작성된 근거가 되는 프롬프트를 읽어 보세요.  Prompt: [PROMPT]. 스토리 조각이 Prompt와 얼마나 관련이 있나요? T0, text-curie-001은 무엇이 더 좋은지 제대로 평가를 못한다. InsturctGPT(text-davinci-003)과 ChatGPT는 제대로 평가한다. 이를 판단하는 MEAN_STD, IAA%는 본문 참고 Kendall's tau로 봤을 때는  1. 사람1평가와 chatgpt평가 비교 2. 사람1평가 vs 사람2평가 비교  이 둘이 꽤 유사하다는 것을 볼 수가 있다. 2. Adversarial Attack 2번째 테스크는, 기존의 문장을 동의어 치환등으로 변형시킨다. 변형문장(적대적문장)은 bert-base-unc...

NL-183, The False Promise of Imitating Proprietary LLMs, Preprint 2023

이미지
◼ Comment 최근에 오픈소스 진영에서 chatgpt와 같은 독점모델을 따라하는 모방모델을 여러 시도들이 있었다. 그에 대한 분석을 한 논문이다. 예를 들어, Vicuna는 ChatGPT와 Google Bard의 품질에 90% 도달했다고 주장합니다.  모방모델을 대충? 써보면 꽤 성능이 좋아보인다. 실제로 크라우드워커들이 봤을 때 모방 모델들이 instruction을 잘 따르고, chatgpt와 경쟁력이 있다라고 느낀다고 한다. 하지만 좀 더 엄밀히 분석해보면 모방 데이터로 활용된 비슷한 프롬프트, 테스크에서는 잘 작동하나 unseen 프롬프트에서는 잘 작동을 안한다고 한다. 말하는 스타일은 chatgpt(독점모델)을 잘 카피하나, 응답에대한 실질적으로 근거, 사실성을 모방하는 것은 아니다라고 볼 수 있다. 여기서 독점모델은 chatgpt, 모방모델의 베이스는 LLaMA로 생각하면 될듯 지시형 데이터 모방 모델 API을 이용해서 추출 가능 self-instruct와 같은 연구도 참고 일반화 모델이 목적이 아닌, 특정 테스크만을 목표로 하는 경우 (로컬모방) 이런 경우는 독점 모델을 통해, 특정 테스크에 대한 데이터만 잘 뽑아 와서 모방모델을 학습시킬 것이다. 학습된 모방모델의 성능은 독점모델보다도 오히려 좋은 경우가 존재  일반화 모델이 목적인 경우 (광범위한 모방) 그림1을 보면, 모방 데이터를 많이 추출해서 학습시킨다해도 성능이 향상되지 않는다. 오히려 성능이 떨어지는 경우도 보임 즉, 모방 데이터를 많이 늘린다해도, 모방모델의 성능은 한계가 있다는 것이다. 하지만 같은 모방 데이터에 대해, 모방 모델의 사이즈를 늘리면, 테스크 성능이 향상된다. 즉 중요한 것은 모방 모델의 사이즈(기본성능)이라고 볼 수 있다. 그러나 우리는 또한 모방 데이터의 양을 늘릴 때 인간 평가가 빠르게 포화되는 것을 발견했습니다 (Figure 1과 3 왼쪽).  이는 이 접근 방식의 가능한 한계점을 시사하고 있습니다. 즉, 모방데이터로 학습하는 것은 괜...