글

라벨이 style transfer인 게시물 표시

NL-147, Prompt-and-Rerank: A Method for Zero-Shot and Few-Shot Arbitrary Textual Style Transfer with Small Language Models

이미지
ARR 202204-Review 1 0 Abstract 범용 사전 훈련된 언어 모델을 사용하여 텍스트를 주어진 스타일로 자동 변환하는 작업인 임의의 텍스트 스타일 전송(TST) 방법을 제안합니다. Prompt-and-Rerank라고 하는 우리의 방법은 TST 작업의 새로운 수학적 공식을 기반으로 하며, TST 작업은 텍스트 유사성, 대상 스타일 강도 및 유창성의 세 가지 구성 요소로 분해됩니다. 특히, 우리의 방법은 먼저 대상 스타일의 candidate generations 집합을 얻기 위해 제로샷 또는 퓨어샷 프롬프트를 사용한 다음 위의 세 가지 구성 요소의 조합에 따라 이러한 후보의 순위를 재지정합니다. Experimentally, our method enables small pre-trained language models to perform on par with state-of-the-art large-scale models while consuming two orders of magnitude less compute and memory. 실험적으로 우리의 방법은 작은 사전 훈련된 언어 모델이 최첨단 대규모 모델과 동등한 성능을 발휘하면서 컴퓨팅 및 메모리를 100배 덜 소모하도록 합니다. 이에 대해 계산 필요 마지막으로, 우리는 7개의 다양한 스타일 전송 데이터 세트에 걸쳐 스타일 전송 품질에 대한 모델 크기 및 프롬프트 디자인(예: prompt paraphrasing and delimiter-pair choice)의 효과 에 대한 체계적인 조사를 수행합니다. 텍스트 스타일 전송에 대한 향후 연구를 용이하게 하기 위해 모든 코드와 데이터를 공개할 것입니다. 1 Introduction TST(텍스트 스타일 전송)는 주요 의미 내용, 구조 또는 기타 속성을 변경하지 않고 텍스트 조각(예:  sentiment attribute, formality, politeness 등)의 한 문체 측면을 전송하는 작업을 나타냅니다. 전통적으로 N...

NL-074, Generate, Delete and Rewrite: A Three-Stage Framework for Improving Persona Consistency of Dialogue Generation (2020-ACL)

이미지
■ Comment 일단 이 논문은 single-turn에 집중한 논문으로 이전의 PERSONA-chat으로 실험한 연구들과 다르다. single turn 연구긴 하지만, multi-turn도 똑같이 접근 하면 안될 것은 없어 보인다. 그런데 이 논문은 좀 heavy하고 3-stage라서 속도적으로는 느릴 것 같은 생각이다. 따라서 히스토리에 해당하는 입력은 업고, persona-question → answer 형식이다. 즉 persona-chat 데이터셋에서 뽑아서 사용한 것으로 보여진다. 또한 크게보면 QA식이니까, 생성하는 모델구조가 MRC와 많이쓰는 것과 비슷한 느낌이다. 모델 구조자체는 사실 그렇게 특별한 점은 없어 보인다. 모델은 GDR로 generate-delete-rewrite인데, 사실 generate와 rewrite는 생성모델로 G의 decoder와 비슷하지만, delete된 시퀀스를 입력으로 받는다는 점이 다르다. 또한 이런 delete&generate와 같은 방법은 style transfer에 이미 있긴하다.  단지 generate가 추가된 느낌? 또한 delete할 때, attribute words을 찾기 위해, DNLI 데이터세트를 썼다. 0. Abstract 대화에서 일관성있는 personality을 유지하는 것은 사람에게는 자연스러운 것이나, 기게에게는 어려운 문제이다. persona 기반의 대화 생성 테스크는 그래서 personality가 일정하지 않은 문제를 명시적인 persona를 대화 생성모델과 통합하면서 해결하기 위해 도입된다. 사람과 비슷한 response을 생성하는것에 기반을 둔 persona-based 모델들의 성공에도 불구하고, 그들의 one-stage decoding 프레임워크는 inconsistent persona words의 생성을 피하기 어렵다. 이 연구에서, 우리는 generate-delete-rewrite 메커니즘으로 생성된 response 프로토타입에서 inconsistent 단어들을 삭제하...