Luyu Gao and Jamie Callan, Unsupervised Corpus Aware Language Model Pre-training for Dense Passage Retrieval, arXiv:2108.05540 요약 기존의 Condenser에 constrastive loss를 추가한 coCondenser를 제안한다. Condenser는 masked language model (MLM)을 loss로 이용한다. coCondenser는 MLM과 constrative loss를 함께 이용한다. Condenser와 coCondenser를 함께 이용한다. Condenser와 coCondenser의 네트워크 구조는 동일하고, loss 함수가 다르다. 2단계로 pretraining을 한다. 일반적인 말뭉치에서 Condenser를 pretraining 한다. pretrained Condenser를 dense retrieval 대상 말뭉치에서 coCondenser로 pretraining한다. Condenser는 cls가 더 많은 정보를 가지도록 하는 pretraining 방법이다. coCondenser는 의미적으로 유사한 텍스트간의 임베딩이 유사하도록 pretraining 한다. MS Marco passage retrieval에서 RocketQA보다 더 좋은 성능이 나온다. RocketQA는 여러가지 data engineering 기법을 사용하고, batch size를 크게 사용한다. (batch size = 4096 혹은 8192 인듯) coCondenser는 여러가지 data engineering 기법을 사용하지 않고, batch size도 RocketQA보다 훨씬 작다 (batch size = 64) Condenser 아래 그림이 Condenser 구조이다. early layers, late...
댓글