유사도 기반 이미지 캡션을 이용한 시각질의응답 연구

Using similarity based image caption to aid visual question answering
Citations

WEB OF SCIENCE

1

초록

시각질의응답과 이미지 캡셔닝은 이미지의 특징과 문장의 언어적인 특징을 이해하는 것을 요구하는작업이다. 따라서 두 가지 작업 모두 이미지와 텍스트를 연결해 줄 수 있는 공동 어텐션이 핵심이라고 할 수 있다. 본 논문에서는 MSCOCO 데이터 셋에 대하여 사전 훈련된 transformer 모델을 이용하여 캡션을 생성한 후 이를 활용해 시각질의응답의 성능을 높이는 모델을 제안하고자 한다. 이때 질문과 관계없는 캡션은 오히려 시각질의응답에서 답을 맞히는데 방해가 될 수 있기 때문에 질문과의유사도를 기반으로 질문과 유사한 일부의 캡션을 활용하도록 하였다. 또한 캡션에서 불용어는 답을맞히는데 영향을 주지 못하거나 방해가 될 수 있기 때문에 제거한 후에 실험을 진행하였다. 기존 시각질의응답에서 이미지와 텍스트간의 공동 어텐션을 활용하여 좋은 성능을 보였던 deep modular co-attention network (MCAN)과 유사도 기반의 선별된 캡션을 사용하여 VQA--v2 데이터에 대하여실험을 진행하였다. 그 결과 기존의 MCAN모델과 비교하여 유사도 기반으로 선별된 캡션을 활용했을때 성능 향상을 확인하였다.

키워드

visual question answering; multimodal data; co-attention; image captioning; text similarity; 시각질의 응답; 이종 데이터; 공동 어텐션; 이미지 캡셔닝; 텍스트 유사도
제목
유사도 기반 이미지 캡션을 이용한 시각질의응답 연구
제목 (타언어)
Using similarity based image caption to aid visual question answering
저자
강준서; 임창원
DOI
10.5351/KJAS.2021.34.2.191
발행일
2021-04
저널명
응용통계연구
권
34
호
2
페이지
191 ~ 204