상세 보기
유사도 기반 이미지 캡션을 이용한 시각질의응답 연구
Using similarity based image caption to aid visual question answering
- 강준서;
- 임창원
Citations
WEB OF SCIENCE
1초록
시각질의응답과 이미지 캡셔닝은 이미지의 특징과 문장의 언어적인 특징을 이해하는 것을 요구하는작업이다. 따라서 두 가지 작업 모두 이미지와 텍스트를 연결해 줄 수 있는 공동 어텐션이 핵심이라고 할 수 있다. 본 논문에서는 MSCOCO 데이터 셋에 대하여 사전 훈련된 transformer 모델을 이용하여 캡션을 생성한 후 이를 활용해 시각질의응답의 성능을 높이는 모델을 제안하고자 한다. 이때 질문과 관계없는 캡션은 오히려 시각질의응답에서 답을 맞히는데 방해가 될 수 있기 때문에 질문과의유사도를 기반으로 질문과 유사한 일부의 캡션을 활용하도록 하였다. 또한 캡션에서 불용어는 답을맞히는데 영향을 주지 못하거나 방해가 될 수 있기 때문에 제거한 후에 실험을 진행하였다. 기존 시각질의응답에서 이미지와 텍스트간의 공동 어텐션을 활용하여 좋은 성능을 보였던 deep modular co-attention network (MCAN)과 유사도 기반의 선별된 캡션을 사용하여 VQA--v2 데이터에 대하여실험을 진행하였다. 그 결과 기존의 MCAN모델과 비교하여 유사도 기반으로 선별된 캡션을 활용했을때 성능 향상을 확인하였다.
키워드
visual question answering; multimodal data; co-attention; image captioning; text similarity; 시각질의 응답; 이종 데이터; 공동 어텐션; 이미지 캡셔닝; 텍스트 유사도
- 제목
- 유사도 기반 이미지 캡션을 이용한 시각질의응답 연구
- 제목 (타언어)
- Using similarity based image caption to aid visual question answering
- 저자
- 강준서; 임창원
- 발행일
- 2021-04
- 저널명
- 응용통계연구
- 권
- 34
- 호
- 2
- 페이지
- 191 ~ 204
- 언어
- KOR
- 출판사
- 한국통계학회
- 발행국가
- 대한민국
- 분량
- 14 페이지
- ISSN
- E 2383-5818
P 1225-066X