사전 학습 모델과 앙상블 기법을 통한 음성 감정인식

Pre-trained models and ensemble technique for speech emotion recognition

초록

음성 감정 인식 연구는 인간-기계 상호작용을 향상시키는 데 중요하고, 의료, 교육, 고객 서비스 등 다양한 분야에서 효율성을 높이고 사용자 경험을 개선할 수 있다. 본 연구에서는 DACON의 `월간 데이콘 음성 감정 인식 AI 경진대회'에 참가하여 여섯 가지 감정을 분류하는 AI 모델을 개발을 목표로 하였다. 전통적인 음성 처리 기술 기반 방법과 사전 학습된 모델을 이용한 방법들의 성능을 비교하였고, 사전 학습된 모델을 통해 음성의 일반화된 특징을 효과적으로 학습한 임베딩 벡터의 추가 학습 가능성을 탐구하였다. 그 결과, WavLM에 1D CNN을 결합한 모델이 79.80\%의 성능으로 우수한 결과를 보였고, 사용한 모든 사전 학습된 모델들을 하드 보팅 앙상블하여 5등에 준하는 80.79\%까지 성능을 향상시켰다. 본 연구는 음성 감정 분류에서 높은 성능을 달성하여 음성 감정 인식 기술의 적용 가능성을 높임으로써, 다양한 실제 응용 분야에서 감정 인식 모델의 활용을 가능하게 하는 데 기여할 것이다.

키워드

Deep learningensemble learningpre-trained modelsspeech emotion recognition딥러닝사전 학습된 모델앙상블 학습음성 감정 인식
제목
사전 학습 모델과 앙상블 기법을 통한 음성 감정인식
제목 (타언어)
Pre-trained models and ensemble technique for speech emotion recognition
저자
서재진강태인곽일엽
DOI
10.7465/jkdi.2024.35.4.445
발행일
2024-07
저널명
한국데이터정보과학회지
35
4
페이지
445 ~ 459