Pemodelan CNN Untuk Deteksi Emosi Berbasis Speech Bahasa Indonesia

Penulis

DOI:

https://doi.org/10.35143/jkt.v7i1.4623

Kata Kunci:

Speech Emotion Recognition (SER), CNN, deep learning

Abstrak

Perkembangan teknologi menunjukkan semakin banyak kebutuhan perangkat yang mampu menjalankan interaksi antara manusia dengan computer secara cerdas. Satu contohnya adalah sistem pengenalan emosi dengan computer. Di dalamnya diperlukan kemampuan untuk melakukan pengenalan, penafsiran, dan memberikan respons emosi yang diekspresikan dalam ucapan. Tetapi sampai saat ini penelilitan speech emotion recognition (SER) yang berbasis bahasa Indonesia masih sangat sedikit. Hal ini disebabkan keterbatasan korpus data berbahasa Indonesia untuk SER. Pada penelitian ini dibuat sistem SER dengan mengambil dataset dari TV series berbahasa Indonesia. Sistem dirancang dengan kemampuan untuk  melakukan proses klasifikasi emosi, yaitu empat kelas label emosi  marah, senang, netral dan sedih. Untuk implementasinya digunakan metode deep learning, yang dalam hal ini dipilih metode CNN. Pada sistem ini input berupa kombinasi dari tiga fitur, yaitu MFCC, frekuensi fundamental, dan RMSE. Dari eksperimen yang telah dijalankan telah diperoleh hasil terbaik untuk sistem SER berbahasa Indonesia dengan menggunakan input MFCC + frekuensi fundamental, yang menunjukkan tingkat akurasi sebesar 85%. Sedangkan ketika hanya menggunakan input MFCC memiliki tingkat akurasi sampai 83%. Sementara itu ketika dipaksakan dengan kombinasi ketiga input MFCC+ F0+ RMSE mengalami penurunan kinerja dan hanya mencapai akurasi 78% ,dan akurasi terendah menggunakan fitur MFCC + RMSE yaitu 72%. Dari study awal ini diharapkan mampu memberikan gambaran bagi para peneliti di bidang SER, tentang  bagaimana memilih fitur sinyal wicara sebagai input di dalam pengujian dan mempermudah untuk langkah pengembangan penelitiannya.

Unduhan

Data unduhan tidak tersedia.

Referensi

C.M. Lee, S.S. Narayanan, “Toward Detecting Emotions in Spoken Dialogsâ€, IEEE Trans, Speech Audio Process, 13(2), 293–303 , 2005.

D. Tacconi, O. Mayora, P. Lukowicz, B. Arnrich, C. Setz, G. Troster, C. Haring, “Activity and Emotion Recognition to Support Early Diagnosis of Psychiatric Diseasesâ€, Second International Conference on Pervasive Computing Technologies for Healthcare, pp. 100–102, 2008.

S. Yildirim, S. Narayanan, A. Potamianos, “Detecting Emotional State of a Child in a Conversational Computer Gameâ€. Comput. Speech Lang. 25(1), 29–44 , 2011.

D. Ververidis, C. Kotropoulos, “Emotional speech recognition: resources, features, and methodsâ€, Speech Commun. 48 (9), 1162–1181, 2006.

D.Neiberg, K. Elenius, “Automatic Recognition of Anger in Spontaneous Speechâ€, INTERSPEECH 2008, Brisbane, Australia, pp. 2755–2758, 2008.

Alex, S. Ben, Mary, L., & Babu, B. P. “Attention and Feature Selection for Automatic Speech Emotion Recognition Using Utterance and Syllable-Level Prosodic Featuresâ€, Circuits, Systems, and Signal Processing, 39(11), 5681–5709, 2020.

Mirsamadi, S., Barsoum, E., & Zhang, C., “Automatic Speech Emotion Recognition Using Recurrent Neural Networks With Local Attention Center for Robust Speech Systems†, IEEE International Conference on Acoustics, Speech, and Signal Processing (ICASSP), 2227–2231, 2017.

Mustaqeem, Sajjad, M., & Kwon, S. ,“Clustering-Based Speech Emotion Recognition by Incorporating Learned Features and Deep BiLSTMâ€. IEEE Access, 8, 79861–79875, 2020.

Sun, T. W., “End-to-End Speech Emotion Recognition with Gender Informationâ€. IEEE Access, 8, 152423–152438., 2020.

Hamidi, Mina., “Emotion Recognition from Persian Speech with Neural Network.â€, International Journal of Artificial Intelligence & Applications. 3. 107-112, 2012.

Hamsa, S., Shahin, I., Iraqi, Y., & Werghi, N., “Emotion Recognition from Speech Using Wavelet Packet Transform Cochlear Filter Bank and Random Forest Classifier.â€, IEEE Access, 8, 96994–97006, 2020.

Fahmi, F., Jiwanggi, M. A., & Adriani, M. , “Speech-Emotion Detection in an Indonesian Movieâ€, Proceedings of the 1st Joint Workshop on Spoken Language Technologies for Under-Resourced Languages (SLTU) and Collaboration and Computing for Under-Resourced Languages (CCURL), May, 185–193, 2020.

Cong, P.; Wang, C.; Ren, Z.; Wang, H.; Wang, Y.; Feng, J. “Unsatisï¬ed customer call detection with deep learningâ€, In Proceedings of the 2016 10th International Symposium on Chinese Spoken Language Processing(ISCSLP), Tianjin, China, 17–20; pp. 1–5, 2016.

Livingstone, S., & Russo, F. “The Ryerson Audio-Visual Database of Emotional Speech and Song (RAVDESS) “. In PLoS ONE (Vol. 13), 2018.

Unduhan

Diterbitkan

2021-06-02

Cara Mengutip

Pemodelan CNN Untuk Deteksi Emosi Berbasis Speech Bahasa Indonesia. (2021). Jurnal Komputer Terapan, 7(1), 143-152. https://doi.org/10.35143/jkt.v7i1.4623

Artikel Serupa

1-10 dari 57

Anda juga bisa Mulai pencarian similarity tingkat lanjut untuk artikel ini.

Artikel paling banyak dibaca berdasarkan penulis yang sama