Pemodelan CNN Untuk Deteksi Emosi Berbasis Speech Bahasa Indonesia
DOI:
https://doi.org/10.35143/jkt.v7i1.4623Kata Kunci:
Speech Emotion Recognition (SER), CNN, deep learningAbstrak
Perkembangan teknologi menunjukkan semakin banyak kebutuhan perangkat yang mampu menjalankan interaksi antara manusia dengan computer secara cerdas. Satu contohnya adalah sistem pengenalan emosi dengan computer. Di dalamnya diperlukan kemampuan untuk melakukan pengenalan, penafsiran, dan memberikan respons emosi yang diekspresikan dalam ucapan. Tetapi sampai saat ini penelilitan speech emotion recognition (SER) yang berbasis bahasa Indonesia masih sangat sedikit. Hal ini disebabkan keterbatasan korpus data berbahasa Indonesia untuk SER. Pada penelitian ini dibuat sistem SER dengan mengambil dataset dari TV series berbahasa Indonesia. Sistem dirancang dengan kemampuan untuk melakukan proses klasifikasi emosi, yaitu empat kelas label emosi marah, senang, netral dan sedih. Untuk implementasinya digunakan metode deep learning, yang dalam hal ini dipilih metode CNN. Pada sistem ini input berupa kombinasi dari tiga fitur, yaitu MFCC, frekuensi fundamental, dan RMSE. Dari eksperimen yang telah dijalankan telah diperoleh hasil terbaik untuk sistem SER berbahasa Indonesia dengan menggunakan input MFCC + frekuensi fundamental, yang menunjukkan tingkat akurasi sebesar 85%. Sedangkan ketika hanya menggunakan input MFCC memiliki tingkat akurasi sampai 83%. Sementara itu ketika dipaksakan dengan kombinasi ketiga input MFCC+ F0+ RMSE mengalami penurunan kinerja dan hanya mencapai akurasi 78% ,dan akurasi terendah menggunakan fitur MFCC + RMSE yaitu 72%. Dari study awal ini diharapkan mampu memberikan gambaran bagi para peneliti di bidang SER, tentang bagaimana memilih fitur sinyal wicara sebagai input di dalam pengujian dan mempermudah untuk langkah pengembangan penelitiannya.Unduhan
Referensi
C.M. Lee, S.S. Narayanan, “Toward Detecting Emotions in Spoken Dialogsâ€, IEEE Trans, Speech Audio Process, 13(2), 293–303 , 2005.
D. Tacconi, O. Mayora, P. Lukowicz, B. Arnrich, C. Setz, G. Troster, C. Haring, “Activity and Emotion Recognition to Support Early Diagnosis of Psychiatric Diseasesâ€, Second International Conference on Pervasive Computing Technologies for Healthcare, pp. 100–102, 2008.
S. Yildirim, S. Narayanan, A. Potamianos, “Detecting Emotional State of a Child in a Conversational Computer Gameâ€. Comput. Speech Lang. 25(1), 29–44 , 2011.
D. Ververidis, C. Kotropoulos, “Emotional speech recognition: resources, features, and methodsâ€, Speech Commun. 48 (9), 1162–1181, 2006.
D.Neiberg, K. Elenius, “Automatic Recognition of Anger in Spontaneous Speechâ€, INTERSPEECH 2008, Brisbane, Australia, pp. 2755–2758, 2008.
Alex, S. Ben, Mary, L., & Babu, B. P. “Attention and Feature Selection for Automatic Speech Emotion Recognition Using Utterance and Syllable-Level Prosodic Featuresâ€, Circuits, Systems, and Signal Processing, 39(11), 5681–5709, 2020.
Mirsamadi, S., Barsoum, E., & Zhang, C., “Automatic Speech Emotion Recognition Using Recurrent Neural Networks With Local Attention Center for Robust Speech Systems†, IEEE International Conference on Acoustics, Speech, and Signal Processing (ICASSP), 2227–2231, 2017.
Mustaqeem, Sajjad, M., & Kwon, S. ,“Clustering-Based Speech Emotion Recognition by Incorporating Learned Features and Deep BiLSTMâ€. IEEE Access, 8, 79861–79875, 2020.
Sun, T. W., “End-to-End Speech Emotion Recognition with Gender Informationâ€. IEEE Access, 8, 152423–152438., 2020.
Hamidi, Mina., “Emotion Recognition from Persian Speech with Neural Network.â€, International Journal of Artificial Intelligence & Applications. 3. 107-112, 2012.
Hamsa, S., Shahin, I., Iraqi, Y., & Werghi, N., “Emotion Recognition from Speech Using Wavelet Packet Transform Cochlear Filter Bank and Random Forest Classifier.â€, IEEE Access, 8, 96994–97006, 2020.
Fahmi, F., Jiwanggi, M. A., & Adriani, M. , “Speech-Emotion Detection in an Indonesian Movieâ€, Proceedings of the 1st Joint Workshop on Spoken Language Technologies for Under-Resourced Languages (SLTU) and Collaboration and Computing for Under-Resourced Languages (CCURL), May, 185–193, 2020.
Cong, P.; Wang, C.; Ren, Z.; Wang, H.; Wang, Y.; Feng, J. “Unsatisï¬ed customer call detection with deep learningâ€, In Proceedings of the 2016 10th International Symposium on Chinese Spoken Language Processing(ISCSLP), Tianjin, China, 17–20; pp. 1–5, 2016.
Livingstone, S., & Russo, F. “The Ryerson Audio-Visual Database of Emotional Speech and Song (RAVDESS) “. In PLoS ONE (Vol. 13), 2018.
Unduhan
Diterbitkan
Terbitan
Bagian
Lisensi
Hak Cipta (c) 2021 Jurnal Komputer Terapan

Artikel ini berlisensiCreative Commons Attribution-NonCommercial-ShareAlike 4.0 International License.
Penulis yang mempublikasikan naskah pada jurnal ini setuju tentang hal-hal berikut ini:
- Penulis memegang hak cipta untuk proses, prosedur, atau artikel yang dideskripsikan pada naskah dan memberikan hak kepada jurnal untuk pertama kali mempublikasikan naskah dibawah Creative Commons Attribution License yang memperbolehkan orang lain untuk menyebarkan hasil penelitian dengan pengakuan hak cipta penulis dan jurnal.
- Penulis memegang hak untuk mempublikasikan kembali semua atau sebagian hasil penelitian pada naskah lain tetapi tidak memberikan hak kepada pihak ketiga lain untuk mencetak dan mempublikasikan ulang hasil penelitian yang sama.
- Penulis diperbolehkan dan disarankan untuk menginformasikan naskah yang telah terbit secara online (seperti pada repository institusi atau website milik penulis) yang akan meningkatkan produktivitas rujukan dan sitasi dari naskah yang telah terbit.
Ciptaan disebarluaskan di bawah Lisensi Creative Commons Atribusi-NonKomersial-BerbagiSerupa 4.0 Internasional.








