<mods:mods version="3.3" xsi:schemaLocation="http://www.loc.gov/mods/v3 http://www.loc.gov/standards/mods/v3/mods-3-3.xsd" xmlns:mods="http://www.loc.gov/mods/v3" xmlns:xsi="http://www.w3.org/2001/XMLSchema-instance"><mods:titleInfo><mods:title>KLASIFIKASI MOOD MUSIK BERBASIS SUARA&#13;
MENGGUNAKAN ALGORITMA CONVOLUTIONAL&#13;
NEURAL NETWORK (CNN)</mods:title></mods:titleInfo><mods:name type="personal"><mods:namePart type="given">Siwan Yesarela</mods:namePart><mods:namePart type="family">Harefa</mods:namePart><mods:role><mods:roleTerm type="text">author</mods:roleTerm></mods:role></mods:name><mods:abstract>Musik merupakan media ekspresi yang memiliki kemampuan luar biasa&#13;
dalam menyampaikan emosi dan memengaruhi suasana hati pendengarnya. Namun,&#13;
klasifikasi mood musik secara otomatis menghadapi tantangan yang signifikan&#13;
karena sifat audio yang kompleks, multidimensional, dan subjektif. Sistem&#13;
klasifikasi manual yang mengandalkan penilaian manusia dinilai tidak efisien dan&#13;
tidak skalabel untuk mengelola koleksi musik dalam jumlah besar, seperti pada&#13;
platform streaming modern. Ketidakmampuan sistem otomatis untuk mengenali&#13;
nuansa emosional dalam musik berdampak pada pengalaman pengguna yang&#13;
kurang personal, rekomendasi lagu yang tidak akurat, serta keterbatasan dalam&#13;
pengembangan aplikasi berbasis konteks emosional seperti terapi musik, kurasi&#13;
playlist adaptif, dan sistem rekomendasi cerdas.&#13;
Penelitian ini mengembangkan sistem klasifikasi mood musik berbasis&#13;
sinyal suara menggunakan algoritma Convolutional Neural Network (CNN) untuk&#13;
lima kelas mood, yaitu aggressive, dramatic, romantic, sad, dan happy. Dataset&#13;
yang digunakan adalah "Music Classification" dari Kaggle, terdiri dari 10.133&#13;
sampel audio berformat WAV dengan durasi 10 detik dan sampling rate 22.050 Hz.&#13;
Fitur audio diekstraksi melalui empat channel, yakni MFCC, Delta MFCC, DeltaDelta&#13;
MFCC,&#13;
dan&#13;
Mel-Spectrogram,&#13;
yang&#13;
kemudian&#13;
digabungkan&#13;
menjadi&#13;
tensor&#13;
&#13;
berukuran&#13;
(40&#13;
&#13;
× 130 × 4) sebagai input model. Arsitektur CNN yang dirancang&#13;
terdiri dari empat blok konvolusi, Batch Normalization, GlobalAveragePooling2D,&#13;
serta dua lapisan fully connected yang dilengkapi regularisasi dropout dan L2. Guna&#13;
menangani ketidakseimbangan kelas dalam dataset, diterapkan balanced class&#13;
weight selama proses pelatihan model.&#13;
Model terbaik yang dihasilkan mencapai akurasi sebesar 79,93% dan&#13;
precision 80,88% pada data uji, menunjukkan kemampuan generalisasi yang baik&#13;
terhadap data yang belum pernah dilihat sebelumnya. Penerapan balanced class&#13;
weight terbukti berkontribusi signifikan dalam meningkatkan performa model&#13;
secara keseluruhan. Sistem kemudian di-deploy menggunakan framework Flask&#13;
sebagai REST API dengan antarmuka web interaktif, sehingga memungkinkan&#13;
prediksi mood musik secara langsung dan mudah diakses. Hasil penelitian ini dapat&#13;
dimanfaatkan oleh pengembang aplikasi musik, platform streaming, peneliti di&#13;
bidang Music Information Retrieval (MIR), serta praktisi terapi musik berbasis&#13;
teknologi. Untuk penelitian lebih lanjut, disarankan eksplorasi arsitektur yang lebih&#13;
dalam seperti ResNet atau penggunaan model transformer berbasis audio seperti&#13;
AST (Audio Spectrogram Transformer), perluasan kelas mood, serta pemanfaatan&#13;
teknik augmentasi data audio guna meningkatkan akurasi dan ketahanan model&#13;
pada kondisi audio dunia nyata yang lebih beragam.</mods:abstract><mods:classification authority="lcc">000 Ilmu komputer, informasi dan pekerjaan umum</mods:classification><mods:originInfo><mods:dateIssued encoding="iso8061">2026-05-22</mods:dateIssued></mods:originInfo><mods:originInfo><mods:publisher>Universitas AMIKOM Yogyakarta;Fakultas Ilmu Komputer</mods:publisher></mods:originInfo><mods:genre>Thesis</mods:genre></mods:mods>