<mods:mods version="3.3" xsi:schemaLocation="http://www.loc.gov/mods/v3 http://www.loc.gov/standards/mods/v3/mods-3-3.xsd" xmlns:mods="http://www.loc.gov/mods/v3" xmlns:xsi="http://www.w3.org/2001/XMLSchema-instance"><mods:titleInfo><mods:title>PENDEKATAN DATA-DRIVEN UNTUK MENGATASI&#13;
MASALAH KUALITAS PADA VIZWIZ CAPTIONING</mods:title></mods:titleInfo><mods:name type="personal"><mods:namePart type="given">Rhama Rangga</mods:namePart><mods:namePart type="family">Dhiputra</mods:namePart><mods:role><mods:roleTerm type="text">author</mods:roleTerm></mods:role></mods:name><mods:abstract>Model visi-bahasa modern saat ini masih mengalami kendala teknis yang&#13;
signifikan saat memproses foto berkualitas rendah, berderau, atau kabur yang&#13;
diambil secara autentik oleh individu tunanetra dalam skenario dunia nyata.&#13;
Kesenjangan teknis ini memicu fenomena "Paradoks Kualitas" yang menyebabkan&#13;
penurunan kinerja sistem pemandu visual secara drastis, sehingga berdampak&#13;
negatif pada keamanan dan kemandirian navigasi pengguna. Penelitian ini&#13;
bertujuan untuk mengeliminasi bias tersebut melalui pengembangan pipeline&#13;
berbasis data-centric yang mengintegrasikan penyaringan kekaburan Fast Fourier&#13;
Transform (FFT) dengan teknik Parameter-Efficient Fine-Tuning (PEFT)&#13;
menggunakan Low-Rank Adaptation (LoRA). Langkah-langkah penyelesaian&#13;
masalah mencakup kurasi data multidimensi, optimalisasi memori menggunakan&#13;
pengoptimal AdamW pada kartu grafis tingkat konsumen, serta pengujian statistik&#13;
mendalam melalui pembagian tertil berbasis FFT. Hasil penelitian menunjukkan&#13;
bahwa model yang dioptimalkan (V2-Final) berhasil mencapai skor CIDEr sebesar&#13;
0,4481, BERTScore F1 sebesar 0,8815, dan BLEU-4 sebesar 0,0511. Analisis&#13;
statistik dengan nilai p = 0,622 dan Cohen’s d sebesar -0,038 membuktikan bahwa&#13;
bias kualitas telah berhasil dihilangkan, menghasilkan performa yang seimbang&#13;
antara citra buram dan tajam. Selain itu, sistem terbukti efisien secara komputasi&#13;
dengan penggunaan VRAM puncak hanya sebesar 3,8 GB. Hasil penelitian ini&#13;
dapat dimanfaatkan oleh pengembang teknologi bantu untuk menciptakan alat&#13;
navigasi real-time yang tangguh bagi penyandang tunanetra. Penelitian selanjutnya&#13;
disarankan untuk mengintegrasikan model ini dengan arsitektur Large Language&#13;
Model (LLM) multimodal untuk interaksi percakapan yang lebih dinamis.</mods:abstract><mods:classification authority="lcc">000 Ilmu komputer, informasi dan pekerjaan umum</mods:classification><mods:originInfo><mods:dateIssued encoding="iso8061">2026-05-25</mods:dateIssued></mods:originInfo><mods:originInfo><mods:publisher>Universitas AMIKOM Yogyakarta;Fakultas Ilmu Komputer</mods:publisher></mods:originInfo><mods:genre>Thesis</mods:genre></mods:mods>