%0 Thesis %9 S1 - Sarjana %A Dhiputra, Rhama Rangga %A Universitas AMIKOM Yogyakarta, %B Fakultas Ilmu Komputer %D 2026 %F universitasamikomyogyakarta:33095 %I Universitas AMIKOM Yogyakarta %K aksesibilitas, BLIP, image captioning, kurasi data, LoRA, accessibility, data curation. %T PENDEKATAN DATA-DRIVEN UNTUK MENGATASI MASALAH KUALITAS PADA VIZWIZ CAPTIONING %U https://eprints.amikom.ac.id/id/eprint/33095/ %X Model visi-bahasa modern saat ini masih mengalami kendala teknis yang signifikan saat memproses foto berkualitas rendah, berderau, atau kabur yang diambil secara autentik oleh individu tunanetra dalam skenario dunia nyata. Kesenjangan teknis ini memicu fenomena "Paradoks Kualitas" yang menyebabkan penurunan kinerja sistem pemandu visual secara drastis, sehingga berdampak negatif pada keamanan dan kemandirian navigasi pengguna. Penelitian ini bertujuan untuk mengeliminasi bias tersebut melalui pengembangan pipeline berbasis data-centric yang mengintegrasikan penyaringan kekaburan Fast Fourier Transform (FFT) dengan teknik Parameter-Efficient Fine-Tuning (PEFT) menggunakan Low-Rank Adaptation (LoRA). Langkah-langkah penyelesaian masalah mencakup kurasi data multidimensi, optimalisasi memori menggunakan pengoptimal AdamW pada kartu grafis tingkat konsumen, serta pengujian statistik mendalam melalui pembagian tertil berbasis FFT. Hasil penelitian menunjukkan bahwa model yang dioptimalkan (V2-Final) berhasil mencapai skor CIDEr sebesar 0,4481, BERTScore F1 sebesar 0,8815, dan BLEU-4 sebesar 0,0511. Analisis statistik dengan nilai p = 0,622 dan Cohen’s d sebesar -0,038 membuktikan bahwa bias kualitas telah berhasil dihilangkan, menghasilkan performa yang seimbang antara citra buram dan tajam. Selain itu, sistem terbukti efisien secara komputasi dengan penggunaan VRAM puncak hanya sebesar 3,8 GB. Hasil penelitian ini dapat dimanfaatkan oleh pengembang teknologi bantu untuk menciptakan alat navigasi real-time yang tangguh bagi penyandang tunanetra. Penelitian selanjutnya disarankan untuk mengintegrasikan model ini dengan arsitektur Large Language Model (LLM) multimodal untuk interaksi percakapan yang lebih dinamis.