PUBLICATION
Advancing Cross-Cultural Natural Language Processing with a Focus on Sundanese Language and Contextual Nuances
AM Rifai, E Utami, A Amali, M Fatchan, M Ekhsan
Bahasa Sunda, sebagai salah satu bahasa daerah di Indonesia, memiliki nilai budaya yang mendalam namun masih kurang terwakili dalam bidang linguistik komputasi. Penelitian ini menjawab kesenjangan tersebut dengan mengembangkan model penerjemahan antara bahasa Sunda dan bahasa Indonesia menggunakan arsitektur *sequence-to-sequence* (Seq2Seq) berbasis transformer. Dengan menggunakan dataset paralel yang terdiri dari 3.616 pasangan kalimat, model ini menjalani proses fine-tuning untuk menangkap nuansa linguistik dan kontekstual. Hasil evaluasi menunjukkan performa yang kuat: skor Bilingual Evaluation Understudy (BLEU) sebesar 44,12, skor F1 Recall-Oriented Understudy for Gisting Evaluation (ROUGE)-1 sebesar 0,72, dan skor F1 ROUGE-L sebesar 0,71. Angka-angka tersebut mencerminkan kualitas penerjemahan yang tinggi meskipun ketersediaan data terbatas. Berbeda dengan penelitian penerjemahan bahasa Sunda sebelumnya yang mengandalkan Recurrent Neural Network (RNN), Long Short-Term Memory (LSTM), atau model transformer standar, penelitian ini secara unik memanfaatkan model transformer multibahasa pra-latih M2M100. Hal ini memungkinkan penerapan transfer learning dari bahasa dengan sumber daya melimpah (*high-resource languages*) untuk meningkatkan kinerja pada bahasa dengan sumber daya terbatas (low-resource languages). Hasil penelitian ini menyoroti potensi model tersebut untuk aplikasi dunia nyata, seperti alat penerjemahan untuk pendidikan dan pertukaran budaya. Penelitian ini juga menekankan pentingnya peningkatan akses terhadap teks berbahasa Sunda serta penguatan kehadiran digital bahasa tersebut guna mendukung upaya pelestarian bahasa. Secara keseluruhan, penelitian ini tidak hanya memajukan riset Natural Language Processing (NLP) untuk bahasa dengan sumber daya terbatas, tetapi juga mempertegas pentingnya mengintegrasikan bahasa daerah, seperti bahasa Sunda, ke dalam teknologi modern. Dengan mengembangkan penelitian terdahulu mengenai penerjemahan Indonesia–Sunda, kebaruan penelitian ini terletak pada proses fine-tuning model transformer Seq2Seq multibahasa yang mampu menangkap nuansa linguistik maupun kontekstual, sehingga menetapkan tolok ukur baru dalam pemrosesan bahasa dengan sumber daya terbatas.