Klasifikasi multi-label topik Al-Qur'an pada terjemahan bahasa inggris menggunakan BERT dan Bi-LSTM dengan fitur linguistik

Mutmainnah, Agustina Latifatul (2026) Klasifikasi multi-label topik Al-Qur'an pada terjemahan bahasa inggris menggunakan BERT dan Bi-LSTM dengan fitur linguistik. Undergraduate thesis, UIN Sunan Ampel Surabaya.

[thumbnail of Agustina Latifatul Mutmainnah_09050622079.pdf] Text
Agustina Latifatul Mutmainnah_09050622079.pdf

Download (4MB)
[thumbnail of Agustina Latifatul Mutmainnah_09050622079_Full.pdf] Text
Agustina Latifatul Mutmainnah_09050622079_Full.pdf
Restricted to Repository staff only until 5 August 2029.

Download (4MB)

Abstract

Al-Qur'an terdiri atas 6.236 ayat yang terdiri dari beberapa tema, dengan kemungkinan satu ayat dapat memuat beberapa tema, sehingga memiliki karakteristik klasifikasi multilabel. Karakteristik tersebut memerlukan model klasifikasi yang mampu memahami makna kontekstual setiap ayat secara lebih baik. Namun, penelitian-penelitian sebelumnya mengenai klasifikasi multilabel topik Al-Qur'an umumnya masih memanfaatkan static word embedding, yang memiliki keterbatasan dalam merepresentasikan makna kata sesuai dengan konteks penggunaannya. Oleh karena itu, penelitian ini bertujuan untuk meningkatkan performa klasifikasi multilabel topik Al-Qur'an pada terjemahan bahasa Inggris melalui integrasi contextual embedding Bidirectional Encoder Representations from Transformers (BERT), model Bidirectional Long Short-Term Memory (Bi-LSTM), serta fitur linguistik berupa Part-of-Speech (POS) Tagging dan Named Entity Recognition (NER). Penelitian ini dilakukan melalui tiga skenario eksperimen yang disusun secara bertahap untuk mengevaluasi kontribusi setiap komponen terhadap kinerja model. Evaluasi model menggunakan metrik Macro F1-score dan Hamming Loss, sedangkan hasil prediksi divalidasi oleh tiga pakar menggunakan koefisien Fleiss' Kappa dan Jaccard Similarity. Hasil penelitian menunjukkan bahwa kombinasi BERT, Bi-LSTM, POS Tagging, dan NER menghasilkan performa terbaik dengan nilai Macro F1-score sebesar 0,4835 dan Hamming Loss sebesar 0,0919, yang menunjukkan bahwa penambahan fitur linguistik mampu meningkatkan kemampuan model dalam mengidentifikasi berbagai topik pada setiap ayat. Validasi pakar menghasilkan nilai Fleiss' Kappa sebesar 0,3849 dan Jaccard Similarity sebesar 88,27%, yang menunjukkan bahwa hasil klasifikasi memiliki tingkat kesesuaian yang baik dengan penilaian pakar. Meskipun demikian, performa model secara keseluruhan masih belum optimal karena dipengaruhi oleh ketidakseimbangan distribusi label (label imbalance) dan karakteristik klasifikasi multilabel yang melibatkan banyak label dalam satu ayat. Oleh karena itu, penelitian selanjutnya disarankan untuk menerapkan strategi penanganan ketidakseimbangan data, mengeksplorasi arsitektur pembelajaran yang lebih adaptif, serta mengoptimalkan kualitas dan distribusi dataset guna meningkatkan performa klasifikasi multilabel topik Al-Qur'an.

Item Type: Thesis (Undergraduate)
Creators:
Name Email NIM
Mutmainnah, Agustina Latifatul agustinalatifa11@gmail.com 09050622079
Contributors:
Contribution Name Email NIDN
Thesis advisor Kunaefi, Anang akunaefi@uinsa.ac.id 2013117902
Thesis advisor Nooriansyah, Subhan subhan.nooriansyah@uinsa.ac.id 2028129005
Uncontrolled Keywords: Klasifikasi multilabel; topik al-Qur’an; BERT; Bi-LSTM; POS Tagging; NER
Subjects: Al Qur'an
Teknologi > Teknologi Informasi
Linguistik
Divisions: Fakultas Sains dan Teknologi > Studi Sistem Informasi
Depositing User: Agustina Latifatul Mutmainnah
Date Deposited: 05 Aug 2026 01:06
Last Modified: 05 Aug 2026 01:08
URI: https://digilib.uinsa.ac.id/id/eprint/92433

Actions (login required)

View Item
View Item