IMPLEMENTASI MODEL TRANSFORMER INDOBERT BERBASIS DEEP LEARNING UNTUK DETEKSI SPAM PESAN TEKS BERBAHASA INDONESIA

Authors

  • Annisa Alfrini
  • Desi Anggreani Universitas Muhammadiyah Makassar, Indonesia
  • Fahrim Irhamna Rachman Universitas Muhammadiyah Makassar, Indonesia

Keywords:

deteksi spam, Deep Learning, Transformer, IndoBERT, klasifikasi teks.

Abstract

Perkembangan teknologi informasi dan komunikasi dalam beberapa tahun terakhir telah mendorong peningkatan penggunaan media digital secara masif, salah satunya adalah aplikasi Telegram. Namun, fenomena ini memunculkan permasalahan baru, yaitu ancaman penyebaran pesan spam yang tidak terkendali, berpotensi mengganggu kenyamanan, menyebabkan kerugian finansial, serta mengancam keamanan data pengguna akibat skema penipuan. Penelitian ini bertujuan untuk mengimplementasikan model deep learning berbasis arsitektur Transformer, secara spesifik menggunakan model IndoBERT, untuk mendeteksi dan mengklasifikasikan pesan teks Telegram berbahasa Indonesia ke dalam kategori spam dan non-spam (ham). Penelitian ini memanfaatkan dataset seimbang yang berjumlah 5.971 pesan teks (2.979 spam dan 2.992 non-spam), yang dikumpulkan secara langsung melalui metode scraping dari berbagai grup Telegram publik. Tahapan penelitian dirancang secara sistematis, meliputi prapemrosesan teks (case folding, cleaning, dan tokenisasi awal), tokenisasi lanjutan menggunakan metode WordPiece, penyesuaian parameter, serta proses fine-tuning pada model pralatih IndoBERT. Evaluasi performa model diukur secara komprehensif menggunakan confusion matrix. Hasil penelitian menunjukkan bahwa model IndoBERT berhasil mengidentifikasi pola linguistik spam, termasuk penggunaan bahasa informal, tautan eksternal, hingga manipulasi karakter. Model menghasilkan kinerja klasifikasi yang sangat optimal dengan perolehan nilai akurasi sebesar 97,32%, presisi 98,62%, recall 95,97%, dan F1-score 97,28%. Selain itu, pengujian langsung terhadap 10 sampel data baru (unseen data) menunjukkan tingkat keberhasilan prediksi sebesar 100% secara spesifik pada skala pengujian tersebut. Kesimpulannya, pendekatan model IndoBERT terbukti sangat efektif, tangguh, dan adaptif untuk diimplementasikan sebagai sistem penyaringan spam otomatis secara real-time pada teks berbahasa Indonesia.

References

M. B. M. Amin et al., “Deteksi Spam Berbahasa Indonesia Berbasis Teks Menggunakan Model Bert,” Jurnal Teknologi Informasi dan Ilmu Komputer, vol. 11, no. 6, pp. 1291–1302, Dec. 2024, doi: 10.25126/jtiik.2024118121.

N. Latifah, R. Dwiyansaputra, and G. S. Nugraha, “Multiclass Text Classification of Indonesian Short Message Service (SMS) Spam using Deep Learning Method and Easy Data Augmentation,” MATRIK : Jurnal Manajemen, Teknik Informatika dan Rekayasa Komputer, vol. 23, no. 3, pp. 663–676, Jun. 2024, doi: 10.30812/matrik.v23i3.3835.

A. Vaswani et al., “Attention Is All You Need,” in Advances in Neural Information Processing Systems (NIPS), 2017, pp. 5998–6008. doi: https://doi.org/10.48550/arXiv.1706.03762.

Y. Tay, M. Dehghani, D. Bahri, and D. Metzler, “Efficient Transformers: A Survey,” ACM Comput. Surv., vol. 55, no. 6, pp. 1–28, Jun. 2022, doi: 10.1145/3530811.

B. Wilie et al., “IndoNLU: Benchmark and Resources for Evaluating Indonesian Natural Language Understanding,” in Proceedings of the 1st Conference of the Asia-Pacific Chapter of the Association for Computational Linguistics and the 10th International Joint Conference on Natural Language Processing, 2020, pp. 843–857. doi: https://doi.org/10.18653/v1/2020.aacl-main.85.

F. Koto, A. Rahimi, J. H. Lau, and T. Baldwin, “IndoLEM and IndoBERT: A Benchmark Dataset and Pre-trained Language Model for Indonesian NLP,” in Proceedings of the 28th International Conference on Computational Linguistics, 2020, pp. 757–770. doi: https://doi.org/10.18653/v1/2020.coling-main.66.

A. R. Chrismanto, A. Kartika Sari, and Y. Suyanto, “SPAMID-PAIR: A Novel Indonesian Post-Comment Pairs Dataset Containing Emoji,” (IJACSA) International Journal of Advanced Computer Science and Applications, vol. 13, no. 11, pp. 92–100, 2022, doi: https://dx.doi.org/10.14569/IJACSA.2022.0131110.

A. R. Chrismanto, A. K. Sari, and Y. Suyanto, “Enhancing Spam Comment Detection on Social Media With Emoji Feature and Post-Comment Pairs Approach Using Ensemble Methods of Machine Learning,” IEEE Access, vol. 11, pp. 80246–80265, 2023, doi: 10.1109/ACCESS.2023.3299853.

R. A. Supono and M. I. Imani, “Implementasi Machine Learning untuk Klasifikasi Email Spam Menggunakan Indobert, Hugging Face Transfomers dan Streamlit,” Jurnal Sosial dan Teknologi (SOSTECH), vol. 6, no. 1, pp. 420–440, 2026, doi: https://doi.org/10.59188/jurnalsostech.v6i1.32659.

A. Fikri Aji et al., “One Country, 700+ Languages: NLP Challenges for Underrepresented Languages and Dialects in Indonesia,” in Proceedings of the 60th Annual Meeting of the Association for Computational Linguistics, Long Papers, 2022, pp. 7226–7249. doi: https://doi.org/10.18653/v1/2022.acl-long.500.

J. Opitz, “A Closer Look at Classification Evaluation Metrics and a Critical Reflection of Common Evaluation Practice,” Trans. Assoc. Comput. Linguist., vol. 12, pp. 820–836, 2024, doi: https://doi.org/10.1162/tacl_a_00675.

Downloads

Published

2026-06-30

Issue

Section

Articles