ANALISIS PERBANDINGAN CNN DAN VISION TRANSFORMER DALAM KLASIFIKASI HURUF SEMAPHORE PRAMUKA BERBASIS CITRA

Authors

  • Muh. Akbar Haeruddin Univertas Muhammadiyah Makassar
  • Desi Anggreani Universitas Muhammadiyah Makassar
  • Muhyiddin A.M Hayat Universitas Muhammadiyah Makassar

DOI:

https://doi.org/10.70248/jcsit.v3i4.4366

Abstract

Klasifikasi huruf Semaphore Pramuka merupakan salah satu permasalahan computer vision yang menantang karena kemiripan pose antarkelas, variasi subjek, pencahayaan, serta latar belakang citra. Penelitian ini bertujuan membandingkan kinerja Convolutional Neural Network (CNN) menggunakan model EfficientNetB0 dan Vision Transformer (ViT) menggunakan model DeiT-Tiny dalam mengklasifikasikan citra huruf Semaphore. Dataset terdiri atas 26 kelas huruf A–Z dengan 1.014 citra untuk pelatihan dan validasi serta 234 citra pengujian eksternal. Tahap praproses meliputi konversi citra ke format RGB, resize menjadi 224×224 piksel, normalisasi, dan augmentasi pada data pelatihan. Kedua model dilatih menggunakan transfer learning dengan konfigurasi pelatihan yang setara. Proses pelatihan menggunakan optimizer AdamW dengan learning rate 3×10⁻⁴, weight decay 1×10⁻⁴, batch size 64, penjadwalan cosine annealing, serta label smoothing 0,1, dipadukan dengan early stopping untuk mencegah overfitting. Kedua model kemudian dievaluasi menggunakan metrik accuracy, precision, recall, F1-score, dan confusion matrix. Hasil pengujian menunjukkan bahwa DeiT-Tiny memberikan performa yang lebih baik dibandingkan EfficientNet-B0. DeiT-Tiny memperoleh accuracy 97,01%, precision 97,64%, recall 97,01%, dan F1-score 96,95%, sedangkan EfficientNetB0 memperoleh accuracy 82,05%, precision 85,48%, recall 82,05%, dan F1-score 81,53%. Selain itu, DeiT-Tiny mampu mengklasifikasikan 23 dari 26 kelas secara sempurna dengan jumlah kesalahan yang lebih sedikit. Hasil penelitian menunjukkan bahwa Vision Transformer berbasis DeiT-Tiny lebih efektif dibandingkan EfficientNetB0 dalam klasifikasi citra huruf Semaphore pada dataset yang digunakan. Temuan ini secara teoretis memperkuat bukti bahwa mekanisme self-attention pada ViT mampu menangkap relasi spasial global antarbagian pose secara lebih baik pada dataset berskala kecil, sekaligus memberikan kontribusi praktis sebagai dasar pengembangan sistem pengenalan Semaphore berbasis citra yang lebih akurat, misalnya untuk media pembelajaran maupun penilaian keterampilan Semaphore secara otomatis

References

K. Raman, W. W. Lun, and H. Hashim, “Virtual reality for verbal communication development in English as second language learning: Advantages and optimisation strategies,” Comput. Educ. X Real., vol. 8, no. February, p. 100145, Jun. 2026.

Y. Huan and W. Yan, “Semaphore Recognition Using Deep Learning,” Electron., vol. 14, no. 2, 2025.

R. Jalayer, M. Jalayer, C. Orsenigo, and M. Tomizuka, “A review on deep learning for vision-based hand detection, hand segmentation and hand gesture recognition in human–robot interaction,” Robot. Comput. Integr. Manuf., vol. 97, no. July 2025, p. 103110, 2026.

P. Niu, “Convolutional neural network for gesture recognition human-computer interaction system design,” PLoS One, vol. 20, no. 2 February, pp. 1–22, 2025.

Purwono, A. Ma’arif, W. Rahmaniar, H. I. K. Fathurrahman, A. Z. K. Frisky, and Q. M. U. Haq, “Understanding of Convolutional Neural Network (CNN): A Review,” Int. J. Robot. Control Syst., vol. 2, no. 4, pp. 739–748, 2022.

G. Rangel, J. C. Cuevas-Tello, J. Nunez-Varela, C. Puente, and A. G. Silva-Trujillo, “A Survey on Convolutional Neural Networks and Their Performance Limitations in Image Recognition Tasks,” Journal of Sensors, vol. 2024. Hindawi Limited, 2024.

L. S. A. Putra, F. T. P. Wigyarinto, E. Kusumawardhani, and V. A. Gunawan, “Semaphore letter code recognition system using wavelet method and back propagation neural network,” Int. J. Adv. Technol. Eng. Explor., vol. 11, no. 112, pp. 316–331, 2024.

J. Maurício, I. Domingues, and J. Bernardino, “Comparing Vision Transformers and Convolutional Neural Networks for Image Classification: A Literature Review,” Appl. Sci., vol. 13, no. 9, 2023.

T. Zhang, W. Xu, B. Luo, and G. Wang, “Depth-Wise Convolutions in Vision Transformers for efficient training on small datasets,” Neurocomputing, vol. 617, no. March 2024, p. 128998, 2025.

C. K. Tan, K. M. Lim, R. K. Y. Chang, C. P. Lee, and A. Alqahtani, “HGR-ViT: Hand Gesture Recognition with Vision Transformer,” Sensors, vol. 23, no. 12, pp. 1–20, 2023.

Downloads

Published

2026-09-20

Issue

Section

Articles