DETEKSI TEKS BERITA HASIL GENERATED KECERDASAN BUATAN BERDASARKAN FITUR STILOMETRI MENGGUNAKAN ALGORITMA TABPFN DAN SHAP
DOI:
https://doi.org/10.70248/jcsit.v3i4.4557Abstract
Kemajuan pesat Large Language Models (LLM) seperti Llama 3.1 memicu eskalasi disinformasi digital akibat kemampuannya memproduksi teks berita sintetis yang menyerupai gaya penulisan jurnalis manusia. Penelitian ini mengusulkan kerangka deteksi forensik digital teks berbasis fitur stilometri tingkat permukaan yang dipadukan dengan algoritma klasifikasi Prior-Data Fitted Networks (TabPFN) serta transparansi model berbasis Shapley Additive Explanations (SHAP). Eksperimen dilakukan menggunakan korpus seimbang 500 dokumen berita berbahasa Indonesia (250 artikel orisinal Kompas.com dan 250 teks sintesis Llama 3.1) yang dipartisi secara terstratifikasi dengan rasio 80:20, yaitu 400 data latih dan 100 data uji. Enam atribut stilometri diekstraksi tanpa melalui tahap pembuangan kata henti maupun perataan morfologi guna mempertahankan keaslian sidik jari gaya kepenulisan. Pemanfaatan TabPFN memungkinkan inferensi data tabular dieksekusi secara instan melalui mekanisme in-context learning tanpa membutuhkan penalaan hiperparameter yang intensif. Hasil evaluasi empiris membuktikan keandalan tinggi dan konsistensi klasifikasi model dalam membedakan naskah berita manusia dari teks buatan mesin secara objektif dan independen terhadap topik wacana. Analisis keterbukaan model menggunakan SHAP mengungkap bahwa Type-Token Ratio (TTR) merupakan determinan stilometri paling krusial, di mana tingginya diversitas kosakata jurnalis manusia menjadi faktor pembeda esensial terhadap kecenderungan repetisi leksikal mesin. Secara keilmuan, integrasi ini membuktikan efektivitas pendekatan stilometri terukur sebagai instrumen forensik digital teks yang tangguh, efisien secara komputasi, dan akuntabel dalam mendukung verifikasi keaslian naskah pada ekosistem jurnalisme media daring.
References
Bagies, T., Alsuhaimi, R., Almasre, M., & Bafail, A. (2025). Predicting Suspicious Arabic X Accounts Using Stylometric Features. IEEE Access, 13(September), 153464–153473. https://doi.org/10.1109/ACCESS.2025.3605126
Emekci, H., & Özkan, İ. (2025). Stylometric Analysis of Sustainable Central Bank Communications: Revealing Authorial Signatures in Monetary Policy Statements †. Sustainability (Switzerland), 17(20), 1–15. https://doi.org/10.3390/su17208979
Ghosh, S. K., & Khandoker, A. H. (2024). Investigation on explainable machine learning models to predict chronic kidney diseases. Scientific Reports, 14(1), 1–15. https://doi.org/10.1038/s41598-024-54375-4
Grattafiori, A., Dubey, A., Jauhri, A., Pandey, A., Kadian, A., Al-Dahle, A., Letman, A., Mathur, A., Schelten, A., Vaughan, A., Yang, A., Fan, A., Goyal, A., Hartshorn, A., Yang, A., Mitra, A., Sravankumar, A., Korenev, A., Hinsvark, A., … Ma, Z. (2024). The Llama 3 Herd of Models. 1–92. http://arxiv.org/abs/2407.21783
Hamilton, R. I., & Papadopoulos, P. N. (2023). Using_SHAP_Values_and_Machine_Learning_to_Understa (1). 1, 1–12.
Hollmann, N., Müller, S., Purucker, L., & Krishnakumar, A. (2025). Accurate predictions on small data with a tabular foundation model. Nature, 637(May 2024). https://doi.org/10.1038/s41586-024-08328-6
Hollmann, N., Müller, S., Purucker, L., Krishnakumar, A., Körfer, M., Hoo, S. Bin, Schirrmeister, R. T., & Hutter, F. (2025). Accurate predictions on small data with a tabular foundation model. Nature, 637(8045), 319–326. https://doi.org/10.1038/s41586-024-08328-6
Mitchell, E., Lee, Y., Khazatsky, A., Manning, C. D., & Finn, C. (2023). DetectGPT: Zero-Shot Machine-Generated Text Detection using Probability Curvature. Proceedings of Machine Learning Research, 202, 24950–24962.
Narendra, E. C., Dhara, F., Arsya, A., Adisty, D., Putri, Y., Informasi, S., & Komputer, F. I. (2024). ANALISIS DAMPAK DISRUPTIF AI TERHADAP KETENAGAKERJAAN : POTENSI POSITIF DAN TANTANGAN NEGATIF ANALYSIS OF AI DISRUPTIVE IMPACT ON EMPLOYMENT : POSITIVE. 339–350.
Of, A., Between, D., Texts, H., The, U., Language, N., & Method, P. (2025). ANALYSIS OF DIFFERENCES BETWEEN AI AND HUMAN TEXTS USING THE NATURAL LANGUAGE PROCESSING METHOD ANALISIS PERBEDAAN TEKS BUATAN ARTIFICIAL INTELLIGENCE DAN MANUSIA MENGGUNAKAN METODE. 10(2), 1016–1025.
Patel, D., Parsa, S., & Johnson, A. P. (2026). A hybrid neural-symbolic approach for the longitudinal profiling of coercive control in digital investigations. Forensic Science International: Digital Investigation, 56(January), 302074. https://doi.org/10.1016/j.fsidi.2026.302074
Putu, L., & Antari, S. (2025). KESADARAN HUKUM DIGITAL DALAM PENDIDIKAN BAHASA : UPAYA MENCEGAH PLAGIARISME DAN. 5(1), 76–86.
Sa, D., & Gerhana, Y. A. (2025). Deteksi Generatif Teks pada Penilaian Otomatis Tes Esai Berbahasa Indonesia Menggunakan. 11(2).
Tanaja, R. N., Johnny, Rafif, M. A., & Gunawan, A. A. S. (2025). Fake News Detection using Machine Learning: Integrating FakeBERT Classification, Style Analysis, and Credibility Verification. Procedia Computer Science, 269, 1067–1076. https://doi.org/10.1016/j.procs.2025.09.048
Tran, V. H., Sebastian, Y., Karim, A., & Azam, S. (2024). Distinguishing Human Journalists from Artificial Storytellers Through Stylistic Fingerprints. Computers, 13(12). https://doi.org/10.3390/computers13120328
Winarjo, M. A. K., & Sari, D. N. (2026). A Systematic Comparison of SHAP and LIME for Explaining IndoBERTweet Predictions on Indonesian Toxic Content Detection.
















