IMPLEMENTASI NLP UNTUK SUMMARIZATION DOKUMEN AKADEMIK BERBAHASA INDONESIA MENGGUNAKAN TEXTRANK DAN TRANSFORMER MT5
DOI:
https://doi.org/10.70248/jcsit.v3i4.4363Keywords:
Automatic Text Summarization, Natural Language Processing, TextRank, Transformer mT5, ROUGE.Abstract
Perkembangan dokumen akademik digital meningkatkan kebutuhan akan sistem automatic text summarization yang mampu menyajikan informasi secara ringkas tanpa menghilangkan makna utama. Penelitian ini mengimplementasikan Natural Language Processing (NLP) pada sistem summarization dokumen akademik berbahasa Indonesia berbasis web menggunakan metode TextRank dan Transformer mT5. Dataset terdiri atas dua dokumen akademik yang dievaluasi menggunakan gold summary. Tahapan penelitian meliputi ekstraksi teks, preprocessing, pembangkitan ringkasan, dan evaluasi menggunakan ROUGE-1, ROUGE-2, dan ROUGE-L. Model Transformer mT5 diimplementasikan dengan konfigurasi maksimum input 512 token, output 256 token, beam search 4, length penalty 1,0, dan repetition penalty 1,2. Hasil pengujian menunjukkan bahwa performa kedua metode dipengaruhi oleh karakteristik dokumen. TextRank memperoleh rata-rata ROUGE-1 F1-score sebesar 0,4363, sedangkan Transformer mT5 memperoleh 0,4329. TextRank menghasilkan kesesuaian leksikal yang lebih tinggi terhadap gold summary, sedangkan Transformer mT5 mampu menghasilkan ringkasan yang lebih ringkas berdasarkan hasil observasi. Penelitian ini menunjukkan bahwa kedua pendekatan memiliki karakteristik yang saling melengkapi dalam automatic text summarization dokumen akademik berbahasa Indonesia.
References
C. Jiang, W. Jin, X. Wang, and L. Zhao, “Incorporating moral motivation in automatic summary generation of literary fiction,” Data Inf. Manag., vol. 10, no. 2, p. 100120, 2026, doi: 10.1016/j.dim.2025.100120.
D. Kumar, C. Verma, and Z. Illes, “Optimizing student job placements with NLP and Explainable AI: A fair and transparent hiring framework,” Array, vol. 29, no. March, p. 100729, 2026, doi: 10.1016/j.array.2026.100729.
G. Sharma, D. Sharma, and M. Sasikumar, “Summarizing long scientific documents through hierarchical structure extraction,” Nat. Lang. Process. J., vol. 8, no. December 2023, p. 100080, 2024, doi: 10.1016/j.nlp.2024.100080.
H. Wang, “Automatic question-answering modeling in English by integrating TF-IDF and segmentation algorithms,” Syst. Soft Comput., vol. 6, no. February, p. 200087, 2024, doi: 10.1016/j.sasc.2024.200087.
S. Goyal and A. Kaur, “Summarization of Software Bug Report based on Sentence Semantic Similarity (SSBRSSS) Technique,” Procedia Comput. Sci., vol. 235, no. 2023, pp. 1761–1771, 2024, doi: 10.1016/j.procs.2024.04.167.
S. S. Abdulkareem, “Hybrid extractive – abstractive summarization of scientific texts via deep clustering and attention mechanism,” vol. 138, no. December 2025, pp. 21–35, 2026.
M. F. Fakhrezi, M. A. Bijaksana, and A. F. Huda, “Implementation of Automatic Text Summarization with TextRank Method in the Development of Al-Qur’an Vocabulary Encyclopedia,” Procedia Comput. Sci., vol. 179, no. 2020, pp. 391–398, 2021, doi: 10.1016/j.procs.2021.01.021.
S. Phani, A. Abdul, M. K. S. Prasad, and V. D. Reddy, “MATSFT: User query-based multilingual abstractive text summarization for low resource Indian languages by fine-tuning mT5,” Alexandria Eng. J., vol. 127, no. December 2024, pp. 129–142, 2025, doi: 10.1016/j.aej.2025.04.031.
N. M. Gardazi, M. K. Malik, and A. Daud, “Pahari POS-tagged corpus: A large-scale linguistic resource for NLP applications,” Data Br., vol. 65, 2026, doi: 10.1016/j.dib.2026.112515.
A. Auriemma Citarella, M. Barbella, M. G. Ciobanu, F. De Marco, L. Di Biasi, and G. Tortora, “Assessing the effectiveness of ROUGE as unbiased metric in Extractive vs. Abstractive summarization techniques,” J. Comput. Sci., vol. 87, no. February 2024, p. 102571, 2025, doi: 10.1016/j.jocs.2025.102571.
S. Yunus, C. Hark, and F. Okumuş, “Enhancing extractive multi-documents summarization with a novel dominating set model for semantic relationship detection,” Eng. Sci. Technol. an Int. J., vol. 69, no. July, 2025, doi: 10.1016/j.jestch.2025.102127.
A. Goswami, “ScienceDirect Blockchain-Integrated Network for Secure Data Sharing in Collaborative NLP Research Applications,” Procedia Comput. Sci., vol. 275, pp. 200–207, 2026, doi: 10.1016/j.procs.2026.01.025.
D. Zare, L. Fernandez-Sanz, V. Pospelova, I. Lopez-Baldominos, N. Rizun, and A. Revina, “Semantic mapping of soft skills from skillsmatch framework to the standard EN 16234-1 using transformer-based NLP,” Comput. Stand. Interfaces, vol. 98, no. March, 2026, doi: 10.1016/j.csi.2026.104162.
J. S. Zhu, H. Sun, and B. Kong, “Improving multilingual English translation performance through T5 and MAML integration,” Syst. Soft Comput., vol. 7, no. October 2024, p. 200394, 2025, doi: 10.1016/j.sasc.2025.200394.
















