Penerapan IndoBERT untuk Klasifikasi Curriculum Vitae Indonesia pada Tahap Early Screening
DOI:
https://doi.org/10.33005/santika.v6i1.1186Keywords:
curriculum vitae, klasifikasi dokumen, IndoBERT, pemrosesan bahasa alami, rekrutmenAbstract
Proses rekrutmen karyawan sering melibatkan penyaringan sejumlah besar dokumen Curriculum Vitae (CV) yang umumnya masih dilakukan secara manual. Kondisi ini memerlukan waktu yang relatif lama serta berpotensi menimbulkan subjektivitas dalam proses seleksi administrasi. Permasalahan tersebut semakin kompleks karena dokumen CV memiliki struktur yang beragam dan sering menggunakan campuran bahasa Indonesia dan bahasa Inggris. Penelitian ini menerapkan model bahasa berbasis Transformer, yaitu IndoBERT, untuk melakukan klasifikasi dokumen CV berbahasa Indonesia secara otomatis pada tahap early screening. Dataset yang digunakan terdiri dari 1140 dokumen CV dari proses rekrutmen nyata dengan distribusi kelas yang tidak seimbang. Tahapan pra-pemrosesan meliputi ekstraksi teks, anonimisasi data pribadi, normalisasi teks, serta segmentasi dokumen menggunakan teknik sliding window. Model kemudian dilakukan fine-tuning dan dievaluasi menggunakan metrik Accuracy, Precision, Recall, F1-score, serta Precision–Recall Area Under Curve (PR-AUC). Hasil evaluasi pada data uji menunjukkan bahwa model menghasilkan Accuracy sebesar 0,731, Precision sebesar 0,154, Recall sebesar 0,316, F1-score sebesar 0,207, dan PR-AUC sebesar 0,165. Analisis variasi threshold menunjukkan adanya trade-off antara precision dan recall yang dapat disesuaikan dengan kebutuhan proses rekrutmen. Hasil penelitian ini menunjukkan bahwa pendekatan berbasis IndoBERT memiliki potensi sebagai alat bantu prioritisasi kandidat pada tahap seleksi administrasi.
References
A. Jain and P. Sharma, “Automated Resume Screening Using Machine Learning Techniques,” Int. J. Eng. Res. Technol., vol. 11, no. 5, pp. 1–6, 2022.
R. Nugroho and S. Dewi, “Digital Recruitment Challenges in Indonesia,” J. Manaj. Teknol., vol. 21, no. 2, pp. 115–123, 2022.
C. D. Manning, P. Raghavan, and H. Schütze, Introduction to Information Retrieval. Cambridge, U.K.: Cambridge University Press, 2008.
T. Joachims, “Text Categorization with Support Vector Machines: Learning with Many Relevant Features,” in Proceedings of ECML, 1998, pp. 137–142.
A. Vaswani and others, “Attention Is All You Need,” in Advances in Neural Information Processing Systems, 2017, pp. 5998–6008.
J. Devlin, M.-W. Chang, K. Lee, and K. Toutanova, “BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding,” in Proceedings of NAACL-HLT, 2019, pp. 4171–4186.
M. Malherbe and N. Rule, “Resume Classification Using Contextual Language Models,” in IEEE International Conference on Big Data, 2020, pp. 1–6.
B. Wilie and others, “IndoNLU: Benchmark and Resources for Evaluating Indonesian Natural Language Understanding,” in Findings of EMNLP, 2020, pp. 843–857.
F. Kurniawan and R. Sarno, “Deep Learning for Indonesian Text Classification: A Comparative Study,” TELKOMNIKA, vol. 18, no. 6, pp. 3109–3116, 2020.
R. Parlika, A. Pratama, and A. Kurniawan, “The Online Test Application Uses Telegram Bots Version 1.0,” J. Phys. Conf. Ser., vol. 1569, no. 2, 2020.
J. Davis and M. Goadrich, “The Relationship Between Precision-Recall and ROC Curves,” in Proceedings of ICML, 2006, pp. 233–240.
P. Cappelli, “AI in Human Resources: Opportunities and Risks,” Calif. Manage. Rev., vol. 61, no. 4, pp. 15–42, 2019.
H. Zhang, Y. Song, and Q. Li, “Automated Resume Screening with Pretrained Language Models,” IEEE Access, vol. 9, pp. 123456–123468, 2021.
M. Kumar and S. Singh, “Deep Learning-Based Resume Classification System,” Int. J. Adv. Comput. Sci. Appl., vol. 13, no. 5, pp. 245–252, 2022.
X. Sun, Y. Cheng, and Z. Gan, “How to Fine-Tune BERT for Text Classification?,” in Proceedings of CCL, 2019, pp. 194–206.
Y. Liu and others, “RoBERTa: A Robustly Optimized BERT Pretraining Approach,” arXiv Prepr. arXiv1907.11692, 2019.
S. Buda, A. Maki, and M. A. Mazurowski, “A Systematic Study of the Class Imbalance Problem in Deep Learning,” Neural Networks, vol. 106, pp. 249–259, 2018.
C. Xie, F. Zheng, and L. Zhang, “Imbalanced Text Classification Using BERT with Cost-Sensitive Learning,” IEEE Access, vol. 8, pp. 12345–12356, 2020.
T.-Y. Lin and others, “Focal Loss for Dense Object Detection,” in Proceedings of ICCV, 2017, pp. 2980–2988.
I. Koto, J. H. Lau, and T. Baldwin, “IndoLEM and IndoBERT: Benchmarking Indonesian Language Models,” in Proceedings of COLING, 2020.
Z. C. Lipton, C. Elkan, and B. Naryanaswamy, “Optimal Thresholding of Classifiers to Maximize F1 Measure,” in Proceedings of ECML PKDD, 2014.


