ỨNG DỤNG HỌC MÁY VÀ TẦN SUẤT THUẬT NGỮ - NGHỊCH ĐẢO TẦN SUẤT TÀI LIỆU TRONG PHÂN LOẠI HỒ SƠ ỨNG VIÊN NGÀNH CÔNG NGHỆ THÔNG TIN HỖ TRỢ TIỀN SÀNG LỌC TUYỂN DỤNG
DOI:
https://doi.org/10.59266/houjs.2026.1425Keywords:
học máy, hồ sơ ứng viên, phân loại văn bản, tiền sàng lọc, tần suất thuật ngữ - nghịch đảo tần suất tài liệuAbstract
Nghiên cứu xây dựng hệ thống hỗ trợ tiền sàng lọc hồ sơ ứng viên ngành Công nghệ thông tin thông qua phân loại hồ sơ ứng viên (Curriculum Vitae - CV) tiếng Việt theo nhóm nghề. Hệ thống tích hợp mô-đun trích xuất văn bản từ các định dạng đầu vào, tiền xử lý văn bản, biểu diễn đặc trưng bằng TF-IDF và bốn thuật toán học máy gồm Máy véc-tơ hỗ trợ (Support Vector Machine - SVM), bộ phân loại Bayes đơn giản (Naive Bayes - NB), hồi quy logistic (Logistic Regression - LR) và rừng ngẫu nhiên (Random Forest - RF). Bộ dữ liệu nghiên cứu gồm 345 CV được gán vào bốn nhóm Web Developer, Backend Developer, Data Analyst và Tester. Dữ liệu được phân chia có phân tầng thành tập huấn luyện và tập kiểm tra; việc lựa chọn mô hình và tối ưu siêu tham số được thực hiện trên tập huấn luyện, trong khi tập kiểm tra độc lập gồm 69 CV được sử dụng cho đánh giá cuối cùng. Trên tập kiểm tra, SVM tuyến tính đạt độ chính xác (Accuracy) 88,41%, điểm F1 có trọng số (Weighted-F1) 88,22%, điểm F1 trung bình vĩ mô (Macro-F1) 87,10% và độ chính xác cân bằng (Balanced Accuracy) 87,04%. Phân tích lỗi cho thấy sự nhầm lẫn tập trung chủ yếu giữa Web Developer và Backend Developer. Kết quả cho thấy TF-IDF kết hợp SVM có tiềm năng hỗ trợ phân loại CV ở bước tiền sàng lọc; tuy nhiên hệ thống không thay thế đánh giá chuyên môn của nhà tuyển dụng và cần được kiểm định trên dữ liệu độc lập lớn hơn trước khi triển khai thực tế.
References
Aggarwal, C. C., & Zhai, C. (2012). Mining text data. Springer. https://doi.org/10.1007/978-1-4614-3223-4
Barrak, A., Adams, B., & Zouaq, A. (2022). Toward a traceable, explainable, and fair JD/resume recommendation system. arXiv. https://doi.org/10.48550/arXiv.2202.08960
Breiman, L. (2001). Random forests. Machine Learning, 45(1), 5-32. https://doi.org/10.1023/A:1010933404324
Gan, C., & Mori, T. (2022). Construction of English resume corpus and test with pre- trained language models. arXiv. https://doi.org/10.48550/arXiv.2208.03219
Heakl, A., Mohamed, Y., Mohamed, N., Elsharkawy, A., & Zaky, A. (2024). ResumeAtlas: Revisiting resume classification with large-scale datasets and large language models. arXiv. https://doi.org/10.48550/arXiv.2406.18125
Joachims, T. (1998). Text categorization with support vector machines: Learning with many relevant features. In Proceedings of the European Conference on Machine Learning (pp. 137-142). Springer. https://doi.org/10.1007/BFb0026683
Nguyen, L. M. và Pham. Q. N. (2018). Phân loại tài liệu tiếng Việt sử dụng TF-IDF và SVM. Tạp chí Khoa học và Công nghệ Đại học Đà Nẵng, (11), 45-50.
Pedregosa, F., Varoquaux, G., Gramfort, A., Michel, V., Thirion, B., Grisel, O., Blondel, M., Prettenhofer, P., Weiss, R., Dubourg, V., Vanderplas, J., Passos, A., Cournapeau, D., Brucher, M., Perrot, M., & Duchesnay, É. (2011). Scikit- learn: Machine learning in Python. Journal of Machine Learning Research, 12, 2825-2830. https://jmlr.org/papers/v12/pedregosa11a.html
Vu, T., Nguyen, D. Q., Nguyen, D. Q., Dras, M., & Johnson, M. (2018). VnCoreNLP: A Vietnamese natural language processing toolkit. In Proceedings of NAACL: Demonstrations (pp. 56- 60). Association for Computational Linguistics. https://doi.org/10.18653/v1/N18-5012
Wang, Z., Wei, W., Xu, C., Xu, J., & Mao, X.-L. (2022). Person-job fit estimation from candidate profile and related recruitment history with co-attention neural networks. arXiv. https://doi.org/10.48550/arXiv.2206.09116