ỨNG DỤNG HỌC MÁY VÀ TẦN SUẤT THUẬT NGỮ - NGHỊCH ĐẢO TẦN SUẤT TÀI LIỆU TRONG PHÂN LOẠI HỒ SƠ ỨNG VIÊN NGÀNH CÔNG NGHỆ THÔNG TIN HỖ TRỢ TIỀN SÀNG LỌC TUYỂN DỤNG

Các tác giả

  • Nguyễn Thị Mười Phương
  • Trần Thị Lụa
  • Trần Thị Nga
  • Lý Cao Tú
  • Vũ Thị Duyên

DOI:

https://doi.org/10.59266/houjs.2026.1425

Từ khóa:

học máy, hồ sơ ứng viên, phân loại văn bản, tiền sàng lọc, tần suất thuật ngữ - nghịch đảo tần suất tài liệu

Tóm tắt

Nghiên cứu xây dựng hệ thống hỗ trợ tiền sàng lọc hồ sơ ứng viên ngành Công nghệ thông tin thông qua phân loại hồ sơ ứng viên (Curriculum Vitae - CV) tiếng Việt theo nhóm nghề. Hệ thống tích hợp mô-đun trích xuất văn bản từ các định dạng đầu vào, tiền xử lý văn bản, biểu diễn đặc trưng bằng TF-IDF và bốn thuật toán học máy gồm Máy véc-tơ hỗ trợ (Support Vector Machine - SVM), bộ phân loại Bayes đơn giản (Naive Bayes - NB), hồi quy logistic (Logistic Regression - LR) và rừng ngẫu nhiên (Random Forest - RF). Bộ dữ liệu nghiên cứu gồm 345 CV được gán vào bốn nhóm Web Developer, Backend Developer, Data Analyst và Tester. Dữ liệu được phân chia có phân tầng thành tập huấn luyện và tập kiểm tra; việc lựa chọn mô hình và tối ưu siêu tham số được thực hiện trên tập huấn luyện, trong khi tập kiểm tra độc lập gồm 69 CV được sử dụng cho đánh giá cuối cùng. Trên tập kiểm tra, SVM tuyến tính đạt độ chính xác (Accuracy) 88,41%, điểm F1 có trọng số (Weighted-F1) 88,22%, điểm F1 trung bình vĩ mô (Macro-F1) 87,10% và độ chính xác cân bằng (Balanced Accuracy) 87,04%. Phân tích lỗi cho thấy sự nhầm lẫn tập trung chủ yếu giữa Web Developer và Backend Developer. Kết quả cho thấy TF-IDF kết hợp SVM có tiềm năng hỗ trợ phân loại CV ở bước tiền sàng lọc; tuy nhiên hệ thống không thay thế đánh giá chuyên môn của nhà tuyển dụng và cần được kiểm định trên dữ liệu độc lập lớn hơn trước khi triển khai thực tế.

Tài liệu tham khảo

Aggarwal, C. C., & Zhai, C. (2012). Mining text data. Springer. https://doi.org/10.1007/978-1-4614-3223-4

Barrak, A., Adams, B., & Zouaq, A. (2022). Toward a traceable, explainable, and fair JD/resume recommendation system. arXiv. https://doi.org/10.48550/arXiv.2202.08960

Breiman, L. (2001). Random forests. Machine Learning, 45(1), 5-32. https://doi.org/10.1023/A:1010933404324

Gan, C., & Mori, T. (2022). Construction of English resume corpus and test with pre- trained language models. arXiv. https://doi.org/10.48550/arXiv.2208.03219

Heakl, A., Mohamed, Y., Mohamed, N., Elsharkawy, A., & Zaky, A. (2024). ResumeAtlas: Revisiting resume classification with large-scale datasets and large language models. arXiv. https://doi.org/10.48550/arXiv.2406.18125

Joachims, T. (1998). Text categorization with support vector machines: Learning with many relevant features. In Proceedings of the European Conference on Machine Learning (pp. 137-142). Springer. https://doi.org/10.1007/BFb0026683

Nguyen, L. M. và Pham. Q. N. (2018). Phân loại tài liệu tiếng Việt sử dụng TF-IDF và SVM. Tạp chí Khoa học và Công nghệ Đại học Đà Nẵng, (11), 45-50.

Pedregosa, F., Varoquaux, G., Gramfort, A., Michel, V., Thirion, B., Grisel, O., Blondel, M., Prettenhofer, P., Weiss, R., Dubourg, V., Vanderplas, J., Passos, A., Cournapeau, D., Brucher, M., Perrot, M., & Duchesnay, É. (2011). Scikit- learn: Machine learning in Python. Journal of Machine Learning Research, 12, 2825-2830. https://jmlr.org/papers/v12/pedregosa11a.html

Vu, T., Nguyen, D. Q., Nguyen, D. Q., Dras, M., & Johnson, M. (2018). VnCoreNLP: A Vietnamese natural language processing toolkit. In Proceedings of NAACL: Demonstrations (pp. 56- 60). Association for Computational Linguistics. https://doi.org/10.18653/v1/N18-5012

Wang, Z., Wei, W., Xu, C., Xu, J., & Mao, X.-L. (2022). Person-job fit estimation from candidate profile and related recruitment history with co-attention neural networks. arXiv. https://doi.org/10.48550/arXiv.2206.09116

Tải xuống

Loading...