TẠO SINH CÂU HỎI TRẮC NGHIỆM THEO CHUẨN ĐẦU RA HỌC PHẦN DỰA TRÊN MÔ HÌNH NGÔN NGỮ LỚN VÀ THANG NHẬN THỨC BLOOM

Các tác giả

  • Ngọ Văn Sơn
  • Bùi Anh Tuấn
  • Nguyễn Quang Ánh

DOI:

https://doi.org/10.59266/houjs.2026.1437

Từ khóa:

tạo sinh câu hỏi tự động, mô hình ngôn ngữ lớn, chuẩn đầu ra học phần, chấm chéo LLM, đánh giá giáo dục đại học

Tóm tắt

Nghiên cứu đề xuất và thử nghiệm quy trình tạo sinh tự động câu hỏi trắc nghiệm khách quan (TNKQ) tiếng Việt dựa trên mô hình ngôn ngữ lớn (LLM), trong đó mỗi câu hỏi được gắn với một chuẩn đầu ra học phần (Course Learning Outcomes - CLO) và một mức nhận thức theo thang Bloom cải tiến, đồng thời được dựa vào nội dung giáo trình bằng kỹ thuật truy xuất BM25 nhằm hạn chế hiện tượng ảo giác nội dung. Khác với các nghiên cứu trước dựa vào giảng viên đánh giá thủ công hoặc dùng một LLM tự đánh giá bản thân, nghiên cứu này đề xuất cơ chế chấm chéo giữa hai LLM thuộc hai họ độc lập (LLaMA-3.3-70B và Qwen3-32B) làm phương pháp đánh giá tự động. Thử nghiệm trên học phần Mạng và truyền thông với 40 câu hỏi sinh được cho thấy hệ thống đạt mức đồng thuận đáp án tốt đến rất tốt (Cohen's κ = 0,78–0,82) và độ bám sát giáo trình rất cao (0,97–0,99), nhưng bộc lộ thách thức lớn khi phân loại mức nhận thức Bloom (κ = 0,03–0,26). Kết quả khẳng định xu hướng khả thi của AI trong hỗ trợ đánh giá đại học, đồng thời chỉ rõ ranh giới giữa năng lực tự động hóa và vai trò không thể thay thế của giảng viên.

Tài liệu tham khảo

Anderson, L. W., & Krathwohl, D. R. (Eds.). (2001). A taxonomy for learning, teaching, and assessing: A revision of Bloom’s taxonomy of educational objectives. Longman.

Bộ Giáo dục và Đào tạo. (2021). Thông tư số 17/2021/TT-BGDĐT ngày 22/6/2021 quy định về chuẩn chương trình đào tạo; xây dựng, thẩm định và ban hành chương trình đào tạo các trình độ của giáo dục đại học. https://vanban.chinhphu.vn/?pageid=27160&docid=203478

Biggs, J. (1996). Enhancing teaching through constructive alignment. Higher Education, 32, 347-364. https://doi.org/10.1007/BF00138871

Dhawaleswar Rao, & Saha, S. K. (2020). Automatic multiple choice question generation from text: A survey. IEEE Transactions on Learning Technologies, 13(1), 14-25. https://doi.org/10.1109/TLT.2018.2889100

Doughty, J., Wan, Z., Bompelli, A., Qayum, J., Wang, T., Zhang, J., Zheng, Y., Doyle, A., Sridhar, P., Agarwal, A., Bogart, C., Keylor, E., Kultur, C., Savelka, J., & Sakr, M. (2024). A comparative study of AI-generated (GPT-4) and human-crafted MCQs in programming education. In Proceedings of the 26th Australasian Computing Education Conference (pp. [cần bổ sung nếu có]). https://doi.org/10.1145/3636243.3636256

Elkins, S., Kochmar, E., Cheung, J. C. K., & Serban, I. (2024). How teachers can use large language models and Bloom’s taxonomy to create educational quizzes. In Proceedings of the Thirty-Eighth AAAI Conference on Artificial Intelligence and Thirty-Sixth Conference on Innovative Applications of Artificial Intelligence and Fourteenth Symposium on Educational Advances in Artificial Intelligence. https://doi.org/10.1609/aaai.v38i21.30353

Haladyna, T. M., Downing, S. M., & Rodriguez, M. C. (2002). A review of multiple-choice item-writing guidelines for classroom assessment. Applied Measurement in Education, 15(3), 309-333. https://doi.org/10.1207/S15324818AME1503_5

Kıyak, Y. S., Coşkun, Ö., Budakoğlu, I., & Uluoğlu, C. (2024). ChatGPT for generating multiple-choice questions: Evidence on the use of artificial intelligence in automatic item generation for a rational pharmacotherapy exam. European Journal of Clinical Pharmacology, 80, 1-7. https://doi.org/10.1007/s00228-024-03649-x

Kurdi, G., Leo, J., Parsia, B., Sattler, U., & Al- Emari, S. (2020). A systematic review of automatic question generation for educational purposes. International Journal of Artificial Intelligence in Education, 30(1), 121-204. https://doi.org/10.1007/s40593-019-00186-y

Landis, J. R., & Koch, G. G. (1977). The Measurement of Observer Agreement for Categorical Data. Biometrics, 33(1), 159-174. https://doi.org/10.2307/2529310

Rodriguez, M. C. (2005). Three options are optimal for multiple-choice items: A meta-analysis of 80 years of research. Educational Measurement: Issues and Practice, 24(2), 3-13. https://doi.org/10.1111/j.1745-3992.2005.00006.x

Zheng, L., Chiang, W.-L., Sheng, Y., Zhuang, S., Wu, Z., Zhuang, Y., Lin, Z., Li, Z., Li, D., Xing, E. P., Zhang, H., Gonzalez, J. E., & Stoica, I. (2023). Judging LLM-as-a-judge with MT-bench and Chatbot Arena. In Advances in Neural Information Processing Systems.

Tải xuống

Loading...