THIẾT KẾ HÀM PHẦN THƯỞNG ĐA MỤC TIÊU CHO HỌC TĂNG CƯỜNG TRONG ĐIỆN TOÁN BIÊN HỖ TRỢ ỨNG DỤNG THỰC TẾ ẢO VÀ TĂNG CƯỜNG
DOI:
https://doi.org/10.59266/houjs.2026.1339Keywords:
điện toán biên, học tăng cường sâu, hàm phần thưởng đa mục tiêu, ứng dụng AR/VR, độ trễ thấp, PPO, quản lý tài nguyênAbstract
Quản lý động tài nguyên trong hệ thống điện toán biên đa truy cập (Multi- Access Edge Computing - MEC) phục vụ ứng dụng thực tế ảo và thực tế tăng cường (AR/ VR) đặt ra nhiều thách thức lớn do yêu cầu khắt khe về độ trễ thấp và hiệu quả năng lượng. Học tăng cường sâu (Deep Reinforcement Learning - DRL) đã trở thành cách tiếp cận phổ biến cho bài toán này; tuy nhiên, hiệu năng của DRL phụ thuộc nhiều vào thiết kế hàm phần thưởng. Mục tiêu của bài báo là phân tích và so sánh ba thiết kế hàm phần thưởng đa mục tiêu cho thuật toán Proximal Policy Optimization (PPO) trong môi trường MEC AR/VR, bao gồm: tổng có trọng số tuyến tính (LWS), hàm logarit (LOG) và phương án phân tầng thích ứng (Adaptive Hierarchical - AH) được nhóm tác giả đề xuất. Phương pháp nghiên cứu là xây dựng môi trường mô phỏng MEC AR/VR tùy chỉnh trên Python với 10 thiết bị người dùng và một trạm gốc tích hợp một máy chủ biên duy nhất, sau đó huấn luyện và đánh giá ba phương án trên bốn chỉ số: độ trễ trung bình, năng lượng tiêu thụ, tỷ lệ vi phạm hạn và tốc độ hội tụ; mỗi cấu hình được lặp lại 5 lần với 5 hạt giống ngẫu nhiên khác nhau. Bài báo cũng bổ sung so sánh với ba baseline đơn giản (Random, Greedy battery-aware, AllLocal) và phân tích độ nhạy của tham số trọng số động κ. Kết quả cho thấy hàm phần thưởng AH đề xuất giảm 19% độ trễ trung bình, 27% năng lượng tiêu thụ và 27% tỷ lệ vi phạm hạn so với LWS, đồng thời cho thấy độ ổn định cao trong dải κ rộng.
References
Cao, Z., Zhou, P., Li, R., Huang, S., & Wu, D. (2020). Multiagent Deep Reinforcement Learning for Joint Multichannel Access and Task Offloading of Mobile-Edge Computing in Industry 4.0. IEEE Internet of Things Journal, 7(7), 6201-6213. https://doi.org/10.1109/JIOT.2020.2968951
Chen, J., Xing, H., Xiao, Z., Xu, L., & Tao, T. (2021). A DRL Agent for Jointly Optimizing Computation Offloading and Resource Allocation in MEC. IEEE Internet of Things Journal, 8(24), 17508-17524. https://doi.org/10.1109/JIOT.2021.3081694
Hoàng, T. N. (2026). Đề xuất cơ chế truyền thông trạng thái thích nghi dựa trên mức độ quan trọng cho bài toán phân tải tác vụ đa tác tử trong điện toán biên di động. Tạp chí Khoa học Trường Đại học Mở Hà Nội, số đặc biệt 10A, 25-35. https://doi.org/10.59266/houjs.2026.1151
Mach, P., & Becvar, Z. (2017). Mobile edge computing: A Survey on Architecture and Computation Offloading. IEEE Communications Surveys & Tutorials, 19(3), 1628-1656. https://doi.org/10.1109/COMST.2017.2682318
Mao, Y., You, C., Zhang, J., Huang, K., & Letaief, K. B. (2017). A Survey on Mobile Edge Computing: The Communication Perspective. IEEE Communications Surveys & Tutorials, 19(4), 2322-2358. https://doi.org/10.1109/COMST.2017.2745201
Nguyen, C. L., Dinh, T. H., Gong, S., Niyato, D., Wang, P., Liang, Y.-C., & Kim, D. I. (2019). Applications of deep reinforcement learning in communications and networking: A survey. IEEE Communications Surveys & Tutorials, 21(4), 3133-3174. https://doi.org/10.1109/COMST.2019.2916583
Schulman, J., Wolski, F., Dhariwal, P., Radford, A., & Klimov, O. (2017). Proximal policy optimization algorithms. arXiv. https://doi.org/10.48550/arXiv.1707.06347
Siriwardhana, Y., Porambage, P., Liyanage, M., & Ylianttila, M. (2021). A Survey on Mobile Augmented Reality With 5G Mobile Edge Computing: Architectures, Applications, and Technical Aspects. IEEE Communications Surveys & Tutorials, 23(2), 1160-1192. https://doi.org/10.1109/COMST.2021.3061981