人工智能 · 强化学习

张汉平(Jag)

我是卡尔顿大学计算机科学博士研究生,研究方向为人工智能。我主要在 Yuhong Guo 教授的指导下,在人工智能与机器学习实验室(AIML Lab)从事强化学习(RL)研究。我的博士论文主要围绕安全强化学习。

我最近已完成博士阶段的学习,并将很快加入中国的一所研究机构。

关于

研究方向

我的研究主要围绕强化学习(RL)算法的开发。我的主要研究兴趣是安全强化学习,同时也关注强化学习泛化、自然语言指导的强化学习、基于技能的强化学习以及跨领域强化学习。同时,我也对将强化学习技术应用于其他机器学习问题感兴趣,包括半监督学习和噪声标签学习。

近期,我们研究了如果根据自然语言指导来改进强化学习智能体,从而提升决策效率、并在有限交互条件下增强泛化能力。同时,我依然对研究安全强化学习方法有兴趣,并希望能够使其应用于真实世界的决策场景中。

论文

会议论文

2026

Skill-based Safe Reinforcement Learning with Risk Planning

Hanping Zhang, Yuhong Guo. Reinforcement Learning Conference (RLC), 2026.

2026

Select-to-Act: Hierarchical Reinforcement Learning via Adaptive Language Guidance

Hanping Zhang, Adam Koziak, Yuhong Guo. European Conference on Machine Learning and Principles and Practice of Knowledge Discovery in Databases (ECML PKDD), 2026.

2026

Bi-Level Optimization for Single Domain Generalization

Marzi Heidari, Hanping Zhang, Hao Yan, Yuhong Guo. IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) Findings Track, 2026.

2025

Skill-Enhanced Reinforcement Learning Acceleration from Heterogeneous Demonstrations

Hanping Zhang, Yuhong Guo. European Conference on Artificial Intelligence (ECAI), 2025.

2025

Learning to Clean: Reinforcement Learning for Noisy Label Correction

Marzi Heidari, Hanping Zhang, Yuhong Guo. Advances in Neural Information Processing Systems (NeurIPS), 2025.

2025

Zero-Shot Action Generalization with Limited Observations

Abdullah Alchihabi*, Hanping Zhang*, Yuhong Guo. International Conference on Artificial Intelligence and Statistics (AISTATS), 2025. *Equal contribution

2024

Reinforcement Learning Guided Semi-Supervised Learning

Marzi Heidari, Hanping Zhang, Yuhong Guo. Advances in Neural Information Processing Systems (NeurIPS), 2024.

2021

Why Dataset Properties Bound the Scalability of Parallel Machine Learning Training Algorithms

Daning Cheng, Shigang Li, Hanping Zhang, Fen Xia, Yunquan Zhang. IEEE Transactions on Parallel and Distributed Systems (TPDS), 2021.

2019

Using Gradient Based Multikernel Gaussian Process and Meta-Acquisition Function to Accelerate SMBO

Daning Cheng, Hanping Zhang, Fen Xia, Shigang Li, Yunquan Zhang. IEEE International Conference on Tools with Artificial Intelligence (ICTAI), 2019.

研讨会论文

2025

LLM-Driven Policy Diffusion: Enhancing Generalization in Offline Reinforcement Learning

Hanping Zhang, Yuhong Guo. Aligning Reinforcement Learning Experimentalists and Theorists Workshop (NeurIPS), 2025.

2022

Generalization of Reinforcement Learning with Policy-Aware Adversarial Data Augmentation

Hanping Zhang, Yuhong Guo. Decision Awareness in Reinforcement Learning Workshop (ICML), 2022.

背景

教育经历

2021 年 9 月至今

卡尔顿大学

计算机科学博士

渥太华,加拿大安大略省

导师:Yuhong Guo 教授。

2019 年 3 月 - 2021 年 5 月

纽约州立大学布法罗分校

计算机科学工程硕士

布法罗,美国纽约州

2015 年 9 月 - 2018 年 5 月

马里兰大学帕克分校

计算机科学理学学士,数学辅修

帕克,美国马里兰州

2013 年 9 月 - 2015 年 7 月

四川大学

计算机科学理学学士

成都,中国四川省

后转入马里兰大学帕克分校。

工作经历

2018 年 6 月 - 2018 年 12 月

实习研究生 | 智铀科技(北京)

  • 在程大宁博士的指导下,基于 Auto-Sklearn 平台实现所提出的梯度引导超参数优化框架。
  • 为 SMAC 集成多核高斯过程与参数服务器模块,实现基于梯度信息和并行计算的超参数优化。
  • 相关研究成果发表于 IEEE International Conference on Tools with Artificial Intelligence (ICTAI 2019)。

学术服务

审稿人

AAAICVPRECMLICLRICMLNeurIPSRLC