Muyleng Ghuy 最新论文
Chen 等人提出通过网络蒸馏联合推断任务目标和人类策略偏好的方法,解决了逆强化学习中奖励模糊性和异质性两大难题,在模拟和真实任务中验证了算法有效性。
https://hci.top/zh/authors/28976?source=all