通过奖励网络蒸馏实现异质演示者的联合目标与策略推断

脑机接口(BCI)与神经反馈AI 辅助决策与自动化系统AI 伦理、公平与问责AI/ML 研究员与工程师HCI 研究员认知科学家

强化学习(RL)作为学习如何做决策的一般框架取得了巨大成功。然而,这一成功依赖于RL专家对奖励函数的交互式手调。另一方面,逆强化学习(IRL)试图从易于获得的人类演示中学习奖励函数。然而,IRL存在两个主要局限:1)奖励模糊性——有无限数量的可能奖励函数可以解释专家的演示;2)异质性——人类专家采用不同的策略和偏好,由于假设演示者寻求最大化相同奖励,使得从多个演示者学习变得困难。在本工作中,我们提出了一种通过网络蒸馏联合推断任务目标和人类策略偏好的方法。这种方法使我们能够提炼出稳健的任务奖励(解决奖励模糊性)并对每个策略的目标进行建模(处理异质性)。我们演示了我们的算法可以更好地恢复任务奖励和策略奖励,并在两个模拟任务和一个真实世界的乒乓球任务中模仿这些策略。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/hri/38234/2020

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3319502.3374791
一眼看懂

论文快照

fact_check
dataset
来源
HRI
calendar_month
年份
2020
emoji_events
奖项
未标记奖项
group
作者
4 位作者
sell
研究子方向
脑机接口(BCI)与神经反馈、AI 辅助决策与自动化系统、AI 伦理、公平与问责
work
职业/产业
AI/ML 研究员与工程师、HCI 研究员、认知科学家
article
内容状态
仅摘要
hub
相关论文
9 篇相关论文