通过奖励网络蒸馏实现异质演示者的联合目标与策略推断
脑机接口(BCI)与神经反馈AI 辅助决策与自动化系统AI 伦理、公平与问责AI/ML 研究员与工程师HCI 研究员认知科学家
强化学习(RL)作为学习如何做决策的一般框架取得了巨大成功。然而,这一成功依赖于RL专家对奖励函数的交互式手调。另一方面,逆强化学习(IRL)试图从易于获得的人类演示中学习奖励函数。然而,IRL存在两个主要局限:1)奖励模糊性——有无限数量的可能奖励函数可以解释专家的演示;2)异质性——人类专家采用不同的策略和偏好,由于假设演示者寻求最大化相同奖励,使得从多个演示者学习变得困难。在本工作中,我们提出了一种通过网络蒸馏联合推断任务目标和人类策略偏好的方法。这种方法使我们能够提炼出稳健的任务奖励(解决奖励模糊性)并对每个策略的目标进行建模(处理异质性)。我们演示了我们的算法可以更好地恢复任务奖励和策略奖励,并在两个模拟任务和一个真实世界的乒乓球任务中模仿这些策略。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
当前问题库还没有收录这篇论文的问题与痛点。
- 71%
深度学习以理解人类
CHI '18· 人体姿态与行为识别 +2
- 71%
关于认知:人类能力的一种错觉可能会妨碍对AI系统的适当依赖
CHI '23· 可解释人工智能(XAI) +2
- 71%
两个人的头脑是否比一个人在AI辅助决策中更好?比较群体和个人在人类-AI协作再犯风险评估中的行为和表现
CHI '23· 大语言模型(LLM)的人机协作 +2
- 71%
以人为本的人工智能是什么意思?研究领域的地图
CHI '23· 大语言模型(LLM)的人机协作 +2
- 71%
理解多智能体集体中的遵从与转化动态
CHI '26· 大语言模型(LLM)的人机协作 +2
- 71%
少即是多:重新思考人类行为的概率模型
HRI '20· 脑机接口(BCI)与神经反馈 +2
- 67%
公平的机器指导以提高有偏见人群的公平决策
CHI '24· AI 辅助决策与自动化系统 +1
- 63%
解释、公平性和人类-AI决策中的适当依赖
CHI '24· 可解释人工智能(XAI) +2
- 63%
使用 GPT 对话智能体模拟人群选择行为与偏见
CHI '26· 大语言模型(LLM)的人机协作 +3
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)
快捷操作
广告推荐
学习 AI 编程到 CodeNow
open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3319502.3374791
一眼看懂
fact_check论文快照
dataset
来源
HRI
calendar_month
年份
2020
emoji_events
奖项
未标记奖项
group
作者
4 位作者
sell
研究子方向
脑机接口(BCI)与神经反馈、AI 辅助决策与自动化系统、AI 伦理、公平与问责
work
职业/产业
AI/ML 研究员与工程师、HCI 研究员、认知科学家
article
内容状态
仅摘要
hub
相关论文
9 篇相关论文