通过贝叶斯逆强化学习自主评估示范充分性

荣誉提名
遥操作驾驶(Teleoperation)AI 辅助决策与自动化系统AI/ML 研究员与工程师

我们研究了确定示范充分性的问题:机器人如何自我评估它是否从专家那里获得了足够多的演示以确保达到期望的性能水平?为了解决这个问题,我们提出了一种基于贝叶斯逆强化学习和风险价值的新型自评估方法,使能够从示范中学习("LfD")的机器人能够计算其性能的高置信度界,并利用这些界来确定它们何时拥有足够数量的演示。我们提出并评估了充分性的两种定义:(1)归一化期望值差异,衡量相对于人类未观测到的奖励函数的遗憾;(2)相对于基线策略的改进百分比。我们展示了如何为这两个指标制定高置信度界。我们在离散和连续状态空间的模拟中评估了我们的方法,并说明了开发能够准确评估示范充分性的机器人系统的可行性。我们还表明,机器人可以在评估示范充分性的同时利用主动学习从特定状态请求演示,而这会导致需要的演示更少,同时机器人仍能保持对其策略的高度信心。最后,我们通过用户研究演示了我们方法的可行性。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/hri/140153/2024

广告推荐

学习 AI 编程到 CodeNow

一眼看懂

论文快照

fact_check
dataset
来源
HRI
calendar_month
年份
2024
emoji_events
奖项
荣誉提名
group
作者
3 位作者
sell
研究子方向
遥操作驾驶(Teleoperation)、AI 辅助决策与自动化系统
work
职业/产业
AI/ML 研究员与工程师
article
内容状态
仅摘要
hub
相关论文
2 篇相关论文