通过贝叶斯逆强化学习自主评估示范充分性
荣誉提名遥操作驾驶(Teleoperation)AI 辅助决策与自动化系统AI/ML 研究员与工程师
我们研究了确定示范充分性的问题:机器人如何自我评估它是否从专家那里获得了足够多的演示以确保达到期望的性能水平?为了解决这个问题,我们提出了一种基于贝叶斯逆强化学习和风险价值的新型自评估方法,使能够从示范中学习("LfD")的机器人能够计算其性能的高置信度界,并利用这些界来确定它们何时拥有足够数量的演示。我们提出并评估了充分性的两种定义:(1)归一化期望值差异,衡量相对于人类未观测到的奖励函数的遗憾;(2)相对于基线策略的改进百分比。我们展示了如何为这两个指标制定高置信度界。我们在离散和连续状态空间的模拟中评估了我们的方法,并说明了开发能够准确评估示范充分性的机器人系统的可行性。我们还表明,机器人可以在评估示范充分性的同时利用主动学习从特定状态请求演示,而这会导致需要的演示更少,同时机器人仍能保持对其策略的高度信心。最后,我们通过用户研究演示了我们方法的可行性。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
当前问题库还没有收录这篇论文的问题与痛点。
- 67%
TiiS:用于复杂系统建模的人工智能:驯服专家模型的复杂性以改进决策
IUI '22· AI 辅助决策与自动化系统
- 60%
什么时候机器学习数据是好的?:公共卫生数据化评估
CHI '22· 遥操作驾驶(Teleoperation) +2
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)
快捷操作
一眼看懂
fact_check论文快照
dataset
来源
HRI
calendar_month
年份
2024
emoji_events
奖项
荣誉提名
group
作者
3 位作者
sell
研究子方向
遥操作驾驶(Teleoperation)、AI 辅助决策与自动化系统
work
职业/产业
AI/ML 研究员与工程师
article
内容状态
仅摘要
hub
相关论文
2 篇相关论文