SIRL:基于相似性的隐式表示学习
作者
生成式AI(文本、图像、音乐、视频)可解释人工智能(XAI)人-机器人协作(HRC)AI/ML 研究员与工程师
当机器人使用高容量模型直接从原始状态学习奖励函数时,它们需要同时学习任务中重要的内容——任务「特征」——以及如何将这些特征组合成单一目标。如果它们试图从输入全奖励函数的数据中同时完成这两件事,很容易得到包含数据中虚假相关性的表示,导致在新环境中泛化失败。相反,我们的最终目标是让机器人识别和隔离人们实际关心和使用来表示状态和行为的因果特征。我们的想法是,通过询问用户他们认为哪些行为相似来调整这个表示:如果重要的特征相似,即使底层行为不同,行为也会相似;反之,即使只有一个重要特征不同,行为也会不同。这进而使机器人能够区分哪些需要纳入表示、哪些是虚假的,以及行为的哪些方面可以压缩在一起、哪些不能。基于相似性学习表示的方法与对比学习有很好的对应关系——这是一种自监督表示学习技术,将视觉相似的数据点映射到相似的嵌入,其中相似性由设计者通过数据增强启发式定义。相比之下,为了学习人们使用的表示,从而学习他们的偏好和目标,我们使用他们对相似性的定义。在模拟和用户研究中,我们表明通过这种相似性查询学习的表示虽然远非完美,但确实比自监督和任务输入方法更具泛化能力。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
当前问题库还没有收录这篇论文的问题与痛点。
快捷操作
一眼看懂
fact_check论文快照
dataset
来源
HRI
calendar_month
年份
2023
emoji_events
奖项
未标记奖项
group
作者
5 位作者
sell
研究子方向
生成式AI(文本、图像、音乐、视频)、可解释人工智能(XAI)、人-机器人协作(HRC)
work
职业/产业
AI/ML 研究员与工程师
article
内容状态
仅摘要
hub
相关论文
3 篇相关论文