PREDILECT:基于零样本语言推理的强化学习偏好提取方法

生成式AI(文本、图像、音乐、视频)大语言模型(LLM)的人机协作AI 辅助决策与自动化系统自动驾驶工程师与测试员软件工程师与开发者AI/ML 研究员与工程师

偏好强化学习(RL)已成为机器人学习的新兴领域,人类通过表达对不同状态-动作对序列的偏好在塑造机器人行为方面发挥关键作用。然而,为机器人制定现实策略需要人类对大量查询做出响应。本研究通过扩展每条查询收集的信息(包含偏好和可选文本提示)来解决样本效率挑战。为此,我们利用大型语言模型(LLM)的零样本能力对人类提供的文本进行推理。为适应额外的查询信息,我们重新制定奖励学习目标,包含灵活的高亮信息——即包含相对较高信息量且与预训练LLM零样本处理相关特征的状态-动作对。我们在模拟场景和用户研究中通过分析反馈及其含义证明了本工作的有效性。此外,收集的反馈还可用于训练机器人在模拟社交导航场景中执行符合社会规范的轨迹。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/hri/140086/2024

广告推荐

学习 AI 编程到 CodeNow

一眼看懂

论文快照

fact_check
dataset
来源
HRI
calendar_month
年份
2024
emoji_events
奖项
未标记奖项
group
作者
3 位作者
sell
研究子方向
生成式AI(文本、图像、音乐、视频)、大语言模型(LLM)的人机协作、AI 辅助决策与自动化系统
work
职业/产业
自动驾驶工程师与测试员、软件工程师与开发者、AI/ML 研究员与工程师
article
内容状态
仅摘要
hub
相关论文
10 篇相关论文