PREDILECT:基于零样本语言推理的强化学习偏好提取方法
生成式AI(文本、图像、音乐、视频)大语言模型(LLM)的人机协作AI 辅助决策与自动化系统自动驾驶工程师与测试员软件工程师与开发者AI/ML 研究员与工程师
偏好强化学习(RL)已成为机器人学习的新兴领域,人类通过表达对不同状态-动作对序列的偏好在塑造机器人行为方面发挥关键作用。然而,为机器人制定现实策略需要人类对大量查询做出响应。本研究通过扩展每条查询收集的信息(包含偏好和可选文本提示)来解决样本效率挑战。为此,我们利用大型语言模型(LLM)的零样本能力对人类提供的文本进行推理。为适应额外的查询信息,我们重新制定奖励学习目标,包含灵活的高亮信息——即包含相对较高信息量且与预训练LLM零样本处理相关特征的状态-动作对。我们在模拟场景和用户研究中通过分析反馈及其含义证明了本工作的有效性。此外,收集的反馈还可用于训练机器人在模拟社交导航场景中执行符合社会规范的轨迹。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
当前问题库还没有收录这篇论文的问题与痛点。
- 83%
GenComUI:探索生成式视觉辅助作为支持任务导向人机通信的媒介
CHI '25· 生成式AI(文本、图像、音乐、视频) +2
- 83%
专业能力的新表现:软件工程师使用AI编码助手评估和展示编码专长
CHI '26· 大语言模型(LLM)的人机协作 +2
- 83%
从初级到高级:代理AI介导的软件工程中分配代理与导航职业成长
CHI '26· 大语言模型(LLM)的人机协作 +2
- 83%
开发者与主动式AI的交互模式:一项为期五天的实地研究
IUI '26· AI 辅助决策与自动化系统 +2
- 71%
氛围编程的纠缠——重新定位生成式 AI 编程中意图、作者身份与责任的边界
CHI '26· 生成式AI(文本、图像、音乐、视频) +2
- 71%
Gemini 在工作场所:知识工作者对生产力提升的感知与评估
DIS '25· 生成式AI(文本、图像、音乐、视频) +3
- 71%
GPTVoiceTasker:通过动态界面探索与学习提升多步骤移动任务效率
UIST '24· 生成式AI(文本、图像、音乐、视频) +2
- 71%
探索利用大型语言模型实现乘客与自动驾驶车辆的自然交互谈判
AutoUI '24· 自动驾驶界面与接管设计 +2
- 67%
使用生成语言模型发现自然语言编程的语法和策略
CHI '22· 生成式AI(文本、图像、音乐、视频) +1
- 67%
在人工智能中介沟通中比较句子层面的建议和消息层面的建议
CHI '23· 大语言模型(LLM)的人机协作 +1
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)
快捷操作
一眼看懂
fact_check论文快照
dataset
来源
HRI
calendar_month
年份
2024
emoji_events
奖项
未标记奖项
group
作者
3 位作者
sell
研究子方向
生成式AI(文本、图像、音乐、视频)、大语言模型(LLM)的人机协作、AI 辅助决策与自动化系统
work
职业/产业
自动驾驶工程师与测试员、软件工程师与开发者、AI/ML 研究员与工程师
article
内容状态
仅摘要
hub
相关论文
10 篇相关论文