评估个性化价值对齐在人形机器人交互中的影响:信任与团队绩效成果的洞察

大语言模型(LLM)的人机协作社交机器人交互人-机器人协作(HRC)

本文研究了机器人实时个性化对齐其奖励函数与人类价值观对信任和团队绩效的影响。我们提出并比较了三种不同的机器人交互策略:非学习者策略(机器人假设人类的奖励函数与其自身相同);非适应性学习者策略(机器人学习人类的奖励函数用于信任估计和人类行为建模,但仍优化自身的奖励函数);适应性学习者策略(机器人学习人类的奖励函数并将其作为自己的奖励函数)。我们进行了两项人类受试者实验,共有54名参与者。在两个实验中,人机团队在城镇中搜索潜在威胁。团队依次经过搜索地点寻找威胁。我们将人与机器人之间的交互建模为信任感知的马尔可夫决策过程(信任感知MDP),并使用贝叶斯逆强化学习(IRL)来估计人类在与机器人交互过程中的奖励权重。在实验1中,我们使用人类价值观/目标的先验信息启动学习算法。在实验2中,我们使用无信息的先验启动学习算法。结果表明,当从良好的信息先验开始时,个性化适应价值观似乎不会使信任或团队绩效受益。另一方面,当信息先验不可用时,适应人类价值观会导致更高的信任和更高的感知绩效,同时保持相同的客观团队绩效。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/hri/140139/2024

广告推荐

学习 AI 编程到 CodeNow

一眼看懂

论文快照

fact_check
dataset
来源
HRI
calendar_month
年份
2024
emoji_events
奖项
未标记奖项
group
作者
4 位作者
sell
研究子方向
大语言模型(LLM)的人机协作、社交机器人交互、人-机器人协作(HRC)
work
职业/产业
—
article
内容状态
仅摘要
hub
相关论文
9 篇相关论文