用用户输入建模人类反馈的变异性:一项探索性方法论

AI 辅助决策与自动化系统心理健康应用与在线支持社区AI/ML 研究员与工程师HCI 研究员

为加速交互式强化学习(IntRL)算法的开发,先前工作常使用完美的Oracle作为模拟人类教师来提供反馈信号。这些Oracle通常源自真实知识或最优策略,在没有延迟的情况下向机器人学习者提供密集且无错误的反馈。然而,这种机器式反馈行为无法准确代表人类反馈的多样模式,可能导致真实人机交互中算法性能不稳定或出现意外。为缓解Oracle过度简化用户行为的这一局限性,我们提出一种可应用于标准Oracle的人类反馈变异性建模方法。我们提出了一个五维模型,包含先前工作中识别的五个反馈变异性维度。该模型能够修改完美Oracle的反馈输出,引入更多类似人类的特征。我们通过仿真实验展示每个模型属性如何影响IntRL算法的学习性能。我们还进行了概念验证研究,以两种方式说明如何从人群中获取模型数据。建模结果直观呈现了参与者的反馈变异性,有助于解释Oracle与人类教师之间的不匹配。总体而言,我们的方法是结合真实用户洞察改进模拟Oracle的有前景的一步。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/hri/140090/2024

广告推荐

学习 AI 编程到 CodeNow

一眼看懂

论文快照

fact_check
dataset
来源
HRI
calendar_month
年份
2024
emoji_events
奖项
未标记奖项
group
作者
3 位作者
sell
研究子方向
AI 辅助决策与自动化系统、心理健康应用与在线支持社区
work
职业/产业
AI/ML 研究员与工程师、HCI 研究员
article
内容状态
仅摘要
hub
相关论文
10 篇相关论文