重新发现可能性:强化学习的视角
作者
人体姿态与行为识别
文献标题
Rediscovering Affordance: A Reinforcement Learning Perspective
文献信息
- 主题领域: 人机交互 (HCI)、强化学习 (Reinforcement Learning)、感知与动作
- 关键词: Affordance, Reinforcement Learning, Perception, Action, Interaction, Robotics, Machine Learning, Adaptation, Motion Planning, HCI
研究背景与问题
-
发现的问题或挑战:
- 现有的关于“Affordance”(可供性)的理论无法清晰解释其形成的机制,即人类如何通过交互发现并适应不同对象的可供性。
- 既有理论(例如生态学视角和认知学视角)无法同时解释人类在观察、学习和适应新对象或界面中的相关过程。
- 缺乏统一的理论来描述可供性的学习和适应过程。
-
问题重要性:
- 可供性是人机交互(HCI)领域中的核心概念,广泛应用于设计规范。然而,人类如何对新物体形成正确的交互认知对设计直观且可用的界面至关重要。
- 虽已有深度学习等方法应用于物体探测,但它们仍未解释如何“动态学习与适应”交互。
-
研究动机与相关工作:
- 作者希望通过强化学习(Reinforcement Learning,RL)的理论,为可供性形成提出一个系统框架。
- 此研究借鉴了心理学、计算机视觉与强化学习的相关工作,但致力于整合这些方法以解释可供性感知的动态形成与适应。
解决方案
-
提出的方法或解决方案:
- 作者提出了一种基于强化学习的“可供性形成理论”:用户通过探索环境中的交互信号(例如成功/失败反馈),学习将可能的运动与对应的感知特征相关联。
- 提出两种认知过程:1) 行为动作与感知信号的效用关联;2) 对交互动作类别的归纳与命名。
- 构建了一个虚拟机器人模型,模拟人类在未见过的交互部件(widgets)上的可供性学习过程。
-
创新之处:
- 整合心理学中的“生态视角”与“认知分类视角”,以及机器学习中的强化学习理论,以提供一个生物学可信且泛用性强的动态可供性学习框架。
- 使用计算机仿真验证理论,将理论扩展为可用于模拟与实践的计算模型。
- 提出并实验验证了在强化学习中“运动规划”(motion planning)作为可供性发现与适应的关键机制。
-
实施步骤及关键技术:
- 用户研究: 通过两个用户实验研究人类如何感知与适应交互部件的可供性:
- 实验1:考察不同认知机制如何影响交互可供性的形成。
- 实验2:研究当交互部件行为意外时,人类如何通过反馈信号调整认知。
- 机器人仿真模型:
- 开发一个虚拟机器人,使用强化学习算法(如Proximal Policy Optimization, PPO)训练机器人与不同类型的交互部件(按钮、滑块、欺骗性部件)交互。
- 分别评估机器人在常见部件和新部件(“欺骗性”部件)中的适应性表现。
- 强化学习建模:
- 将任务建模为马尔科夫决策过程(MDP),允许机器人通过试错过程学习最佳的交互策略。
- 实现动作分类器以从学习的运动中正确标记为具体动作类型(如“按下”或“滑动”)。
- 用户研究: 通过两个用户实验研究人类如何感知与适应交互部件的可供性:
研究成果
-
具体成果:
- 用户实验的定量与定性数据表明:在交互中,人类能够灵活切换“特征比较”、“识别”和“运动规划”三种机制进行可供性学习和适应。
- 虚拟机器人模型成功演示了利用强化学习,对常见部件和“欺骗性部件”的交互学习与适应。
-
与现有解决方案相比的优势:
- 提供了迄今为止第一个对可供性学习详细建模的理论框架,以强化学习为指导,解释用户如何从“直接交互”中学会与新界面交互。
- 针对已有深度学习模型机械地分类交互对象的缺陷,提供了通过“不断试探与调整”的动态学习观点。
- 提供了生成性计算模型,这在过去的可供性研究中较为稀缺。
-
实验与评估结果:
- 用户研究表明,运动规划(motion planning)在初次失败后的行为调整中起关键作用,尤其是在人类逐渐适应“陌生”或“误导性”设计的过程中。
- 虚拟机器人在逐步学习后,能够以91.3%的成功率完成按钮交互,94.5%的成功率完成滑块交互;在“欺骗性部件”中,尽管早期表现较差,但成功适应并达成与人类类似的调整趋势。
-
局限性与未来方向:
- 局限性:
- 虽然模型具有与人类相似的学习趋势,但其适应效率远低于人类。
- 当前模型主要依赖运动规划(motion planning),未同时整合所有三种机制(如特征比较、识别)。
- 未来方向:
- 在模型中引入更先进的技术,如元学习(meta-learning),以提高机器人在必要交互样本数较低下的学习效率。
- 开发更加全面的模型,将特征比较与识别机制整合到单一框架中。
- 基于当前模型,设计一个计算工具用于预测新界面设计的可供性——例如分析是否某界面设计对于目标用户群“直观易用”。
- 局限性:
补充信息
- 开放科学数据:
- 致谢:
- 研究得到了Aalto大学通信与网络系、芬兰人工智能中心、以及相关基金项目资助。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
help
研究问题
3- 人类是如何通过交互动态学习和适应新对象或界面的可供性(affordance)的?分类: 决策优化与强化学习理解同类问题arrow_forward
- 生态视角和认知分类视角如何与强化学习理论结合,以解释可供性的形成过程?分类: 决策优化与强化学习理解同类问题arrow_forward
- 强化学习能否模拟人类在面对“误导性”界面组件时的适应过程,并以人类类似方式调整行为?分类: 决策优化与强化学习理解同类问题arrow_forward
lightbulb
现实痛点
1- 用户在首次使用新界面或误导性设计时,难以直观了解可用功能。分类: 决策优化与强化学习理解同类问题arrow_forward
- 100%
有效的自监督人体活动识别到底需要多少未标注数据?
UbiComp '23· 人体姿态与行为识别
- 100%
虚拟身体加速度数据在细粒度人类活动识别中的效用研究
UbiComp '23· 人体姿态与行为识别
- 100%
MI-Poser:使用磁性和惯性传感器融合结合金属干扰缓解的人体姿态跟踪
UbiComp '23· 人体姿态与行为识别
- 100%
MMTSA:用于高效人类活动识别的多模态时序片段注意力网络
UbiComp '23· 人体姿态与行为识别
- 100%
SF-Adapter:用于人体活动识别的计算高效无源域自适应
UbiComp '24· 人体姿态与行为识别
- 100%
PmTrack:实现个性化毫米波人体追踪
UbiComp '24· 人体姿态与行为识别
- 100%
XRF55:用于室内人体动作分析的射频数据集
UbiComp '24· 人体姿态与行为识别
- 100%
语义损失:一种用于上下文感知人体活动识别的新型神经符号方法
UbiComp '24· 人体姿态与行为识别
- 100%
TS2ACT:基于跨模态协同学习的少样本人体活动感知
UbiComp '24· 人体姿态与行为识别
- 100%
IMUGPT 2.0:基于语言模型的传感器人体活动识别跨模态迁移学习
UbiComp '24· 人体姿态与行为识别
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)
快捷操作
广告推荐
学习 AI 编程到 CodeNow
open_in_new打开DOI链接
DOI: https://dl.acm.org/doi/abs/10.1145/3491102.3501992
一眼看懂
fact_check论文快照
dataset
来源
CHI
calendar_month
年份
2022
emoji_events
奖项
未标记奖项
group
作者
6 位作者
sell
研究子方向
人体姿态与行为识别
work
职业/产业
—
article
内容状态
已索引正文
hub
相关论文
10 篇相关论文