你同意吗?基于眼动数据建模人机交互中用户的隐性分歧
作者
眼动追踪与注视交互可解释人工智能(XAI)隐私设计与用户控制AI/ML 研究员与工程师HCI 研究员UI/UX 设计师
文献标题
Do You (Dis)agree With Me? Modelling Implicit User Disagreement in Human–AI Interaction Using Gaze Data
出版信息
- 主题领域: 基于注视和面部数据的人机交互中隐性分歧检测。
- 关键词: 人机交互,分歧检测,注视追踪,面部表情,机器学习,个性化模型,多模态分析,隐性反馈,认知-情感状态,数据集发布。
背景与问题
- 问题/挑战: 当前的人工智能系统缺乏隐性检测用户分歧的机制,而是依赖显性反馈,这可能会干扰交互并降低用户信任。通过注视和面部表情等被动信号检测分歧具有挑战性,因为这些信号通常表现为微妙且个性化的反应。
- 重要性: 隐性分歧检测可以通过实现自适应和非侵入式交互来增强人工智能系统的响应性和可信度,同时减少用户的认知负担。
- 动机与相关研究: 之前的研究已探讨了注视和面部数据在情感识别和认知状态监测等相关任务中的应用,但尚未专注于隐性分歧检测。本研究通过在一个受控的人机交互场景中研究注视和面部信号来填补这一空白。
解决方案
- 提出的方法: 基于机器学习框架,利用在图像字幕任务中收集的注视和面部数据检测用户隐性分歧。
- 创新点:
- 开发一个公开可用的注视和面部数据集,并附有二元同意/分歧标注。
- 探索个性化与通用化机器学习模型在分歧检测中的效果。
- 分析基于注视的特征选择和时间窗口选择对检测性能的影响。
- 流程与关键技术:
- 进行了一项包含30名参与者的受控用户研究,评估图像与字幕配对。
- 使用Tobii Pro Fusion眼动追踪器收集注视数据,使用Luxonis OAK-D摄像头收集面部数据。
- 提取基于注视的特征(如注视次数、扫视持续时间)和面部动作单元(AUs)。
- 使用经典机器学习算法比较个性化与通用化模型。
- 探讨特征子集和时间窗口选择对模型性能的影响。
结果
- 具体发现:
- 个性化的仅基于注视模型实现了68.40%的平衡准确率,优于通用化模型(57.00%)。
- 结合注视和面部数据的多模态模型未能提高性能,平衡准确率接近随机水平(≈51.75%)。
- 注视特征如注视次数、扫视动态和瞳孔直径变化是预测分歧最重要的指标。
- 时间窗口选择显示分歧相关信号通常集中在决策前的最后几秒。
- 相较基线的优势:
- 个性化模型的性能显著提高(平均准确率增加≈7.18%),优于通用化模型。
- 仅基于注视的模型优于多模态和仅基于面部的模型,突显了注视数据在分歧检测中的实用性。
- 实验/评估:
- 进行了基于群组和用户的5折交叉验证。
- 评估了特征子集(FA, FB, FPool)和时间窗口(全记录、最后11秒、最后3秒)的影响。
- 使用统计测试(如Wilcoxon符号秩检验)确认个性化配置的显著性。
- 局限性与未来工作:
- 数据集规模(30名参与者)限制了结果的普适性;结果具有探索性。
- 刺激较为微弱(单词级字幕错误)可能未能引发强烈的分歧信号。
- 面部数据由于中性表情和粗粒度特征处理贡献较少预测价值。
- 未来工作应探索更丰富的刺激、更大规模的数据集、多模态融合技术,以及实际部署中的伦理问题。
总结
本研究探讨了基于注视和面部数据的人机交互中隐性分歧检测。在图像字幕任务中收集了30名参与者的数据,并训练了机器学习模型以预测同意/分歧。个性化的仅基于注视模型实现了最高性能(68.40%的平衡准确率),而多模态和仅基于面部的模型表现较差。特征选择和时间窗口分析表明分歧信号高度个性化,且通常集中于决策点附近。研究结果突显了注视数据在自适应人工智能系统中的潜力,同时强调了实际部署所需的更丰富刺激、更大规模数据集和伦理考量。数据集和研究洞察已公开,以支持进一步研究。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
当前问题库还没有收录这篇论文的问题与痛点。
- 71%
注意差异:设计师和标准在用户算法系统透明度方面的设计
CHI '24· 可解释人工智能(XAI) +2
- 71%
多代理LLM接口中的意义建构:用户如何解读透明度和可信度线索
CHI '26· 大语言模型(LLM)的人机协作 +2
- 71%
AI委托中的信任形成:可解释性与拟人化的相互作用
CHI '26· 可解释人工智能(XAI) +2
- 71%
多少信任才足够?走向技术信任的校准
CHI '26· 可解释人工智能(XAI) +2
- 71%
当编解码器产生幻觉:用户对误压缩图像的感知
CHI '26· 可解释人工智能(XAI) +2
- 71%
用户驱动算法审计中的意义建构:图像字幕模型性别偏见的案例研究
CHI '26· 可解释人工智能(XAI) +2
- 71%
良好的可访问性,受限的创造力:AI生成的UI在可访问性指南与从业者期望之间
DIS '25· 可解释人工智能(XAI) +2
- 71%
通过智能虚拟代理的言语和非言语行为自然表达机器学习模型的不确定性
UIST '24· 眼动追踪与注视交互 +2
- 67%
不要只是告诉我,问我:将解释作为问题来智能构建的AI系统可以提高人类逻辑辨别准确性,超过因果AI解释
CHI '23· 可解释人工智能(XAI) +1
- 63%
跨LLM聊天机器人用户报告风险的表征分析
CHI '26· 大语言模型(LLM)的人机协作 +3
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)
快捷操作
广告推荐
学习 AI 编程到 CodeNow
open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3772318.3790594
一眼看懂
fact_check论文快照
dataset
来源
CHI
calendar_month
年份
2026
emoji_events
奖项
未标记奖项
group
作者
5 位作者
sell
研究子方向
眼动追踪与注视交互、可解释人工智能(XAI)、隐私设计与用户控制
work
职业/产业
AI/ML 研究员与工程师、HCI 研究员、UI/UX 设计师
article
内容状态
已索引正文
hub
相关论文
10 篇相关论文