评估交互原型时的新颖性偏见量化研究

荣誉提名
用户研究方法(访谈、调查、观察)原型设计与用户测试研究伦理与开放科学HCI 研究员认知科学家UI/UX 设计师

文献标题

Quantifying the Novelty Bias when Evaluating Interactive Prototypes

出版信息

  • 主题领域: 人机交互(HCI)评估与新颖性偏差。
  • 关键词: 新颖性效应、人机交互、主观评分、性能指标、技术成熟度、原型评估、安慰剂效应、用户研究、偏差量化、交互设计。

背景与问题

  • 问题/挑战: HCI评估通常依赖用户判断来评估新技术,但新颖性偏差——偏向被标记为“新”的事物——可能会扭曲这些判断,导致偏高的偏好和评分,而这些可能与实际性能不一致。
  • 重要性: 理解和量化新颖性偏差对于确保HCI评估的有效性至关重要,尤其是在设计决策和改进声明中具有指导意义时。
  • 动机与相关工作: 先前研究已承认HCI中的新颖性效应,但尚未量化其对主观评分和客观性能的影响。关于安慰剂效应和评估有效性的相关研究强调了将新颖性框架作为一种独特偏差力量进行隔离的必要性。

解决方案

  • 提出的方法: 通过一个受控实验研究,量化新颖性标签对主观偏好和客观性能的影响,涵盖四种技术类型:鼠标、键盘、搜索引擎和AI聊天机器人。
  • 创新点:
    1. 因果证明将功能相同的系统标记为“新”会改变偏好和主观评分。
    2. 显示这些感知变化可能超过或与客观性能指标不一致。
    3. 阐明技术成熟度(TR)在调节基础性能中的作用,但无法使判断免受新颖性偏差的影响。
  • 实验程序与关键技术:
    • 参与者与功能相同但仅在外观特征和“旧”/“新”标签上不同的技术对进行交互。
    • 任务包括指点、打字、搜索和聊天,测量性能(如吞吐量、错误率)和主观评分(如Likert量表)。
    • 广泛的平衡设计确保没有来自顺序效应或外观偏好的系统性偏差。
    • 统计模型分析试验级和参与者级结果,包括与TR的交互作用。

结果

  • 具体发现:
    • 高达77%的参与者更偏好“新”版本,主观评分对偏好的AI聊天机器人提升了11.6%,对“新”搜索引擎提升了7.1%。
    • 性能差异较小:“新”鼠标减少了9.7%的遗漏,“新”键盘的错误率降低了最多7.2%。
    • 吞吐量、移动时间、浏览时间和交换消息数量几乎没有变化。
  • 相较基线的优势: 新颖性标签持续改变了偏好和评分,但客观性能指标仅显示有限的改善,突出了感知与实际效益之间的不一致。
  • 实验/评估:
    • 样本量: 48名来自不同背景的参与者。
    • 测试技术: 鼠标、键盘、搜索引擎、AI聊天机器人。
    • 评估指标: 速度、准确性、主观评分和TR分数。
    • 统计方法: 混合效应模型、非参数检验和偏好二项检验。
  • 局限性与未来工作:
    • 结果集中于首次使用和结构化实验室环境;需要长期和现场研究来评估新颖性效应随时间的变化。
    • 操作依赖显性标签;未来工作可探索更微妙的新颖性线索。
    • 更广泛的技术类别和更高层次的任务(如协作、创造性工作)可能揭示对新颖性的不同敏感性。

总结

本研究量化了新颖性标签对主观偏好和客观性能的影响,涵盖四种技术类型。结果表明,新颖性框架显著影响偏好和主观评分,而对速度和准确性等性能指标的影响有限。技术成熟度预测了基础技能,但无法减轻新颖性偏差。这些发现突出了在HCI评估中分离真实改进与新颖性驱动的感知的方法学挑战。未来研究应探索长期效应、更微妙的新颖性线索以及更广泛的技术领域,以优化评估实践并确保关于系统质量的可靠结论。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/chi/222350/2026

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3772318.3791685
一眼看懂

论文快照

fact_check
dataset
来源
CHI
calendar_month
年份
2026
emoji_events
奖项
荣誉提名
group
作者
3 位作者
sell
研究子方向
用户研究方法(访谈、调查、观察)、原型设计与用户测试、研究伦理与开放科学
work
职业/产业
HCI 研究员、认知科学家、UI/UX 设计师
article
内容状态
已索引正文
hub
相关论文
10 篇相关论文