人机协同机器训练界面设计指南的探索

大语言模型(LLM)的人机协作可解释人工智能(XAI)AI 辅助决策与自动化系统计算方法在HCI中的应用软件工程师与开发者AI/ML 研究员与工程师HCI 研究员统计学家与数据科学家

文献标题

Towards Guidelines for Designing Human-in-the-Loop Machine Training Interfaces

文献信息

  • 主题领域: 人机交互、交互式机器学习、人工智能系统设计
  • 关键词: 人机互动, 机器学习, 标签数据, 算法训练, 用户界面, 用户体验, UX 评估

研究背景与问题

  • 作者发现了哪些问题或挑战?

    1. 交互式机器学习(Interactive Machine Learning, IML)中的“人为介入”环节对训练过程的可扩展性构成瓶颈。仅依靠人类的标签工作可能难以满足大规模数据集需求且易受疲劳和标签质量问题影响。
    2. 缺乏专门用于设计IML系统交互界面的设计指南,尤其在如何平衡用户代理(agency)、交互负担和模型高效学习的方面。
    3. 许多现有的界面未能很好地支持用户的代理能力,或者提供的选择不够直观,从而导致用户挫败感。
  • 为什么这个问题很重要? 为互动机器学习设计有效的用户界面可以提高系统的可用性、降低人为标签的负担,并优化机器学习系统的性能。能够平衡用户代理和学习效率的系统设计对于实际工业应用、可持续体验和降低训练成本至关重要。

  • 研究动机与相关工作

    1. 传统机器学习系统难以调试且可能产生偏差、不相关或冒犯性的结果。
    2. 现有研究(如Fails和Olsen等[7])探讨了如何通过交互式机器学习让用户直接参与训练,但缺乏系统性的交互设计指南。
    3. 透明性与上下文适应性等问题已被多个研究(Kulesza等[13][15],Amershi等[1])发现为用户常见痛点,鼓励开发更好的设计标准。

解决方案

  • 作者提出了哪些方法或解决方案? 本研究设计了一个实验,使用四种不同的“人类参与机器学习训练”的界面变体,让用户通过它们训练推荐系统,并基于交互速度、用户体验和效率参数对这些界面进行比较评估。

  • 该解决方案的创新之处是什么?

    1. 提出了IMLIQ评分方法(Interactive Machine Learning Interaction Quality),一种结合用户体验与系统学习效率的综合评价分数。
    2. 初步提出了设计交互式学习界面的指导原则,以优化用户体验与效率之间的平衡。
  • 实施步骤是什么?使用了哪些关键技术?

    1. 实验设计:
      • 参与者与4种不同的推荐系统界面交互,完成推荐特定目标物品(红色椅子)的任务。
      • 收集用户的交互数据(如完成任务的交互次数与时间)和主观问卷评价(NASA-TLX评估用户负担)。
    2. 界面变体描述:
      • 界面1: 二分类标签任务,用户选择“喜欢”或“不喜欢”特定物品。
      • 界面2: 类似界面1,但允许用户临时关闭特定特征(例如颜色或风格)的影响。
      • 界面3: 比较式选择,用户从3项物品中选择接近目标的一个。
      • 界面4: 在用户选择后,系统询问具体选择动机。
    3. 评价指标:
      • 效率: 记录完成任务的交互次数与时间。
      • 用户体验: 使用NASA-TLX收集心理、身体、时间负担等主观评分,并额外调查交互性与趣味性。

研究成果

  • 取得了哪些具体成果?

    1. 用户更偏好交互设计更加灵活、表达能力较高的界面(界面2和3获得最多偏好票)。
    2. 用户倾向于选择不具备“不可逆性”或重复性任务感的界面,这些界面被视为更高效且更愉快。
    3. 通过比较四种界面的交互性能,得出了设计交互式学习界面的初步设计准则。
  • 与现有解决方案相比,它有哪些优势? 提议的设计准则与IMLIQ评分模型能够更直观地结合用户体验和系统性能,为人机交互与机器学习界面的整合提供了新的研究视角。

  • 实验或评估结果是什么?

    • 用户偏好分布: 界面2和3获得最多用户票选(各占6票);界面1获得2票,界面4仅获1票。
    • 性能对比: 在IMLIQ模型评分中,界面3得分最高(8.2分),而界面4分数最低(-1.5分)。
界面平均交互次数努力评分 (1-10)交互性评分 (1-10)趣味性评分 (1-10)
界面16.02.44.54.9
界面25.02.36.66.1
界面35.02.66.06.6
界面46.03.25.74.7
  • 局限性与未来方向:
    1. 当前实验样本量有限,参与者背景较为单一(高等教育背景),可能导致结果偏向于理解ML系统的用户。
    2. 测试场景较简单,与真实工业应用场景可能存在偏差。
    3. 提出的IMLIQ评分方法需要进一步大规模实验验证,特别是针对主观得分部分的经验权重建立。

总结

交互式机器学习系统的界面设计需要在用户体验与系统效率之间寻求平衡。本研究展示了人类代理训练系统设计中的关键问题,并以实验方式探讨了不同界面的适用性,提出了四条设计指导原则以及IMLIQ评分方法,作为未来研究与设计的参考框架。这为HCI与机器学习领域的交叉研究提供了新思路,未来可通过更复杂的场景与更广泛的用户群体验证这些初步成果。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/iui/57994/2021

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3397481.3450668
一眼看懂

论文快照

fact_check
dataset
来源
IUI
calendar_month
年份
2021
emoji_events
奖项
未标记奖项
group
作者
2 位作者
sell
研究子方向
大语言模型(LLM)的人机协作、可解释人工智能(XAI)、AI 辅助决策与自动化系统、计算方法在HCI中的应用
work
职业/产业
软件工程师与开发者、AI/ML 研究员与工程师、HCI 研究员、统计学家与数据科学家
article
内容状态
已索引正文
hub
相关论文
10 篇相关论文