人机协同机器训练界面设计指南的探索
文献标题
Towards Guidelines for Designing Human-in-the-Loop Machine Training Interfaces
文献信息
- 主题领域: 人机交互、交互式机器学习、人工智能系统设计
- 关键词: 人机互动, 机器学习, 标签数据, 算法训练, 用户界面, 用户体验, UX 评估
研究背景与问题
-
作者发现了哪些问题或挑战?
- 交互式机器学习(Interactive Machine Learning, IML)中的“人为介入”环节对训练过程的可扩展性构成瓶颈。仅依靠人类的标签工作可能难以满足大规模数据集需求且易受疲劳和标签质量问题影响。
- 缺乏专门用于设计IML系统交互界面的设计指南,尤其在如何平衡用户代理(agency)、交互负担和模型高效学习的方面。
- 许多现有的界面未能很好地支持用户的代理能力,或者提供的选择不够直观,从而导致用户挫败感。
-
为什么这个问题很重要? 为互动机器学习设计有效的用户界面可以提高系统的可用性、降低人为标签的负担,并优化机器学习系统的性能。能够平衡用户代理和学习效率的系统设计对于实际工业应用、可持续体验和降低训练成本至关重要。
-
研究动机与相关工作
- 传统机器学习系统难以调试且可能产生偏差、不相关或冒犯性的结果。
- 现有研究(如Fails和Olsen等[7])探讨了如何通过交互式机器学习让用户直接参与训练,但缺乏系统性的交互设计指南。
- 透明性与上下文适应性等问题已被多个研究(Kulesza等[13][15],Amershi等[1])发现为用户常见痛点,鼓励开发更好的设计标准。
解决方案
-
作者提出了哪些方法或解决方案? 本研究设计了一个实验,使用四种不同的“人类参与机器学习训练”的界面变体,让用户通过它们训练推荐系统,并基于交互速度、用户体验和效率参数对这些界面进行比较评估。
-
该解决方案的创新之处是什么?
- 提出了IMLIQ评分方法(Interactive Machine Learning Interaction Quality),一种结合用户体验与系统学习效率的综合评价分数。
- 初步提出了设计交互式学习界面的指导原则,以优化用户体验与效率之间的平衡。
-
实施步骤是什么?使用了哪些关键技术?
- 实验设计:
- 参与者与4种不同的推荐系统界面交互,完成推荐特定目标物品(红色椅子)的任务。
- 收集用户的交互数据(如完成任务的交互次数与时间)和主观问卷评价(NASA-TLX评估用户负担)。
- 界面变体描述:
- 界面1: 二分类标签任务,用户选择“喜欢”或“不喜欢”特定物品。
- 界面2: 类似界面1,但允许用户临时关闭特定特征(例如颜色或风格)的影响。
- 界面3: 比较式选择,用户从3项物品中选择接近目标的一个。
- 界面4: 在用户选择后,系统询问具体选择动机。
- 评价指标:
- 效率: 记录完成任务的交互次数与时间。
- 用户体验: 使用NASA-TLX收集心理、身体、时间负担等主观评分,并额外调查交互性与趣味性。
- 实验设计:
研究成果
-
取得了哪些具体成果?
- 用户更偏好交互设计更加灵活、表达能力较高的界面(界面2和3获得最多偏好票)。
- 用户倾向于选择不具备“不可逆性”或重复性任务感的界面,这些界面被视为更高效且更愉快。
- 通过比较四种界面的交互性能,得出了设计交互式学习界面的初步设计准则。
-
与现有解决方案相比,它有哪些优势? 提议的设计准则与IMLIQ评分模型能够更直观地结合用户体验和系统性能,为人机交互与机器学习界面的整合提供了新的研究视角。
-
实验或评估结果是什么?
- 用户偏好分布: 界面2和3获得最多用户票选(各占6票);界面1获得2票,界面4仅获1票。
- 性能对比: 在IMLIQ模型评分中,界面3得分最高(8.2分),而界面4分数最低(-1.5分)。
| 界面 | 平均交互次数 | 努力评分 (1-10) | 交互性评分 (1-10) | 趣味性评分 (1-10) |
|---|---|---|---|---|
| 界面1 | 6.0 | 2.4 | 4.5 | 4.9 |
| 界面2 | 5.0 | 2.3 | 6.6 | 6.1 |
| 界面3 | 5.0 | 2.6 | 6.0 | 6.6 |
| 界面4 | 6.0 | 3.2 | 5.7 | 4.7 |
- 局限性与未来方向:
- 当前实验样本量有限,参与者背景较为单一(高等教育背景),可能导致结果偏向于理解ML系统的用户。
- 测试场景较简单,与真实工业应用场景可能存在偏差。
- 提出的IMLIQ评分方法需要进一步大规模实验验证,特别是针对主观得分部分的经验权重建立。
总结
交互式机器学习系统的界面设计需要在用户体验与系统效率之间寻求平衡。本研究展示了人类代理训练系统设计中的关键问题,并以实验方式探讨了不同界面的适用性,提出了四条设计指导原则以及IMLIQ评分方法,作为未来研究与设计的参考框架。这为HCI与机器学习领域的交叉研究提供了新思路,未来可通过更复杂的场景与更广泛的用户群体验证这些初步成果。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
研究问题
3- 如何设计交互式机器学习中的界面以实现用户体验和系统效率的平衡?分类: 编程、计算与物理原型教育同类问题arrow_forward
- 不同类型的“人机互动”界面在机器学习训练中的效率和用户体验表现如何?分类: 编程、计算与物理原型教育同类问题arrow_forward
- 交互式机器学习系统需要哪些设计指南以优化用户主导性和操作负担?分类: 编程、计算与物理原型教育同类问题arrow_forward
现实痛点
1- 用户在训练机器学习系统时面临任务冗余、负担重且效率低下的问题。分类: 编程、计算与物理原型教育同类问题arrow_forward
- 88%
DiLLS:基于智能体行为分层摘要的LLM多智能体系统交互式诊断
CHI '26· 大语言模型(LLM)的人机协作 +3
- 75%
PaTAT:具有可解释交互规则合成的人工智能协作定性编码
CHI '23· 可解释人工智能(XAI) +2
- 75%
故障还是就绪?在部署之前处理深度学习计算机视觉模型中的故障:一项关于实践、挑战和需求的研究
CHI '23· 可解释人工智能(XAI) +2
- 75%
看不见的破坏者:谄媚型大语言模型在问题解决任务中误导新手
CHI '26· 大语言模型(LLM)的人机协作 +2
- 75%
响应延迟和任务类型对人类-LLM 交互与感知的影响
CHI '26· 大语言模型(LLM)的人机协作 +2
- 75%
与我共编还是为我编程?AI 自动化程度提升如何改变开发者工作流
CHI '26· 大语言模型(LLM)的人机协作 +2
- 75%
Unakite:利用 Web 支持开发者的决策制定
UIST '19· 可解释人工智能(XAI) +2
- 67%
当帮助变成伤害:AI编码助手的验证负荷与疲劳
CHI '26· 大语言模型(LLM)的人机协作 +3
- 63%
理解准确性对机器学习模型信任的影响
CHI '19· 可解释人工智能(XAI) +1
- 63%
自动化精度很重要,但高可控性可能更好
CHI '19· 可解释人工智能(XAI) +1
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)