Criticmate:通过情境感知在UI设计中实现阶段性人机协同批评
大语言模型(LLM)的人机协作原型设计与用户测试移动应用用户体验UI/UX 设计师AI/ML 研究员与工程师HCI 研究员
文献标题
Criticmate: Stagewise Human–AI Co-Critique in Single-Screen UI Evaluation
出版信息
- 主题领域: 人机协作在用户界面评估中的应用
- 关键词: 用户界面评估, 启发式批评, 人机协作, 情境感知, 分阶段推理, 单屏评估, 人工智能透明性, 设计批评, 可用性检查, 协同批评
背景与问题
- 问题/挑战: 现有的人工智能工具在用户界面评估中通常采用单次处理的黑箱操作模式,这限制了人工智能的推理能力和人类的参与程度。这种方式导致反馈泛泛而谈,缺乏扎实的依据,并且使人类难以有效干预。
- 重要性: 改善人机协作在用户界面评估中的表现可以提高批评质量,减少认知负担,并在生命周期早期支持更好的设计决策。
- 动机与相关工作: 之前的研究探讨了启发式评估、可用性检查以及基于人工智能的用户界面批评工具,但这些方法通常缺乏结构化的推理,并未有效整合人类专业知识。本文基于情境感知(Situation Awareness, SA)理论来解决这些问题。
解决方案
- 提出的方法: Criticmate 是一种分阶段的人机协同批评系统,用于单屏用户界面评估,将评估过程分解为三个阶段:感知(Perception)、理解(Comprehension)和预测(Projection),并暴露中间推理产物供人类干预。
- 创新点:
- 将用户界面评估概念化为基于情境感知理论的分阶段过程。
- 实现 Criticmate,一个将分阶段协同批评操作化的交互系统。
- 通过离线基准测试和用户研究对分阶段协同批评进行实证验证。
- 为未来的人机协作评估工具提供设计启示。
- 流程与关键技术:
- 感知阶段: 人工智能解析用户界面为部分和组件,由人类验证和优化。
- 理解阶段: 人工智能描述视觉和功能特性,人类根据上下文和领域知识进行调整。
- 预测阶段: 人工智能与人类协作识别问题、提出修复建议,并根据具体任务和领域调整指导原则。
结果
- 具体发现:
- Criticmate 的分阶段流程在语义相似度方面优于专家批评(F1@0.5 = 0.646),相比单次处理基线(如 ZS: 0.465, FS: 0.508)。
- 它生成了更均衡的全局与局部批评(≈39% 局部评论 vs. <28% 基线)。
- 产生了更丰富的批评内容(Vendi Score: 整体批评 3.91,识别问题 6.07)。
- 相较基线的优势:
- Criticmate 在批评质量、用户参与度和信任度方面优于单次处理基线,得到了参与者和外部专家的高评价。
- 通过暴露中间推理阶段,提供了更具体、一致且可操作的反馈。
- 实验/评估:
- 使用 UICrit 数据集(1,000 个移动用户界面截图)进行离线评估,将 Criticmate 与单次处理基线及消融变体进行比较。
- 控制用户研究包括 26 名参与者(13 名专家,13 名中级用户),在真实批评工作流程中将 Criticmate 与单次处理基线进行比较。
- 评估指标包括语义相似度、全局与局部平衡、内容多样性和用户参与度。
- 局限性与未来工作:
- 仅限于单屏、启发式风格评估;未涉及多屏流程或纵向批评。
- 早期阶段的错误可能会传播;未来工作可改进识别准确性并整合视觉注释。
- 研究重点在专业设计师和中级用户;需进一步研究初学者和非设计相关利益者的使用情况。
总结
Criticmate 提出了一个基于情境感知理论的分阶段人机协同批评新范式,用于单屏用户界面评估。通过将评估过程结构化为感知、理解和预测三个阶段,它实现了透明、可编辑的推理,并支持有意义的人类干预。离线基准测试和用户研究表明,Criticmate 生成的批评更接近专家水平,更均衡且更具多样性,同时提升了用户的信任度和参与度。该研究突出了以过程为中心的人机协作在提高自动化评估质量和批评工具用户体验方面的潜力,并为未来扩展到多屏和跨设备场景提供了机会。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
当前问题库还没有收录这篇论文的问题与痛点。
- 71%
关于UX从业者在设计实际企业ML系统中的角色研究
CHI '22· 大语言模型(LLM)的人机协作 +2
- 71%
生成式AI应用程序的设计原则
CHI '24· 生成式AI(文本、图像、音乐、视频) +2
- 71%
基于反事实回放和混合Wizard-of-Oz的多模态生成式AI实时代理原型设计
CHI '26· 生成式AI(文本、图像、音乐、视频) +2
- 71%
通过多智能体推理实现用户界面的自动化优化
CHI '26· 大语言模型(LLM)的人机协作 +2
- 71%
交互增强指令:建模人-GenAI协作中提示与交互的协同作用
CHI '26· 生成式AI(文本、图像、音乐、视频) +2
- 71%
DuetUI:面向任务导向接口的人机协同生成双向上下文循环
CHI '26· 大语言模型(LLM)的人机协作 +2
- 71%
当设计师出汗时:GenAI协同创作的行为痕迹
CHI '26· 生成式AI(文本、图像、音乐、视频) +2
- 71%
Orality:用于通过语音外化和澄清思想的语义画布
CHI '26· 大语言模型(LLM)的人机协作 +2
- 71%
从设计师反馈改进用户界面生成模型
CHI '26· 大语言模型(LLM)的人机协作 +2
- 67%
从HCI研究中映射机器学习进展以揭示设计创新的起点
CHI '18· 大语言模型(LLM)的人机协作
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)
快捷操作
广告推荐
学习 AI 编程到 CodeNow
open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3772318.3790929
一眼看懂
fact_check论文快照
dataset
来源
CHI
calendar_month
年份
2026
emoji_events
奖项
未标记奖项
group
作者
5 位作者
sell
研究子方向
大语言模型(LLM)的人机协作、原型设计与用户测试、移动应用用户体验
work
职业/产业
UI/UX 设计师、AI/ML 研究员与工程师、HCI 研究员
article
内容状态
已索引正文
hub
相关论文
10 篇相关论文