从设计师反馈改进用户界面生成模型

大语言模型(LLM)的人机协作原型设计与用户测试360° 视频与全景内容UI/UX 设计师AI/ML 研究员与工程师HCI 研究员

文献标题

Improving User Interface Generation Models from Designer Feedback

出版信息

  • 主题领域: 利用设计师反馈和机器学习提升用户界面生成模型。
  • 关键词: 用户界面生成、设计师反馈、RLHF、草图绘制、评论、修订、偏好对、LLM微调、奖励模型、人机交互。

背景与问题

  • 问题/挑战: 当前的大型语言模型(LLMs)在生成设计良好的用户界面时表现不佳,原因是训练数据集中缺乏隐性设计知识。现有的人类反馈强化学习(RLHF)方法,如排序和评分,存在噪声且与设计师的工作流程不匹配。
  • 重要性: 提升用户界面生成模型可以使用户界面设计过程更加高效和高质量,从而惠及设计师和终端用户。
  • 动机与相关工作: 之前的研究探讨了基于评分标准的评分、排序以及注释界面来收集反馈,但这些方法通常导致评分者之间的一致性较低,且未能捕捉到细致的设计专业知识。本论文基于设计师的工作流程(如评论、草图绘制、修订)提出了一种更有效的反馈收集和模型训练方法。

解决方案

  • 提出的方法: 一个与设计师工作流程相匹配的反馈收集和模型训练管道,结合评论、草图绘制和修订工作流程,生成高质量的偏好数据以提升用户界面生成模型。
  • 创新点:
    1. 将设计师的评论、草图和修订转化为机器可学习的偏好对技术。
    2. 包含1,460个用户界面屏幕的设计师反馈数据集,与传统排序方法相比,分歧显著减少。
    3. 通过微调模型验证方法有效性,展示了相较于基线模型(包括GPT-5)的性能提升。
  • 流程与关键技术:
    • 使用基础LLM(Qwen2.5-Coder 32B)生成合成用户界面描述及对应代码。
    • 通过四种界面收集设计师反馈:排序、评论、草图绘制和修订。
    • 使用自动化管道将反馈转化为偏好对。
    • 使用基于边际对比损失的奖励模型进行训练,并通过ORPO优化微调生成器模型。

结果

  • 具体发现:
    • 使用草图和修订反馈微调的模型优于使用排序或评论数据训练的模型。
    • 表现最佳的模型(Qwen3-Coder + Sketch)在人类评判的用户界面质量上超过了GPT-5。
    • 设计师反馈与人机交互专家的61.7%一致率,其中基于修订的反馈一致率最高(76.1%)。
  • 相较基线的优势:
    • 使用草图训练的模型在数据质量和数量之间达到了最佳平衡。
    • 通过设计师反馈微调,小型模型的表现超过了大型专有模型如GPT-5。
  • 实验/评估:
    • 设计师反馈研究中,21名参与者生成了1,460条注释。
    • 通过六位人机交互专家的竞技场式评估,使用Elo评分和胜率比较模型。
    • 泛化评估显示在多个基础模型上均有一致的性能提升。
  • 局限性与未来工作:
    • 仅限于短期设计师研究和合成用户界面的验证。
    • 需要更广泛的评估,包括专业设计和更大规模的参与者群体。
    • 有机会探索其他反馈类型(如可用性研究)并调整模型以适应交互式用户体验评估。

总结

本文提出了一种与设计师工作流程相匹配的方法,通过利用评论、草图绘制和修订等反馈工作流来提升用户界面生成模型。生成的数据集和微调后的模型显著优于传统基于排序的方法,并超越了当前最先进的专有模型如GPT-5。研究结果强调了高质量、领域特定反馈在模型训练中的重要性,并为将更广泛的设计专业知识整合到机器学习工作流中指明了未来方向。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/chi/223499/2026

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3772318.3791567
一眼看懂

论文快照

fact_check
dataset
来源
CHI
calendar_month
年份
2026
emoji_events
奖项
未标记奖项
group
作者
6 位作者
sell
研究子方向
大语言模型(LLM)的人机协作、原型设计与用户测试、360° 视频与全景内容
work
职业/产业
UI/UX 设计师、AI/ML 研究员与工程师、HCI 研究员
article
内容状态
已索引正文
hub
相关论文
10 篇相关论文