AI仪器:将提示作为工具来抽象和反映图形界面命令作为通用工具

荣誉提名
生成式AI(文本、图像、音乐、视频)大语言模型(LLM)的人机协作UI/UX 设计师AI/ML 研究员与工程师

研究背景与问题

  • 发现问题与挑战: 作者指出,现有基于聊天的生成式AI接口存在几个核心挑战:边界式对话限制了用户表达和精炼模糊意图的能力,难以支持探索多种选择或快速迭代。用户在描述复杂目标时无法完全清晰表达意图,且必须通过反复试验改进工作流程。这种线性工作流程限制了非线性创意活动,且用户难以了解AI的潜能及其应对的可能结果。
  • 问题重要性: 随着生成式AI在创意设计中的普及,提升用户表达意图的能力、构建多样化结果和非线性工作流程已成为解决用户痛点的一项关键需求。
  • 研究动机与相关工作: 过去的研究试图通过多模态交互、丰富的用户界面等逐步解决部分问题,但未能全面应对意图表达、分歧、引导和探索等复杂行为的需求。作者通过吸收交互设计理论(如工具交互模型)提出新的方法,以适应生成式AI应用场景。

解决方案

  • 提出的解决方案: 作者提出AI-Instruments,将“提示”作为界面对象,基于三个核心原则:意图的具体化(Reification)、反思(Reflection)和基于示例的落地(Grounding)。这些工具设计为图形化交互对象,支持非线性和直接操作工作流程。
  • 创新之处:
    • 意图具体化: 将用户意图转化为可交互的图形界面对象,从而支持复用和直接操作。
    • 反思原则: 支持用户不仅能探索多种可能的结果(反思响应),还能探索不同意图表达方式(反思意图)。
    • 落地原则: 用户可从示例内容或其他工具中提取和应用特定属性,例如视觉风格或内容细节。
  • 实施步骤及关键技术:
    • 工具实例: 提供四种技术探针:碎片(Fragments)、生成容器(Generative Containers)、变换透镜(Transformative Lenses)和填充画笔(Fillable Brushes)。
    • 技术实现: 使用生成式语言和视觉模型(如GPT-4o和Stable Diffusion),生成和组合多种交互方式。
    • 工作流设计: 利用工具实现探索(如多样化生成)、微调(如对图像局部修改)及复杂内容合成等任务。

研究成果

  • 具体成果:
    • 技术探针功能展示: 作者开发了四种AI-Instruments实例,展示了新模型如何支持多任务,如组合内容、迭代修改、风格迁移及扩充内容。
    • 用户反馈: 在用户研究中,12名参与者普遍认为AI-Instruments有助于解决意图表达模糊、探索与结果引导等问题。在对比传统聊天界面时,这些工具更符合复杂创意工作需求。
  • 与现有方案相比的优势: AI-Instruments提供了更加灵活和易操作的界面,支持非线性和直接操作,提升了用户的探索能力、迭代效率及内容生成质量。例如,生成容器和碎片工具能帮助用户构建多种创意方向,而填充画笔支持精细内容调整。
  • 局限性与未来方向:
    • 局限性:
      • 一些用户反馈表明,GUI可能比文本提示界面操作更复杂,在简单任务中效率略低。
      • 工具生成可能导致界面过于复杂,需要进一步优化工具数量和层次结构。
    • 未来方向:
      • 将AI-Instruments扩展到多模态内容(如文本、音频或视频),并提升其对复杂项目(如多内容合成)的处理能力。
      • 进一步探索工具与聊天式交互的集成,以在需要精确控制和简单操作时提供更灵活的工作方式。
      • 改进版本控制和历史追踪,解决当前生成器工具非确定性输出可能带来的可追溯性问题。

通过此研究,作者为设计新一代生成式AI交互界面提供了理论支持和实践工具,为用户创造性内容生成和迭代工作注入了新的可能性。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/chi/188523/2025

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://dl.acm.org/doi/10.1145/3706598.3714259
一眼看懂

论文快照

fact_check
dataset
来源
CHI
calendar_month
年份
2025
emoji_events
奖项
荣誉提名
group
作者
9 位作者
sell
研究子方向
生成式AI(文本、图像、音乐、视频)、大语言模型(LLM)的人机协作
work
职业/产业
UI/UX 设计师、AI/ML 研究员与工程师
article
内容状态
已索引正文
hub
相关论文
10 篇相关论文