AI仪器:将提示作为工具来抽象和反映图形界面命令作为通用工具
荣誉提名作者
生成式AI(文本、图像、音乐、视频)大语言模型(LLM)的人机协作UI/UX 设计师AI/ML 研究员与工程师
研究背景与问题
- 发现问题与挑战: 作者指出,现有基于聊天的生成式AI接口存在几个核心挑战:边界式对话限制了用户表达和精炼模糊意图的能力,难以支持探索多种选择或快速迭代。用户在描述复杂目标时无法完全清晰表达意图,且必须通过反复试验改进工作流程。这种线性工作流程限制了非线性创意活动,且用户难以了解AI的潜能及其应对的可能结果。
- 问题重要性: 随着生成式AI在创意设计中的普及,提升用户表达意图的能力、构建多样化结果和非线性工作流程已成为解决用户痛点的一项关键需求。
- 研究动机与相关工作: 过去的研究试图通过多模态交互、丰富的用户界面等逐步解决部分问题,但未能全面应对意图表达、分歧、引导和探索等复杂行为的需求。作者通过吸收交互设计理论(如工具交互模型)提出新的方法,以适应生成式AI应用场景。
解决方案
- 提出的解决方案: 作者提出AI-Instruments,将“提示”作为界面对象,基于三个核心原则:意图的具体化(Reification)、反思(Reflection)和基于示例的落地(Grounding)。这些工具设计为图形化交互对象,支持非线性和直接操作工作流程。
- 创新之处:
- 意图具体化: 将用户意图转化为可交互的图形界面对象,从而支持复用和直接操作。
- 反思原则: 支持用户不仅能探索多种可能的结果(反思响应),还能探索不同意图表达方式(反思意图)。
- 落地原则: 用户可从示例内容或其他工具中提取和应用特定属性,例如视觉风格或内容细节。
- 实施步骤及关键技术:
- 工具实例: 提供四种技术探针:碎片(Fragments)、生成容器(Generative Containers)、变换透镜(Transformative Lenses)和填充画笔(Fillable Brushes)。
- 技术实现: 使用生成式语言和视觉模型(如GPT-4o和Stable Diffusion),生成和组合多种交互方式。
- 工作流设计: 利用工具实现探索(如多样化生成)、微调(如对图像局部修改)及复杂内容合成等任务。
研究成果
- 具体成果:
- 技术探针功能展示: 作者开发了四种AI-Instruments实例,展示了新模型如何支持多任务,如组合内容、迭代修改、风格迁移及扩充内容。
- 用户反馈: 在用户研究中,12名参与者普遍认为AI-Instruments有助于解决意图表达模糊、探索与结果引导等问题。在对比传统聊天界面时,这些工具更符合复杂创意工作需求。
- 与现有方案相比的优势: AI-Instruments提供了更加灵活和易操作的界面,支持非线性和直接操作,提升了用户的探索能力、迭代效率及内容生成质量。例如,生成容器和碎片工具能帮助用户构建多种创意方向,而填充画笔支持精细内容调整。
- 局限性与未来方向:
- 局限性:
- 一些用户反馈表明,GUI可能比文本提示界面操作更复杂,在简单任务中效率略低。
- 工具生成可能导致界面过于复杂,需要进一步优化工具数量和层次结构。
- 未来方向:
- 将AI-Instruments扩展到多模态内容(如文本、音频或视频),并提升其对复杂项目(如多内容合成)的处理能力。
- 进一步探索工具与聊天式交互的集成,以在需要精确控制和简单操作时提供更灵活的工作方式。
- 改进版本控制和历史追踪,解决当前生成器工具非确定性输出可能带来的可追溯性问题。
- 局限性:
通过此研究,作者为设计新一代生成式AI交互界面提供了理论支持和实践工具,为用户创造性内容生成和迭代工作注入了新的可能性。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
help
研究问题
3- 如何设计一种生成式AI交互方式,使用户能够高效表达模糊意图并快速迭代?分类: 创作工作流与多阶段流程同类问题arrow_forward
- 生成式AI界面如何支持非线性创作工作流和多样化探索?分类: 创作工作流与多阶段流程同类问题arrow_forward
- 通过图形化工具如何增强用户对生成式AI潜能的理解?分类: 创作工作流与多阶段流程同类问题arrow_forward
lightbulb
现实痛点
1- 创作者难以清晰表达意图和快速探索多样的AI生成结果。分类: 创作工作流与多阶段流程同类问题arrow_forward
- 100%
IntentTuner:将人类意图整合到文本到图像生成模型微调中的交互框架
CHI '24· 生成式AI(文本、图像、音乐、视频) +1
- 80%
是AI还是我?理解用户使用文本到图像生成AI工具的提示旅程
CHI '24· 生成式AI(文本、图像、音乐、视频) +1
- 80%
MUD:面向大规模和噪声过滤的现代风格UI建模UI数据集
CHI '24· 生成式AI(文本、图像、音乐、视频) +1
- 80%
生成式AI的角色如何影响人机协作工作中价值感知
CHI '25· 生成式AI(文本、图像、音乐、视频) +1
- 80%
GANzilla:在生成对抗网络中实现用户驱动的方向发现
UIST '22· 生成式AI(文本、图像、音乐、视频) +1
- 75%
生成式人工智能的专业用户体验设计师的看法
CHI '24· 生成式AI(文本、图像、音乐、视频) +1
- 75%
单元、生成器与透镜:面向大型语言模型面向对象交互的设计框架
UIST '23· 大语言模型(LLM)的人机协作
- 75%
Patchview:基于生成式尘埃与磁铁可视化的大型语言模型驱动世界构建系统
UIST '24· 生成式AI(文本、图像、音乐、视频) +1
- 67%
阅读测验生成器:一种支持教师设计高质量阅读测验问题的人机协作系统
CHI '23· 生成式AI(文本、图像、音乐、视频) +2
- 67%
ReactGenie:使用大型语言模型开发复杂多模式交互的框架
CHI '24· 语音用户界面(VUI)设计 +2
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)
快捷操作
广告推荐
学习 AI 编程到 CodeNow
open_in_new打开DOI链接
DOI: https://dl.acm.org/doi/10.1145/3706598.3714259
一眼看懂
fact_check论文快照
dataset
来源
CHI
calendar_month
年份
2025
emoji_events
奖项
荣誉提名
group
作者
9 位作者
sell
研究子方向
生成式AI(文本、图像、音乐、视频)、大语言模型(LLM)的人机协作
work
职业/产业
UI/UX 设计师、AI/ML 研究员与工程师
article
内容状态
已索引正文
hub
相关论文
10 篇相关论文