生成式AI图像工具中的交互方法:HCI与行业趋势及设计机遇综述

生成式AI(文本、图像、音乐、视频)大语言模型(LLM)的人机协作创意协作与反馈系统UI/UX 设计师AI/ML 研究员与工程师产品设计师

文献标题

Interaction Methods in Generative AI Image Tools: A Review of Trends and Design Opportunities Across HCI and Industry

出版信息

  • 主题领域: 生成式人工智能图像工具中的交互方法与界面设计。
  • 关键词: 生成式人工智能,图像生成,人机交互,交互方法,创意流程,工具功能,设计工作流,提示指导,视觉交互。

背景与问题

  • 问题/挑战: 生成式人工智能(GenAI)图像工具高度依赖文本提示,而有效构建这些提示往往较为困难。关于这些工具如何支持交互和创意工作流的综合研究较为有限,特别是在细化、评估和精确控制方面。
  • 重要性: 理解和改进生成式人工智能工具中的交互方法对于提升可用性和支持设计实践中的创意工作流至关重要。
  • 动机与相关工作: 先前的研究探讨了提示推荐系统、多模态界面和文本细化工具,但缺乏对交互方法及其在创意工作流中的整合的全面综述。本文旨在通过分析学术界和商业领域的生成式人工智能工具来填补这一空白。

解决方案

  • 提出的方法: 对37个生成式人工智能图像工具(28个学术工具,9个商业工具)进行系统综述,采用三个分析框架:交互方法、创意流程和工具功能。
  • 创新点:
    1. 引入一个结构化设计空间,用于生成式人工智能图像工具界面。
    2. 确定九个可操作的设计机会,以解决当前工具中的不足。
    3. 基于交互方法、创意流程和功能的跨框架分析。
    4. 对学术系统和商业系统进行比较评估。
  • 流程与关键技术:
    • 使用PRISMA框架对学术工具进行系统综述,并基于行业报告和实际测试分析商业工具。
    • 开发三个分析框架:交互方法(如输入类型、控制级别)、创意流程(如构思、细化)和工具功能(如生成器、编辑器)。
    • 在框架维度上对工具进行0–3分评分,并进行相关性分析以识别模式和不足。

结果

  • 具体发现:
    • 文本提示作为输入占主导地位,但视觉和基于属性的输入在学术工具中逐渐受到关注。
    • 对精确控制、参数控制和结构化评估工作流的支持有限。
    • 强调早期创意流程(构思、探索),但对细化和评估的支持较弱。
  • 相较基线的优势:
    • 学术工具在提示指导和基于视觉的输入方面领先,而商业工具则强调参数控制和全局调整。
  • 实验/评估:
    • 工具在交互方法(如基于文本、基于视觉的输入)、创意流程(如构思、细化)和功能(如生成器、编辑器)方面进行了评估。
    • 相关性分析揭示了一致的关联(如基于文本的输入与构思)以及不足(如视觉输入与变体探索的有限整合)。
  • 局限性与未来工作:
    • 重点关注二维、基于屏幕的工具,未涉及三维、AR/VR系统。
    • 仅限于2022年1月至2025年7月之间发布的工具。
    • 未来工作应扩展到空间界面、更广泛的学科来源以及以用户为中心的评估。

总结

本文对37个生成式人工智能图像工具进行了系统综述,分析了交互方法、创意流程和工具功能。文本提示仍是主要输入方式,但学术工具正在探索视觉和基于属性的输入。研究发现了精确控制、参数控制和评估工作流中的不足,同时对早期构思和探索阶段提供了强有力的支持。提出了九个设计机会以提升可用性和创意支持,包括高级视觉交互、简化参数控制和集成工作流。这些发现为设计更高效的生成式人工智能图像工具界面提供了可操作的洞见。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/chi/222898/2026

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3772318.3790307
一眼看懂

论文快照

fact_check
dataset
来源
CHI
calendar_month
年份
2026
emoji_events
奖项
未标记奖项
group
作者
4 位作者
sell
研究子方向
生成式AI(文本、图像、音乐、视频)、大语言模型(LLM)的人机协作、创意协作与反馈系统
work
职业/产业
UI/UX 设计师、AI/ML 研究员与工程师、产品设计师
article
内容状态
已索引正文
hub
相关论文
10 篇相关论文