文本到图像生成的自适应提示引导
生成式AI(文本、图像、音乐、视频)大语言模型(LLM)的人机协作AI 辅助决策与自动化系统AI/ML 研究员与工程师UI/UX 设计师HCI 研究员
将文本到图像生成与用户意图对齐仍具有挑战性,因为用户经常提供模糊输入并难以掌握模型特性。我们提出自适应提示引导(APE),一种自适应提出视觉查询以帮助用户优化提示词而无需大量写作的技术。我们的技术贡献是在信息论框架下对交互式意图推理的公式化。APE使用语言模型先验将潜在用户意图表示为可解释的特征需求,自适应生成视觉查询,并将引出的需求编译成有效提示词。在IDEA-Bench和DesignBench上的评估表明,APE以更高效率实现了更强的对齐。128名参与者在用户定义任务上的用户研究表明,感知对齐度提高19.8%而工作量未增加。我们的工作贡献了一种原则性的提示编写方法,为与文本到图像模型 prevailing 的基于提示的交互范式提供了有效且高效的补充。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
当前问题库还没有收录这篇论文的问题与痛点。
- 86%
使用生成式AI创建和评估人物角色:对81篇文章的范围性综述
CHI '26· 生成式AI(文本、图像、音乐、视频) +3
- 86%
文本到图像生成中默认图像的探索
CHI '26· 生成式AI(文本、图像、音乐、视频) +3
- 86%
创意场景中可持续人机协作:CAS、UTAUT、心理所有权与自我决定理论的综合方法
CHI '26· 生成式AI(文本、图像、音乐、视频) +3
- 83%
提示词写作中的满足倾向与最大化倾向:人机交互中的特质与任务效应
CHI '26· 生成式AI(文本、图像、音乐、视频) +2
- 83%
GANzilla:在生成对抗网络中实现用户驱动的方向发现
UIST '22· 生成式AI(文本、图像、音乐、视频) +1
- 71%
重新审视人类与AI交互的独特设计难度及其原因
CHI '20· 生成式AI(文本、图像、音乐、视频) +2
- 71%
AI增强的头脑风暴:研究LLM在团队创意生成中的应用
CHI '24· 生成式AI(文本、图像、音乐、视频) +1
- 71%
生成式AI应用程序的设计原则
CHI '24· 生成式AI(文本、图像、音乐、视频) +2
- 71%
基于LLM的搜索对决策制定的影响:速度、准确性和过度依赖
CHI '25· 大语言模型(LLM)的人机协作 +2
- 71%
Script&Shift:一种分层界面范式,用于将内容开发和修辞策略与LLM写作助手集成
CHI '25· 生成式AI(文本、图像、音乐、视频) +2
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)
快捷操作
一眼看懂
fact_check论文快照
dataset
来源
IUI
calendar_month
年份
2026
emoji_events
奖项
未标记奖项
group
作者
5 位作者
sell
研究子方向
生成式AI(文本、图像、音乐、视频)、大语言模型(LLM)的人机协作、AI 辅助决策与自动化系统
work
职业/产业
AI/ML 研究员与工程师、UI/UX 设计师、HCI 研究员
article
内容状态
仅摘要
hub
相关论文
10 篇相关论文