PoemPalette:通过绘画与诗歌的意象领域对齐促进诗歌创意探索与基础理解
作者
生成式AI(文本、图像、音乐、视频)大语言模型(LLM)的人机协作创意协作与反馈系统数字艺术装置与交互表演互动叙事与沉浸式故事内容创作者(YouTuber、Podcaster)视觉艺术家与设计师HCI 研究员
文献标题
PoemPalette: Facilitating Poetry Creative Exploration and Foundational Understanding through the Ideorealm Alignment of Paintings and Poems
出版信息
- 主题领域: 诗歌与视觉艺术创作中的人机交互(HCI)
- 关键词: 意境对齐, 场景图, 生成式人工智能, 诗歌可视化, 大型语言模型, 创意探索, 基础理解, 多模态交互, 文化遗产, 人工智能共创
背景与问题
- 问题 / 挑战: 现有的诗歌与绘画工具通常依赖于缺乏透明性和用户控制的黑箱式人工智能模型,限制了用户在创意探索和深入理解诗歌符号及其视觉表现方面的机会。
- 意义: 通过交互式系统将诗歌与绘画相结合,可以增强创意参与和基础理解,尤其是对探索文化和艺术传统的新手而言。
- 动机与相关工作: 以往的工具主要关注可视化或多模态交互,但未能提供结构化、可解释的中间表示。诗歌文本与视觉输出之间的语义对齐仍然是一个挑战,特别是对于细腻的文化和象征性内容。
解决方案
- 提出的方法: PoemPalette 是一个交互式工具,结合了“绘画与诗歌的意境对齐(IA-PP)”理论、场景图(SG)和生成式人工智能,帮助用户进行创意探索和诗歌可视化。
- 创新点:
- 开发了一种结构化、可解释的场景图(SG)表示,用于对齐诗歌符号与视觉元素。
- 集成语义对齐技术,实现可控的文本到图像生成,同时保留文化和象征意义的真实性。
- 利用大型语言模型(LLM)作为智能代理,通过交互式对话支持诗歌的基础理解。
- 通过用户研究实证验证 PoemPalette 在增强创意探索和理解方面的有效性。
- 流程与关键技术:
- 使用基于 LLM 的语义解析提取诗歌符号及其关系,构建场景图。
- 允许用户交互式修改场景图,并使用 Stable Diffusion XL 和 LoRA 进行文化风格适配的视觉元素生成。
- 提供 LLM 驱动的智能代理,用于上下文解释和问答。
- 可视化情感基调和色彩调色板,以加深用户对诗歌主题的参与感。
结果
- 具体发现:
- PoemPalette 显著提高了创意探索评分(例如,探索性:82.00 对比 AI 基线的 67.50;CSI 总分:77.59 对比 AI 基线的 66.33)。
- 基础理解评分在干预后显著提升(例如,中国诗歌组:前测 43.65 提升至后测 79.9)。
- 相较基线的优势:
- 在创意支持(例如,享受度、表现力)和用户体验(例如,刺激性、新颖性)方面均优于 AI 和非 AI 基线。
- 与非 AI 方法相比,显著降低了认知负荷(例如,NASA-TLX 努力分数更低)。
- 实验 / 评估:
- 进行了一项 60 名参与者的组间研究(中国诗歌和日本俳句各 30 名),比较 PoemPalette、AI 和非 AI 基线。
- 使用标准化工具(CSI、UEQ、NASA-TLX、SUS)和前测–后测理解测试进行评估。
- 局限性与未来工作:
- 在表示抽象或高度修辞化的诗歌元素方面存在挑战。
- 文化范围有限(聚焦于中国唐诗和日本俳句)。
- 计划改进包括建立符号库、增强场景图灵活性以及开展长期研究。
总结
PoemPalette 是一个通过“绘画与诗歌的意境对齐(IA-PP)”框架将诗歌与绘画相结合的交互式系统。通过结合基于场景图的语义对齐、生成式人工智能和 LLM 驱动的辅助功能,它使用户能够以创造性的方式探索和可视化诗歌符号。用户研究表明,与 AI 和非 AI 基线相比,该系统在增强创意探索和基础理解方面具有显著优势。未来的工作将致力于扩展文化适应性、优化图形表示以及探索长期学习效果。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
当前问题库还没有收录这篇论文的问题与痛点。
暂无符合条件(≥60% 相似度)的相关论文
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)
快捷操作
广告推荐
学习 AI 编程到 CodeNow
open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3772318.3791460
一眼看懂
fact_check论文快照
dataset
来源
CHI
calendar_month
年份
2026
emoji_events
奖项
未标记奖项
group
作者
9 位作者
sell
研究子方向
生成式AI(文本、图像、音乐、视频)、大语言模型(LLM)的人机协作、创意协作与反馈系统、数字艺术装置与交互表演
work
职业/产业
内容创作者(YouTuber、Podcaster)、视觉艺术家与设计师、HCI 研究员
article
内容状态
已索引正文
hub
相关论文
0 篇相关论文