Collaposer:将照片集合转化为用于叙事的拼贴视觉资产
作者
平面设计与排版工具创意协作与反馈系统AI辅助写作与文本生成UI/UX 设计师视觉艺术家与设计师内容创作者(YouTuber、Podcaster)
文献标题
Collaposer: Transforming Photo Collections into Visual Assets for Storytelling with Collages
出版信息
- 主题领域: 用于视觉叙事和拼贴创作的数字工具
- 关键词: 数字拼贴、叙事、视觉素材、实例分割、大型语言模型、语义聚类、创意工具、素材准备、动画、用户研究
背景与问题
- 问题/挑战: 为基于拼贴的叙事准备视觉素材是一项劳动密集型任务,涉及低效的照片搜索、手动图像剪裁以及对大型图片集的复杂组织。
- 意义: 简化素材准备过程可以让创作者专注于叙事和构图,从而提升艺术、媒体和设计领域的创意工作流程。
- 动机与相关研究: 现有工具支持整体图像的操作或检索,但缺乏针对拼贴创作的细粒度素材准备功能。之前关于照片摘要、设计材料提取和视觉素材管理的研究未能满足拼贴创作者的特定需求,导致在自动化对象级素材准备方面存在空白。
解决方案
- 提出的方法: Collaposer,一种工具,可根据用户提供的故事描述,将照片集转化为组织良好的、可直接使用的视觉剪裁素材。
- 创新点:
- 结合实例分割、语义聚类和基于LLM的关联的管道,自动化素材准备过程。
- 将视觉素材分层组织到与故事描述一致的类别中(如角色、背景、配件)。
- 提供支持高效导航、选择和组合精选素材的用户界面。
- 流程与关键技术:
- 阶段I: 使用RAM、Grounding DINO和SAM模型对照片集进行预处理,包括标记、检测和分割视觉元素。
- 阶段II: 使用GPT-4o选择相关元素,将其分类到语义类别中,并进行层次聚类。
- 阶段III: 以树状视图和画布形式呈现素材,素材大小反映选择评分,评分基于多样性、故事一致性和分辨率。
- 导出结构化输出(如JSON文件、分层图像),以便在Adobe After Effects等工具中进一步编辑。
结果
- 具体发现:
- 在用户测试中,Collaposer实现了100%的单次成功率,参与者无需重新提示即可完成任务。
- 参与者对Collaposer的选择一致性(Q1-1: 7.0/7.0)、多样性(Q2-1: 6.8/7.0)和可用性(Q4-1: 6.9/7.0)的评分均高于基线工具。
- 相较基线的优势:
- 在故事一致性和多样性方面,Collaposer通过补充用户提示的推断元素,优于Ablated-Select。
- 在呈现效果方面,Collaposer通过聚类和调整素材大小以优化导航,优于Ablated-Present。
- 实验/评估:
- 用户研究(N = 12),比较Collaposer与两个简化基线工具在36个拼贴故事中的表现。
- 评估指标:提示尝试次数、任务持续时间、Likert量表评分和定性反馈。
- 参与者包括9名业余爱好者和3名专业人士,创意背景多样。
- 局限性与未来工作:
- 在某些情况下,提示与用户意图之间存在不一致。
- 素材选择过程缺乏透明性。
- 单次准备限制了迭代优化。
- 短时间的研究限制了对长期使用效果的理解。
总结
Collaposer是一种新颖的工具,通过实例分割、语义聚类和基于LLM的推理,自动化基于拼贴的叙事所需的视觉素材准备。它解决了传统工作流程中的低效问题,使用户能够快速获取并组织与故事一致的剪裁素材。用户研究表明,与基线工具相比,Collaposer在选择一致性、多样性和可用性方面具有显著优势。尽管在提示一致性和迭代优化方面仍存在局限性,Collaposer在艺术、媒体和教育领域的应用前景广阔,可支持静态和动态拼贴创作。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
当前问题库还没有收录这篇论文的问题与痛点。
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)
快捷操作
广告推荐
学习 AI 编程到 CodeNow
open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3772318.3791160
一眼看懂
fact_check论文快照
dataset
来源
CHI
calendar_month
年份
2026
emoji_events
奖项
未标记奖项
group
作者
6 位作者
sell
研究子方向
平面设计与排版工具、创意协作与反馈系统、AI辅助写作与文本生成
work
职业/产业
UI/UX 设计师、视觉艺术家与设计师、内容创作者(YouTuber、Podcaster)
article
内容状态
已索引正文
hub
相关论文
1 篇相关论文