组合结构作为人机协同创作环境的基底:一种设计方法和案例研究

生成式AI(文本、图像、音乐、视频)创意协作与反馈系统音乐人、DJ 与声音设计师电影与动画制作人UI/UX 设计师

研究背景与问题

  • 问题与挑战:

    • 当前的人机共创环境多依赖“提示-结果”这种线性交互方式,缺乏对创作过程中探索、规划、迭代以及对AI生成内容的控制与检查的支持。
    • 在视频创作等复杂内容的创作过程中,如何有效组织和管理多维度信息(如叙事、时间、空间分类)是一个关键挑战。
    • 现有研究已经探讨了利用外部结构(例如链式结构或叙事性图表)来提升AI生成内容的可控性,但缺乏系统化的设计方法来整合这些结构。
  • 重要性:

    • 视频、写作、音乐等复杂内容的创作过程需要动态的、可同步的工具来确保人机协作的流畅性。
    • 高效且透明的协作工具可显著提高创作效率,同时减轻内容生成和管理的复杂性。
  • 研究动机与相关工作:

    • 相关工作指出,使用“组合结构”可以有效组织内容元素,促进内容的检查与迭代。
    • 例如,叙事图可以帮助检查故事线的流动性,而多轨时间线可以支持视频片段的衔接与调整。
    • 尽管这些结构的单一应用已有研究,但在复杂环境下如何有效整合多个结构的工作却十分缺乏。

解决方案

方法与核心思想

  • 提出方法:
    • 将组合结构(compositional structures)作为人机共创的核心设计要素,它可以可视化和组织内容的关键成分(例如空间、时间、叙事与一致性)。
    • 将AI引入这些结构内部和跨结构,支持内容生成和自动化同步,实现更灵活的创作工作流。

创新性

  • 这是一个系统化的四步设计方法:
    1. 确定创作活动中需要用到的组合结构及其相互关系。
    2. 针对具体内容设计每个独立的结构。
    3. 将这些结构整合到一个工作环境中,同时定义它们的同步机制。
    4. 注入AI能力,通过结构内和跨结构的智能化生成和关联优化创作流程。

实施步骤和关键技术

  1. 定义结构与组织规则:

    • 识别内容中的关键维度,例如空间布局、时间段分配和叙事流程。
    • 设计个性化的结构来优化特定维度,如自由画布支持素材收集,线性文本编辑器支持叙事开发等。
  2. 整合与同步:

    • 通过逻辑映射和自动化技术,为不同结构的内容创建关联,例如文本和时间线之间的内容变换。
    • 提供视觉化的同步功能,如高亮相关内容或自动更新关联结果。
  3. AI能力嵌入:

    • 在结构内部,AI协助生成特定内容(如文本叙事或视觉场景)。
    • 在跨结构交互中,自动推断和同步内容(如以时间线调整文本内容以确保一致性)。
  4. 案例应用:

    • 实现了一个名为VideOrigami的视频共创环境,包含自由画布、线性文本编辑器、基于网格的场景规划器和时间线编辑器。
    • 其中集成了OpenAI的GPT-4和DALL-E 3,用于文本生成和视觉生成,以简化视频内容创建。

研究成果

取得的成果

  1. 用户评价证实了环境的有效性:

    • 在用户研究中,参与者表示整合的结构有助于保持创作过程中清晰的方向感,并且通过透明的AI生成过程获得了更大的控制感。
    • 场景规划器成为参与者普遍认为的关键互动点,比以往更多地被用作创作空间。
    • 生成和同步功能缩短了从空白画布到粗剪的视频生成周期。
  2. 新工作流的启发:

    • 用户显示出更多频繁的跨结构切换和并行开发工作流的趋势。
    • 较低的生成成本促使用户广泛使用AI完成初步设计,但高评估成本阻碍了大规模迭代。
  3. 对AI生成的信任与接受:

    • 使用组合结构让参与者能够直观检查每个生成步骤,引发了对AI结果的更强信任。

优势与不足

  • 与现有解决方案的对比:

    • 相较于传统线性工作流系统(如仅依赖时间线的编辑器),通过组合结构的构建和同步使得协作更灵活,减少了上下文切换带来的负担。
    • 特有的同步能力有效解决了内容变换时的信息丢失问题。
  • 局限性:

    • AI生成内容的高保真度可能在早期阶段限制用户的创造性探索。
    • 评估成本(如审阅视频内容)依然较高,限制了用户对大规模变化的尝试。

实验与评估结果

  • 在用户体验中,AI协助的同步和生成能力显著提高了创作效率。
  • 专家和新手用户对系统的总体评分一致较高,但对生成内容的创造性和透明度体验存在微妙差异:
    • 专家用户更多关注个性化控制,而新手用户更倾向于依赖生成功能。

未来方向

  • 探讨低保真内容生成方式以增强早期设计阶段的探索性。
  • 开发更高效的生成内容评估工具,以降低用户的认知负担。
  • 研究如何将类似方法泛化到其他复杂创作领域(例如游戏或虚拟现实内容)。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/chi/189208/2025

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://dl.acm.org/doi/10.1145/3706598.3713401
一眼看懂

论文快照

fact_check
dataset
来源
CHI
calendar_month
年份
2025
emoji_events
奖项
未标记奖项
group
作者
5 位作者
sell
研究子方向
生成式AI(文本、图像、音乐、视频)、创意协作与反馈系统
work
职业/产业
音乐人、DJ 与声音设计师、电影与动画制作人、UI/UX 设计师
article
内容状态
已索引正文
hub
相关论文
4 篇相关论文