玩具讲述者:通过玩具扮演和角色符号进行AI驱动的视觉叙事

生成式AI(文本、图像、音乐、视频)AI 辅助创意写作互动叙事与沉浸式故事游戏开发者与设计师电影与动画制作人视觉艺术家与设计师

研究背景与问题

  • 问题与挑战: 作者注意到许多AI讲故事工具主要依赖自然语言输入来生成故事内容,而忽略了其他可能的交互模式,比如儿童通过玩玩具进行的讲故事活动。同时,现有的AI技术在支持多模态输入方面仍然有限,例如缺乏对简化输入的直观理解、交互延迟高,或者需要用户操纵复杂的输入形式。
  • 重要性: 讲故事是创意表达的重要形式,通过发展多模态交互技术,可以扩展人类与AI合作进行创意表达的可能性,并改善用户体验,同时为技术和交互设计带来新的研究机会。
  • 动机与相关工作: 该研究受到Heider和Simmel关于形状动作的实验的启发,这些动作能够表达丰富的社会互动。此外,过去的研究也尝试采用AI生成故事文本或世界和视觉内容,但这些工作多集中于单一形式(例如文本),而非多模态交互。

解决方案

  • 方法或解决方案: 作者提出了一个名为Toyteller的多模态AI交互系统,结合玩具操作和故事生成,将动作符号作为输入来引导故事生成,同时也作为故事输出内容的一部分。
  • 创新之处:
    • 引入“玩具操作”作为一种新颖的输入模式,让用户通过操控符号动作表达故事意图。
    • 利用动作与文本之间的转换层,使得AI能够在动作生成和文本生成之间有效工作。
  • 实施步骤:
    1. 开发玩具操作界面,允许用户物理地操纵符号动作或提供文本输入。
    2. 训练AI模型,用于从动作识别事件和主动字符信息,以及根据这些信息生成文本和动作。
    3. 设计易用的工具接口,支持故事设置、动作记录、文本生成和交互灵活性。
  • 关键技术:
    • 使用LSTM进行动作序列处理,以优化速度。
    • 将动作信息嵌入到文本嵌入空间,以实现多模态转换。
    • 采用软提示技术优化了大型语言模型的生成性能。

研究成果

  • 具体成果:
    • Toyteller在动作到故事文本生成、动作生成和动作识别等任务上表现优于GPT-4o,尤其在准确性、生成新颖性和交互流畅性方面。
    • 用户研究显示,玩具交互适合表达难以通过语言描述的模糊意图,并对启发创意有重要帮助。
  • 优势对比:
    • Toyteller相比GPT-4o具有更低的交互延迟,更高的动作识别准确性和故事文本生成的新颖度。
    • 系统允许更多的交互灵活性,使用户可以自由选择AI与自己在创作中的角色分配。
  • 实验结果:
    • 动作识别测试中,Toyteller显著提高了正确动作排名和权重分配,同时明显降低了处理延迟。
    • 文本生成评估中,Toyteller的内容更具创意且与动作高度一致。
    • 动作生成任务中,Toyteller生成的动作更符合真实感和目标事件要求。
  • 局限性与未来方向:
    • 局限性: 某些场景中,系统在解释动作时可能产生偏差,对特定领域(如体育动作)的理解有限;当前的“三角形”符号设计限制了视觉表达。
    • 未来方向:
      1. 扩展场景复杂性(例如添加更多角色和道具)。
      2. 改进视觉呈现(添加颜色和更复杂的符号)。
      3. 集成其他交互形式,如3D动作、声音或触觉输入。
      4. 提高对专业领域和复杂场景的适应能力。

总结

Toyteller通过创新的玩具交互方式,将AI-powered讲故事提升至多模态交互的范畴。该研究不仅展示了技术上的创新,还突出了这种交互形式在创意表达、工具设计以及用户体验上的潜力。未来工作可进一步优化技术性能、扩展应用场景,并探索与其他生成技术相结合的可能性。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/chi/188612/2025

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://dl.acm.org/doi/10.1145/3706598.3713435
一眼看懂

论文快照

fact_check
dataset
来源
CHI
calendar_month
年份
2025
emoji_events
奖项
未标记奖项
group
作者
3 位作者
sell
研究子方向
生成式AI(文本、图像、音乐、视频)、AI 辅助创意写作、互动叙事与沉浸式故事
work
职业/产业
游戏开发者与设计师、电影与动画制作人、视觉艺术家与设计师
article
内容状态
已索引正文
hub
相关论文
3 篇相关论文