理解多模态具身对话代理中的会话和表达风格

全身交互与体感输入对话式聊天机器人会话代理的人格与拟人化音乐人、DJ 与声音设计师自由职业者(设计、写作、翻译)

文献标题

Understanding Conversational and Expressive Style in a Multimodal Embodied Conversational Agent

文献信息

  • 作者: Deepali Aneja, Rens Hoegen, Daniel McDuf, Mary Czerwinski
  • 主题领域: 社交智能虚拟代理(SIVA),多模态对话界面设计与用户体验
  • 关键词: 具有身体表现的代理, 社交行为, 对话风格, 面部表情风格, 情感表达, 社会对话, 多模态性

研究背景与问题

  • 问题或挑战: 当前的具有身体表现的对话代理系统常表现为单调性,并且无法适应用户的对话风格与行为。缺乏即时并自然的交互体验。
  • 重要性: 人机接口逐渐多元化,设计一个能理解并匹配人类对话与表情风格的虚拟代理对于提高用户体验以及在开放领域对话中的应用具有潜在的价值。
  • 研究动机与相关工作: 受此前仅支持音频对话风格匹配的系统启发,作者尝试构建一个多模态的、既能进行自由对话又能动态匹配用户对话与表情风格的虚拟代理。已有研究表明对话风格匹配在人机交互中提高信任度和自然性,但通常在应用领域有局限性。

解决方案

  • 提出的方案: 作者开发了一个多模态社交智能虚拟代理 (SIVA),该系统能够实时分析用户的音频与视频信号,并根据交互对话与情感状态生成样式匹配的反应,包括语言、语调、面部表情和头部动作。
  • 创新之处:
    • 将语言对话风格与面部表情、头部姿态等非语言行为结合进行实时样式匹配。
    • 转化基于表情、语言等多模态输入生成实时的面部表情响应与同步的嘴唇动作。
    • 提出的样式匹配架构首次结合用户的对话风格 (高考虑 HC 或高参与 HI) 以及面部表情集合,用于生成自然且可信的交互响应。
  • 实施步骤与关键技术:
    • 在对话层面,SIVA通过微软语音API进行音频输入分析,并结合深度学习生成上下文敏感的对话。
    • 对话风格管理器通过提取语调变化、说话速度与语言特征(如代词使用)捕捉用户风格。
    • 在视觉层面,通过表情识别算法分析用户表情与头部动作,采用情绪API生成情感表达,使用动作单元合成面部表情。
    • 实现实时嘴唇同步与多模态输出响应。

研究成果

  • 具体成果:
    • SIVA在多模态样式匹配条件下表现出更高度的情感反映和非语言行为,被参与者认为较控制组(无样式匹配条件)更可信、更具表现性。
    • 对话风格匹配显著提高了"高参与 HI"用户对于代理活力和类人表现的评分。
    • 系统可以完成开放性任务对话,例如规划节目、讨论假期等。
  • 优势与比较:
    • 与既有单调或特定领域的代理相比,更自然并支持开放型对话。
    • 将对话风格与情感表现有效结合,提升了面向不同人群的适应性。
  • 实验或评估结果:
    • 样式匹配下的SIVA与"高参与 HI"用户具备显著积极互动,但对"高考虑 HC"用户,样式匹配可能产生反效果,表明求得个性化设计还需优化。
    • 用户反馈揭示当前面部表情模仿的自然性尚不足,部分参与者感到"不舒服"或"刻意"。
  • 局限性与未来方向:
    • 存在约2秒的对话延迟影响自然节奏。
    • 表情模仿可能导致"不自然"或"不可亲"现象,需扩展到更复杂的反应机制。
    • 现有架构将对话风格和表情样式合并单一条件,未来研究需拆分独立条件以探讨各特征的驱动效果。
    • 可进一步提升基于更大数据集训练对话生成模型的能力,同时引入身体语言等非语言交互形式。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/chi/47373/2021

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3411764.3445708
一眼看懂

论文快照

fact_check
dataset
来源
CHI
calendar_month
年份
2021
emoji_events
奖项
未标记奖项
group
作者
4 位作者
sell
研究子方向
全身交互与体感输入、对话式聊天机器人、会话代理的人格与拟人化
work
职业/产业
音乐人、DJ 与声音设计师、自由职业者(设计、写作、翻译)
article
内容状态
已索引正文
hub
相关论文
0 篇相关论文