对话代理的启发式评估

最佳论文
对话式聊天机器人会话代理的人格与拟人化

文献标题

Heuristic Evaluation of Conversational Agents

文献信息

  • 主题领域: 人机交互与对话式代理设计的可用性评估
  • 关键词: 对话式代理, 可用性启发式, 用户界面设计, 语音助手, 聊天机器人, 可用性测试, 人机交互, 数据隐私, 对话内容, 交互设计

研究背景与问题

  • 发现的问题或挑战:

    • 当前的对话式代理(如聊天机器人和语音助手)设计中缺乏一致的可用性准则。
    • Nielsen 提出的经典可用性启发式尚未被有效验证或适配于对话式代理的独特特性。
    • 对话式代理与传统人机界面不同,涉及对话内容、交互设计、以及隐私和人性化特征等新的设计领域。
  • 重要性:

    • 随着对话式代理在商业和用户中的普及,确保其设计具备高可用性至关重要。
    • 适应不同对话模式(文本、语音、或多模态)的可用性启发式准则可以显著提升设计质量。
  • 研究动机与相关工作:

    • 作者基于对 Nielsen 启发式的扩展和专家的反馈,旨在为对话式代理开发一组完整的可用性启发式。
    • 借鉴了现有关于人机交互、人性化聊天机器人体验、以及领域特定启发式设计的研究。

解决方案

  • 方法/解决方案:

    • 作者提出一套专为对话式代理设计的 11 条可用性启发式,并通过四个阶段进行验证:
      1. 启发式生成:从文献和先前研究中整合指导意见,建立初始准则。
      2. 专家评审:通过专家评价收集反馈,并对初始准则进行迭代。
      3. 启发式评估验证:使用初始准则与 Nielsen 启发式分别对语音助手(Amazon Echo Skill)和聊天机器人进行评估,比较效果。
      4. 修订后启发式验证:根据评估结果改进准则,再次对聊天机器人进行评估。
  • 创新之处:

    • 提出并验证了针对此类系统的专用启发式准则,进一步拓展了传统启发式评估框架。
    • 在准则设计中融入了 Grice 合作原则等用于改进用户对话体验的理论。
    • 针对新兴多模态交互界面的需求,显式包括了如隐私、上下文维护等特性。
  • 实施步骤与关键技术:

    • 初始准则从文献中抽取并经过整理与分类,与 Grice 原则进一步融合以覆盖对话质量问题。
    • 专家意见通过在线调查获取,基于合理性评分对准则进行修改。
    • 不同阶段评估均规范化设计,并记录启发式与具体可用性问题的映射关系。

研究成果

  • 具体成果:

    • 提出了 11 条经验证的对话式代理可用性启发式,包括关键设计领域如对话内容、指导与帮助、上下文维护等。
    • 修订后的启发式在适应性上超越 Nielsen 的通用准则,能发现更多与对话内容和隐私相关的问题。
  • 与现有解决方案相比的优势:

    • 发现更多的低到中严重程度的可用性问题,尤其在对话内容和视觉设计领域。
    • 尤其适用于语音和文本多模态下的交互设计评估。
  • 实验或评估结果:

    • 专家组对修订后的启发式评价总体相关性更高,其中针对聊天机器人和语音助手所发现的问题数量也显著多于 Nielsen 启发式。
    • 进一步的量化分析证明新准则在覆盖“独特问题”上更有优势。
    • 但是,修订后的启发式在一些领域如设置和音频输出等方面仍有待进一步改进。
  • 局限性与未来方向:

    • 局限于较小的参与者群体和有限的对话代理类型(仅涉及语音助手和基于文本的聊天机器人)。
    • 未来研究建议扩展启发式适用范围至更多用例场景、设备类型和领域习惯。
    • 在用户多样化层次(如不同文化背景或技能水平)应用中验证其通用性。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/chi/47776/2021

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3411764.3445312
一眼看懂

论文快照

fact_check
dataset
来源
CHI
calendar_month
年份
2021
emoji_events
奖项
最佳论文
group
作者
6 位作者
sell
研究子方向
对话式聊天机器人、会话代理的人格与拟人化
work
职业/产业
article
内容状态
已索引正文
hub
相关论文
10 篇相关论文