作为AI语言模型,我无法:“调查LLM对用户请求的否认”

荣誉提名
大语言模型(LLM)的人机协作AI 伦理、公平与问责HCI 研究员认知科学家

文献标题

“As an AI language model, I cannot”: Investigating LLM Denials of User Requests

文献信息

  • 主题领域: 人机交互(HCI)、AI语言模型在用户请求拒绝的设计与用户体验研究
  • 关键词: 人机交互、错误处理、LLM拒绝、用户体验、GPT-4

研究背景与问题

  • 问题或挑战:
    • 用户与大型语言模型(LLM)互动时经常遭遇拒绝或错误,反映了用户请求与系统能力之间的鸿沟。这种拒绝场景既可能是技术原因(如模型能力限制),也可能是社会原因(如政策限制)。
    • 之前的研究关注了错误处理与交互修复策略,但缺乏针对LLM拒绝样式设计对用户体验的影响的研究。
  • 重要性:
    • LLM在现代交互技术中的使用越来越广泛,优化用户体验至关重要。了解用户如何感知拒绝响应可为更好地设计交互提供依据。
  • 研究动机与相关工作:
    • 以往研究表明,用户对错误响应和拒绝交互的感知显著影响其对系统的信任、满意度和心理模型。
    • 在解释性AI领域,优质的解释能帮助用户理解系统限制,减少挫败感。本研究旨在探索拒绝策略在LLM场景中的具体表现。

解决方案

  • 方法或解决方案:
    • 研究比较了四种拒绝样式:基础型拒绝(仅拒绝无解释)、事实型拒绝(提供理由)、引导型拒绝(转移至相关话题)、以及意见型拒绝(纠正用户行为)。
    • 设计两个实验分别研究技术原因拒绝及社会原因拒绝的用户体验。
  • 创新之处:
    • 首次系统性地研究了不同拒绝样式对用户感知(挫败感、有效性、适当性和相关性)的影响,并提出了优化LLM拒绝设计的具体建议。
  • 实施步骤与关键技术:
    1. 构建基于GPT-4的互动模型,要求所有用户请求都被拒绝。
    2. 设置场景和任务以模拟真实用户需求,涵盖健康、政治和幽默三个主题。
    3. 分析四种拒绝样式在不同拒绝原因场景中(技术性和社会性)的用户感知差异。

研究成果

  • 具体成果:
    • 引导性拒绝(Diverting)样式在挫败感最低、有效性及适当性评分最高。
    • 基础型拒绝(Baseline)评分最低,用户感知为“没有任何帮助”。
    • 对社会原因拒绝,意见型拒绝表现较好,尽管不如引导型拒绝。
    • 技术原因拒绝中,事实型拒绝未能显著优于基础型拒绝。
  • 相较现有解决方案的优势:
    • 优化拒绝样式设计能够改善用户体验,减少挫败感,同时增强LLM的可用性和满意度。
  • 实验或评估结果:
    • 用户对基础型拒绝普遍表示不满,而对引导性拒绝的评价显著较高。
    • 定量数据显示,拒绝样式设计在所有测量维度(挫败感、有效性、适当性、相关性)上具有显著影响。
  • 局限性与未来方向:
    • 研究局限于单次交互场景,未涉及复杂对话中的拒绝策略。
    • 样本人口基于美国社会背景,未来可探索跨文化视角。
    • 未讨论更多可能的拒绝样式(如幽默性拒绝)。

通过该研究,为设计更人性化、互动性强的LLM拒绝样式奠定了学术依据,同时开拓了未来优化AI用户体验的研究方向。该研究也建议在技术限制和法律伦理框架内,为用户提供更丰富、有价值的拒绝响应以维持积极的交互体验。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/chi/148063/2024

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3613904.3642135
一眼看懂

论文快照

fact_check
dataset
来源
CHI
calendar_month
年份
2024
emoji_events
奖项
荣誉提名
group
作者
4 位作者
sell
研究子方向
大语言模型(LLM)的人机协作、AI 伦理、公平与问责
work
职业/产业
HCI 研究员、认知科学家
article
内容状态
已索引正文
hub
相关论文
10 篇相关论文