作为AI语言模型,我无法:“调查LLM对用户请求的否认”
荣誉提名大语言模型(LLM)的人机协作AI 伦理、公平与问责HCI 研究员认知科学家
文献标题
“As an AI language model, I cannot”: Investigating LLM Denials of User Requests
文献信息
- 主题领域: 人机交互(HCI)、AI语言模型在用户请求拒绝的设计与用户体验研究
- 关键词: 人机交互、错误处理、LLM拒绝、用户体验、GPT-4
研究背景与问题
- 问题或挑战:
- 用户与大型语言模型(LLM)互动时经常遭遇拒绝或错误,反映了用户请求与系统能力之间的鸿沟。这种拒绝场景既可能是技术原因(如模型能力限制),也可能是社会原因(如政策限制)。
- 之前的研究关注了错误处理与交互修复策略,但缺乏针对LLM拒绝样式设计对用户体验的影响的研究。
- 重要性:
- LLM在现代交互技术中的使用越来越广泛,优化用户体验至关重要。了解用户如何感知拒绝响应可为更好地设计交互提供依据。
- 研究动机与相关工作:
- 以往研究表明,用户对错误响应和拒绝交互的感知显著影响其对系统的信任、满意度和心理模型。
- 在解释性AI领域,优质的解释能帮助用户理解系统限制,减少挫败感。本研究旨在探索拒绝策略在LLM场景中的具体表现。
解决方案
- 方法或解决方案:
- 研究比较了四种拒绝样式:基础型拒绝(仅拒绝无解释)、事实型拒绝(提供理由)、引导型拒绝(转移至相关话题)、以及意见型拒绝(纠正用户行为)。
- 设计两个实验分别研究技术原因拒绝及社会原因拒绝的用户体验。
- 创新之处:
- 首次系统性地研究了不同拒绝样式对用户感知(挫败感、有效性、适当性和相关性)的影响,并提出了优化LLM拒绝设计的具体建议。
- 实施步骤与关键技术:
- 构建基于GPT-4的互动模型,要求所有用户请求都被拒绝。
- 设置场景和任务以模拟真实用户需求,涵盖健康、政治和幽默三个主题。
- 分析四种拒绝样式在不同拒绝原因场景中(技术性和社会性)的用户感知差异。
研究成果
- 具体成果:
- 引导性拒绝(Diverting)样式在挫败感最低、有效性及适当性评分最高。
- 基础型拒绝(Baseline)评分最低,用户感知为“没有任何帮助”。
- 对社会原因拒绝,意见型拒绝表现较好,尽管不如引导型拒绝。
- 技术原因拒绝中,事实型拒绝未能显著优于基础型拒绝。
- 相较现有解决方案的优势:
- 优化拒绝样式设计能够改善用户体验,减少挫败感,同时增强LLM的可用性和满意度。
- 实验或评估结果:
- 用户对基础型拒绝普遍表示不满,而对引导性拒绝的评价显著较高。
- 定量数据显示,拒绝样式设计在所有测量维度(挫败感、有效性、适当性、相关性)上具有显著影响。
- 局限性与未来方向:
- 研究局限于单次交互场景,未涉及复杂对话中的拒绝策略。
- 样本人口基于美国社会背景,未来可探索跨文化视角。
- 未讨论更多可能的拒绝样式(如幽默性拒绝)。
通过该研究,为设计更人性化、互动性强的LLM拒绝样式奠定了学术依据,同时开拓了未来优化AI用户体验的研究方向。该研究也建议在技术限制和法律伦理框架内,为用户提供更丰富、有价值的拒绝响应以维持积极的交互体验。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
help
研究问题
3- 不同的LLM(大型语言模型)拒绝风格对用户体验的影响有哪些?分类: 对话系统管理与错误处理同类问题arrow_forward
- 在技术限制和社会原因造成的拒绝情境中,不同拒绝风格的表现如何?分类: 对话系统管理与错误处理同类问题arrow_forward
- 哪种拒绝风格可以最大限度减少用户的挫败感并提高互动的适当性和有效性?分类: 对话系统管理与错误处理同类问题arrow_forward
lightbulb
现实痛点
1- 用户对AI拒绝请求时的体验感到挫败,难以理解拒绝的理由。分类: 对话系统管理与错误处理同类问题arrow_forward
- 80%
Black LLMirror:用户(自我)对大语言模型使用黑人美式英语交互的感知研究
CHI '26· 大语言模型(LLM)的人机协作 +2
- 75%
持续的人在环优化
CHI '25· 大语言模型(LLM)的人机协作
- 67%
两个人的头脑是否比一个人在AI辅助决策中更好?比较群体和个人在人类-AI协作再犯风险评估中的行为和表现
CHI '23· 大语言模型(LLM)的人机协作 +2
- 67%
以人为本的人工智能是什么意思?研究领域的地图
CHI '23· 大语言模型(LLM)的人机协作 +2
- 67%
故事的仿真:探讨大型语言模型作为定性研究参与者
CHI '25· 大语言模型(LLM)的人机协作 +2
- 67%
理解多智能体集体中的遵从与转化动态
CHI '26· 大语言模型(LLM)的人机协作 +2
- 67%
"我们这是在为斯波克写建议专栏吗?" 理解人工智能对自闭症用户建议中的刻板印象
CHI '26· 大语言模型(LLM)的人机协作 +2
- 60%
公平的机器指导以提高有偏见人群的公平决策
CHI '24· AI 辅助决策与自动化系统 +1
- 60%
EvAlignUX:通过LLM支持的指标探索提升用户体验评估
CHI '25· 大语言模型(LLM)的人机协作 +1
- 60%
人类与日常AI系统交互中的责任归属
CHI '25· AI 伦理、公平与问责 +1
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)
快捷操作
广告推荐
学习 AI 编程到 CodeNow
open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3613904.3642135
一眼看懂
fact_check论文快照
dataset
来源
CHI
calendar_month
年份
2024
emoji_events
奖项
荣誉提名
group
作者
4 位作者
sell
研究子方向
大语言模型(LLM)的人机协作、AI 伦理、公平与问责
work
职业/产业
HCI 研究员、认知科学家
article
内容状态
已索引正文
hub
相关论文
10 篇相关论文