理解用户对ChatGPT回答的不满:类型、解决策略与知识水平的影响
具有聊天能力的大型语言模型(如ChatGPT)广泛应用于各种工作流程。然而,由于对这些大规模模型的有限理解,用户难以使用此技术并经历不同类型的不满。研究人员已引入了几种方法来改进模型响应,如提示工程。然而,他们专注于增强模型在特定任务中的性能,关于如何处理用户对模型响应产生的不满,则研究甚少。因此,以ChatGPT为案例研究,我们研究了用户的不满以及他们解决不满的策略。在根据文献综述将用户对LLM的不满组织为七类后,我们从107名用户那里收集了511个不满意的ChatGPT响应实例以及他们对不满意体验的详细回忆,并将其作为公开可访问的数据集发布。我们的分析表明,当ChatGPT未能理解用户意图时,用户经历不满的频率最高,而他们认为与准确性相关的不满严重程度最高。我们还确定了用户为解决不满而采用的四种策略及其有效性。我们发现用户通常不使用任何策略来解决不满,即使使用策略,72%的不满仍未得到解决。此外,我们发现低LLM知识水平的用户往往面临更多与准确性相关的不满,而他们在解决不满方面投入的努力通常较少。基于这些发现,我们提出了最小化用户不满和增强基于聊天的LLM可用性的设计含义。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
- 67%
Rapsai:通过可视化编程加速多媒体应用程序的机器学习原型设计
CHI '23· 大语言模型(LLM)的人机协作 +1
- 67%
使用大型语言模型实现与移动UI的对话交互
CHI '23· 语音用户界面(VUI)设计 +1
- 67%
MUD:面向大规模和噪声过滤的现代风格UI建模UI数据集
CHI '24· 生成式AI(文本、图像、音乐、视频) +1
- 67%
"如果机器和我一样好,那我还有什么用?" – 使用ChatGPT如何改变年轻专业人士对生产力和成就的看法
CHI '24· 大语言模型(LLM)的人机协作 +1
- 67%
超越自动化:设计师如何将AI视为UI/UX设计发散思维阶段的创意伙伴
CHI '25· 360° 视频与全景内容 +1
- 67%
生产性与反思性:将AI整合到设计工作流程的不同方式如何影响认知和动机
CHI '25· 大语言模型(LLM)的人机协作 +1
- 67%
生成式AI的角色如何影响人机协作工作中价值感知
CHI '25· 生成式AI(文本、图像、音乐、视频) +1
- 67%
LADICA:用于共位团队协作中生成式AI认知辅助的大共享显示接口
CHI '25· 大语言模型(LLM)的人机协作 +1
- 67%
交易数据设计:FTML与金钱/数据洗钱
DIS '24· 算法公平与偏见 +1
- 67%
「这对我也会有效」:在线社区如何影响软件开发人员对AI驱动的代码生成工具的信任
IUI '25· 大语言模型(LLM)的人机协作 +1
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)