基于LLM的搜索对决策制定的影响:速度、准确性和过度依赖
研究背景与问题
-
问题与挑战: 该论文研究了基于大型语言模型(LLM)的搜索工具如何影响决策过程,特别是在速度、准确性和过度依赖的方面。传统搜索工具限制了用户在处理复杂的查询时的效率,而LLM搜索工具虽然显著提升了用户体验,却可能因“幻觉”现象(即生成无事实依据的信息)导致用户错误决策。
-
重要性: 随着LLM技术在在线工具中的广泛应用,这些工具正在改变数十亿用户的搜索与决策行为。作为信息检索的重要入口,搜索工具对决策质量的影响需要被深入了解,尤其是在高价值任务(如购买汽车)场景中。
-
研究动机与相关工作: 作者回顾了LLM在提高生产力(如写作、编程等)方面的潜力,同时提到这些工具制造虚假内容以及用户对其过度信任的风险。此外,研究为过度依赖提供了设计干预的可能性,并讨论了如何通过视觉信号(如色彩编码)来减轻这种现象。
解决方案
-
方法或解决方案: 作者通过两次在线实验比较了传统搜索工具与LLM搜索工具的性能,并在第二次实验中测试了一种色彩编码(利用模型生成的信息置信度)来减少用户对低可信度输出的依赖。
-
创新之处:
- 研究了LLM对用户复杂查询处理效率与决策质量的直接影响。
- 提出和验证了一种基于置信度的视觉反馈机制,通过简单的颜色编码提示用户防范LLM生成的潜在错误信息。
- 高度控制研究变量,包括LLM配置为零“temperature”,确保输出一致性。
-
实施步骤与关键技术:
- 实验1: 比较LLM搜索工具与传统搜索工具在完成任务的效率、查询数量与复杂度以及决策准确性上的差异。
- 让用户完成一系列汽车对比任务(基于货运空间与总长度比率进行选择)。
- 记录用户查询的时间、数量、复杂度以及最终决策。
- 实验2: 探讨颜色编码视觉提示对用户识别LLM低可信度信息影响。
- 将实验分为三个组:无提示组、仅低置信度提示组和高低置信度皆提示组。
- 使用GPT-3提供置信度生成概率(>50%为高置信度,≤50%为低置信度)。
- 实验1: 比较LLM搜索工具与传统搜索工具在完成任务的效率、查询数量与复杂度以及决策准确性上的差异。
研究成果
-
具体成果:
- 使用LLM搜索工具显著提高了完成任务的速度,用户通过更少的但更复杂的查询完成任务。
- 相比传统搜索,LLM虽然在正常任务中表现相近,但当LLM生成错误信息时,用户误选比例显著增加,表现出对错误信息的过度依赖。
- 色彩编码机制有效提高了用户判断错误信息的能力,任务准确性提高超70%。
-
优势: 与传统搜索相比,LLM搜索工具显著改善了查询效率与用户体验。在实施提示机制后,用户在检测错误信息时表现出了更高水平的主动性,从而减轻了工具“幻觉”效应的影响。
-
实验或评估结果:
- 实验1: LLM搜索工具比传统搜索节省了约50%时间,查询复杂度更高,但未能显著降低错误率。在错误场景下,传统搜索工具的正确率保持在93%,而LLM仅为47%(任务5)。
- 实验2: 色彩编码提高了有错误信息场景中的准确性,两种提示组分别达到58%和53%的正确率,而无提示组仅为26%。
- 用户满意度方面,虽然两种搜索工具在可靠性评分上差异不大,但使用LLM的用户更满意整体搜索体验。
-
局限性与未来方向:
-
局限性:
- 实验仅在汽车购买场景中进行,未覆盖更复杂或开放式决策任务。
- 开发工具时,未使用具有会话能力的LLM模型(如Bing Chat或Google Gemini)。
- 使用特定置信度提示(颜色编码),未比较其他提示机制(如置信度评分或附带来源链接)。
-
未来方向:
- 开展更多开放性任务研究,例如涉及复杂搜索目标的交互体验。
- 应用新的LLM模型(如结合传统搜索与LLM的检索增强生成方法)。
- 探索丰富的提示设计,如自然语言形式表达不确定性或动态生成置信度评分。
- 研究不同用户群体是否对置信度提示有差异化需求,例如基于用户的教育水平或技术熟练度调整提示信息设计。
-
通过这项研究,作者展示了LLM搜索工具在信息检索领域的巨大潜力,同时为设计更具可靠性与用户适应性的智能搜索工具提供了重要指导。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
研究问题
3- LLM(大语言模型)搜索工具如何影响用户在复杂查询中的效率、准确性和决策质量?分类: LLM 信任与过度/不足依赖同类问题arrow_forward
- 设计一种基于置信度视觉反馈机制(如颜色编码)是否能减少用户对低置信度信息的过度依赖?分类: LLM 信任与过度/不足依赖同类问题arrow_forward
- 在什么情况下,LLM生成的错误信息会显著增加用户的决策错误率?分类: LLM 信任与过度/不足依赖同类问题arrow_forward
现实痛点
1- 使用LLM工具时,用户容易依赖错误信息,导致决策失误。分类: LLM 信任与过度/不足依赖同类问题arrow_forward
- 100%
用户如何看待混合主动AI:问题解决中协助的态度研究
IUI '26· 大语言模型(LLM)的人机协作 +2
- 86%
使用生成式AI创建和评估人物角色:对81篇文章的范围性综述
CHI '26· 生成式AI(文本、图像、音乐、视频) +3
- 86%
文本到图像生成中默认图像的探索
CHI '26· 生成式AI(文本、图像、音乐、视频) +3
- 86%
设计反馈:理解并克服对话智能体中用户反馈障碍
CHI '26· 大语言模型(LLM)的人机协作 +3
- 83%
设计思维理解:支持AI赋能的用户体验设计构思的模型透明度信息需求
CHI '23· 大语言模型(LLM)的人机协作 +2
- 83%
哪些贡献值得认可?人类与AI共同创作中的归属感认知
CHI '25· 大语言模型(LLM)的人机协作 +2
- 83%
共同揭示计算机:通过反思性对话实现 LLM 媒介的计算
CHI '26· 大语言模型(LLM)的人机协作 +2
- 83%
AI能为我做什么: 评估合作游戏中机器学习解释的效果
IUI '19· 大语言模型(LLM)的人机协作 +2
- 83%
CAIM:面向智能智能体长期交互的认知 AI 记忆框架的开发与评估
IUI '26· 大语言模型(LLM)的人机协作 +2
- 83%
用户对协作伙伴选择中 AI 辅助的依赖性研究
IUI '26· 大语言模型(LLM)的人机协作 +2
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)