基于LLM的搜索对决策制定的影响:速度、准确性和过度依赖

大语言模型(LLM)的人机协作可解释人工智能(XAI)AI 辅助决策与自动化系统UI/UX 设计师AI/ML 研究员与工程师HCI 研究员

研究背景与问题

  • 问题与挑战: 该论文研究了基于大型语言模型(LLM)的搜索工具如何影响决策过程,特别是在速度、准确性和过度依赖的方面。传统搜索工具限制了用户在处理复杂的查询时的效率,而LLM搜索工具虽然显著提升了用户体验,却可能因“幻觉”现象(即生成无事实依据的信息)导致用户错误决策。

  • 重要性: 随着LLM技术在在线工具中的广泛应用,这些工具正在改变数十亿用户的搜索与决策行为。作为信息检索的重要入口,搜索工具对决策质量的影响需要被深入了解,尤其是在高价值任务(如购买汽车)场景中。

  • 研究动机与相关工作: 作者回顾了LLM在提高生产力(如写作、编程等)方面的潜力,同时提到这些工具制造虚假内容以及用户对其过度信任的风险。此外,研究为过度依赖提供了设计干预的可能性,并讨论了如何通过视觉信号(如色彩编码)来减轻这种现象。

解决方案

  • 方法或解决方案: 作者通过两次在线实验比较了传统搜索工具与LLM搜索工具的性能,并在第二次实验中测试了一种色彩编码(利用模型生成的信息置信度)来减少用户对低可信度输出的依赖。

  • 创新之处:

    1. 研究了LLM对用户复杂查询处理效率与决策质量的直接影响。
    2. 提出和验证了一种基于置信度的视觉反馈机制,通过简单的颜色编码提示用户防范LLM生成的潜在错误信息。
    3. 高度控制研究变量,包括LLM配置为零“temperature”,确保输出一致性。
  • 实施步骤与关键技术:

    1. 实验1: 比较LLM搜索工具与传统搜索工具在完成任务的效率、查询数量与复杂度以及决策准确性上的差异。
      • 让用户完成一系列汽车对比任务(基于货运空间与总长度比率进行选择)。
      • 记录用户查询的时间、数量、复杂度以及最终决策。
    2. 实验2: 探讨颜色编码视觉提示对用户识别LLM低可信度信息影响。
      • 将实验分为三个组:无提示组、仅低置信度提示组和高低置信度皆提示组。
      • 使用GPT-3提供置信度生成概率(>50%为高置信度,≤50%为低置信度)。

研究成果

  • 具体成果:

    1. 使用LLM搜索工具显著提高了完成任务的速度,用户通过更少的但更复杂的查询完成任务。
    2. 相比传统搜索,LLM虽然在正常任务中表现相近,但当LLM生成错误信息时,用户误选比例显著增加,表现出对错误信息的过度依赖。
    3. 色彩编码机制有效提高了用户判断错误信息的能力,任务准确性提高超70%。
  • 优势: 与传统搜索相比,LLM搜索工具显著改善了查询效率与用户体验。在实施提示机制后,用户在检测错误信息时表现出了更高水平的主动性,从而减轻了工具“幻觉”效应的影响。

  • 实验或评估结果:

    1. 实验1: LLM搜索工具比传统搜索节省了约50%时间,查询复杂度更高,但未能显著降低错误率。在错误场景下,传统搜索工具的正确率保持在93%,而LLM仅为47%(任务5)。
    2. 实验2: 色彩编码提高了有错误信息场景中的准确性,两种提示组分别达到58%和53%的正确率,而无提示组仅为26%。
    3. 用户满意度方面,虽然两种搜索工具在可靠性评分上差异不大,但使用LLM的用户更满意整体搜索体验。
  • 局限性与未来方向:

    • 局限性:

      1. 实验仅在汽车购买场景中进行,未覆盖更复杂或开放式决策任务。
      2. 开发工具时,未使用具有会话能力的LLM模型(如Bing Chat或Google Gemini)。
      3. 使用特定置信度提示(颜色编码),未比较其他提示机制(如置信度评分或附带来源链接)。
    • 未来方向:

      1. 开展更多开放性任务研究,例如涉及复杂搜索目标的交互体验。
      2. 应用新的LLM模型(如结合传统搜索与LLM的检索增强生成方法)。
      3. 探索丰富的提示设计,如自然语言形式表达不确定性或动态生成置信度评分。
      4. 研究不同用户群体是否对置信度提示有差异化需求,例如基于用户的教育水平或技术熟练度调整提示信息设计。

通过这项研究,作者展示了LLM搜索工具在信息检索领域的巨大潜力,同时为设计更具可靠性与用户适应性的智能搜索工具提供了重要指导。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/chi/188754/2025

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://dl.acm.org/doi/10.1145/3706598.3714082
一眼看懂

论文快照

fact_check
dataset
来源
CHI
calendar_month
年份
2025
emoji_events
奖项
未标记奖项
group
作者
4 位作者
sell
研究子方向
大语言模型(LLM)的人机协作、可解释人工智能(XAI)、AI 辅助决策与自动化系统
work
职业/产业
UI/UX 设计师、AI/ML 研究员与工程师、HCI 研究员
article
内容状态
已索引正文
hub
相关论文
10 篇相关论文