LLM-box 与 Thinking-box:设计支持用户主动识别对话搜索中失真信息的研究

大语言模型(LLM)的人机协作可解释人工智能(XAI)对话式搜索与问答系统AI/ML 研究员与工程师软件工程师与开发者HCI 研究员

文献标题

LLM-box vs. Thinking-box: Designing for Deliberate User Engagement with Distorted Information in Conversational Search

出版信息

  • 主题领域: 用户层面的干预措施,以减轻由大型语言模型(LLMs)驱动的会话式搜索中的信息失真问题。
  • 关键词: 会话式搜索、大型语言模型、幻觉、信息失真、用户参与、反思性提示、深思熟虑的信息寻求、信任校准、认知负荷。

背景与问题

  • 问题/挑战: 在会话式搜索中,LLM生成的响应通常包含失真的信息,由于输出的流畅性和说服力,用户难以识别这些失真。技术性缓解措施虽然降低了幻觉发生率,但无法完全消除信息失真。
  • 重要性: 会话式搜索中的信息失真会影响决策、学习和探索,因此需要在用户层面提供支持,以促进批判性参与并减轻风险。
  • 动机与相关研究: 之前的研究探索了技术解决方案,例如检索增强和置信度评分,以及鼓励批判性思维的反思性提示。然而,这些方法通常专注于检测准确性或信任校准,忽略了用户在现实场景中如何感知和交互这些功能。

解决方案

  • 提出的方法: 两种用户层面的干预措施——LLM-box(置信度评分和描述)和Thinking-box(以反思为导向的检查点),以支持用户对LLM响应的深思熟虑参与。
  • 创新点:
    1. 对技术性和用户层面方法在缓解信息失真方面进行比较评估。
    2. 将幻觉分类法整合到反思性提示中,为用户提供指导。
    3. 提供干预措施如何影响用户参与、认知负荷和检测准确性的实证证据。
  • 过程与关键技术:
    • 开发了三个系统:基线(标准LLM界面)、LLM-box(置信度评分和描述)以及Thinking-box(句子级反思性提示)。
    • 使用包含注释失真的预生成LLM响应,进行16名参与者的组内研究。
    • 通过调查问卷、思维大声说出会话和访谈,测量检测准确性、任务完成时间以及用户感知。

结果

  • 具体发现:
    • Thinking-box实现了最高的检测准确性(真阳性↑),但增加了认知负荷(完成时间↑)。
    • LLM-box降低了认知努力,但导致更多的假阳性,并限制了用户的自主性。
    • 两种干预措施相比基线均提高了对失真信息的意识。
  • 相较基线的优势:
    • Thinking-box显著减少了漏检失真(假阴性↓),并促进了更深层次的参与。
    • LLM-box提高了对失真信息的意识,但限制了用户对标记内容之外的探索。
  • 实验/评估:
    • 在三个系统中随机和均衡分配了九项任务。
    • 定量指标:检测准确性(TP、FP、FN)、任务完成时间。
    • 定性洞察:用户策略、信任校准以及对指导的偏好。
  • 局限性与未来工作:
    • 人口统计多样性有限(年轻成人、熟悉LLM的参与者)。
    • 预生成内容缺乏实时会话动态。
    • 未来研究应探索更广泛的用户群体、话语层面的指导以及反思性提示的长期效果。

总结

本研究比较了两种干预措施——LLM-box和Thinking-box,以支持用户更批判性地参与会话式搜索中的失真信息。Thinking-box提高了检测准确性并促进了深思熟虑的参与,但增加了认知负荷;而LLM-box降低了努力但限制了用户的自主性。两种方法相比基线界面均增强了对失真信息的意识。研究结果表明,用户层面的干预措施可以通过搭建反思框架来补充技术解决方案,同时不削弱用户的自主性。设计启示包括将指导框架设为建议性、分层信息并优先排序,以及将提示定位为不干扰的中断。未来系统应在便利性与建设性努力之间找到平衡,以维持长期的批判性参与。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/chi/222113/2026

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3772318.3790271
一眼看懂

论文快照

fact_check
dataset
来源
CHI
calendar_month
年份
2026
emoji_events
奖项
未标记奖项
group
作者
3 位作者
sell
研究子方向
大语言模型(LLM)的人机协作、可解释人工智能(XAI)、对话式搜索与问答系统
work
职业/产业
AI/ML 研究员与工程师、软件工程师与开发者、HCI 研究员
article
内容状态
已索引正文
hub
相关论文
10 篇相关论文