对话语言模型交互中过度依赖的行为指标

大语言模型(LLM)的人机协作可解释人工智能(XAI)AI 伦理、公平与问责AI/ML 研究员与工程师HCI 研究员

文献标题

Behavioral Indicators of Overreliance During Interaction with Conversational Language Models

出版信息

  • 主题领域: 探讨用户与对话式大型语言模型(LLMs)交互过程中与过度依赖相关的行为模式。
  • 关键词: 过度依赖,对话式LLMs,用户行为,交互模式,错误信息,认知过程,自适应缓解,实时检测,行为聚类,人机协作。

背景与问题

  • 问题/挑战: 用户在与对话式LLMs交互时,常因其流畅且权威的输出而接受错误的AI建议,从而导致过度依赖。现有检测过度依赖的方法主要关注任务结果,无法捕捉交互过程及中间错误。
  • 重要性: 过度依赖可能导致严重错误,削弱人机协作在决策、内容创作和问题解决等关键任务中的有效性。
  • 动机与相关研究: 以往研究通过结果导向的指标和孤立的行为信号探讨过度依赖,但缺乏系统框架来分析交互行为。本研究填补了这一空白,将用户行为与过度依赖关联起来,并实现实时检测与自适应缓解。

解决方案

  • 提出的方法: 基于聚类的分析框架,通过分析用户交互日志识别与过度依赖相关的行为模式。
  • 创新点:
    1. 构建一个将用户交互行为与过度依赖指标关联的数据集。
    2. 开发一个聚类框架,用于量化行为与过度依赖之间的关系。
    3. 识别五种与过度依赖相关的行为模式,并提供认知解释与设计启示。
  • 过程与关键技术:
    1. 进行一项控制实验,77名参与者完成三个任务(答题、文章总结、旅行计划),使用包含错误信息的LLM。
    2. 收集详细的交互日志(如鼠标移动、点击、按键等),并将其处理为特征向量。
    3. 使用基于Transformer的自动编码器将交互序列嵌入到低维表示中。
    4. 应用DBSCAN聚类算法识别重复行为模式,并基于预测能力和一致性验证聚类结果。

结果

  • 具体发现:
    • 识别了五种行为模式:
      1. 高频复制粘贴:过度依赖用户频繁复制粘贴LLM输出内容且不进行编辑。
      2. 专注于任务理解:低依赖用户在与LLM交互前花更多时间理解任务。
      3. 参考LLM响应的频率:过度依赖用户反复查看LLM响应,而低依赖用户更独立完成任务。
      4. 粗粒度与精细粒度定位和编辑:过度依赖用户进行粗略导航和编辑,而低依赖用户进行精确编辑。
      5. 提示前的停顿与犹豫:过度依赖用户在构建后续提示前犹豫,但最终采纳LLM建议。
  • 相较基线的优势: 过程导向的方法捕捉了中间行为和认知策略,而结果导向的方法无法做到这一点。
  • 实验/评估:
    • 任务包括答题、文章总结和旅行计划,注入错误信息以模拟真实世界中的错误。
    • 通过聚类分析行为数据,并结合参与者自我报告和认知解释验证结果。
  • 局限性与未来工作:
    • 人为注入的错误信息可能无法完全模拟自然发生的LLM幻觉。
    • 研究结果局限于特定任务和低风险场景。
    • 未来工作应探索高风险任务、实时检测方法,并结合生理测量进行认知验证。

总结

本研究通过分析用户交互行为探讨对话式LLMs的过度依赖问题。在一项包含77名参与者的控制实验中,识别了五种行为模式,揭示了任务理解、编辑精度和对LLM输出依赖程度的差异。提出的聚类框架实现了过度依赖的实时检测,并为自适应缓解策略提供了支持。尽管研究聚焦于特定任务,其发现为改善人机协作在多种应用中的表现奠定了基础。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/chi/222277/2026

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3772318.3790332
一眼看懂

论文快照

fact_check
dataset
来源
CHI
calendar_month
年份
2026
emoji_events
奖项
未标记奖项
group
作者
6 位作者
sell
研究子方向
大语言模型(LLM)的人机协作、可解释人工智能(XAI)、AI 伦理、公平与问责
work
职业/产业
AI/ML 研究员与工程师、HCI 研究员
article
内容状态
已索引正文
hub
相关论文
10 篇相关论文