对话语言模型交互中过度依赖的行为指标
作者
大语言模型(LLM)的人机协作可解释人工智能(XAI)AI 伦理、公平与问责AI/ML 研究员与工程师HCI 研究员
文献标题
Behavioral Indicators of Overreliance During Interaction with Conversational Language Models
出版信息
- 主题领域: 探讨用户与对话式大型语言模型(LLMs)交互过程中与过度依赖相关的行为模式。
- 关键词: 过度依赖,对话式LLMs,用户行为,交互模式,错误信息,认知过程,自适应缓解,实时检测,行为聚类,人机协作。
背景与问题
- 问题/挑战: 用户在与对话式LLMs交互时,常因其流畅且权威的输出而接受错误的AI建议,从而导致过度依赖。现有检测过度依赖的方法主要关注任务结果,无法捕捉交互过程及中间错误。
- 重要性: 过度依赖可能导致严重错误,削弱人机协作在决策、内容创作和问题解决等关键任务中的有效性。
- 动机与相关研究: 以往研究通过结果导向的指标和孤立的行为信号探讨过度依赖,但缺乏系统框架来分析交互行为。本研究填补了这一空白,将用户行为与过度依赖关联起来,并实现实时检测与自适应缓解。
解决方案
- 提出的方法: 基于聚类的分析框架,通过分析用户交互日志识别与过度依赖相关的行为模式。
- 创新点:
- 构建一个将用户交互行为与过度依赖指标关联的数据集。
- 开发一个聚类框架,用于量化行为与过度依赖之间的关系。
- 识别五种与过度依赖相关的行为模式,并提供认知解释与设计启示。
- 过程与关键技术:
- 进行一项控制实验,77名参与者完成三个任务(答题、文章总结、旅行计划),使用包含错误信息的LLM。
- 收集详细的交互日志(如鼠标移动、点击、按键等),并将其处理为特征向量。
- 使用基于Transformer的自动编码器将交互序列嵌入到低维表示中。
- 应用DBSCAN聚类算法识别重复行为模式,并基于预测能力和一致性验证聚类结果。
结果
- 具体发现:
- 识别了五种行为模式:
- 高频复制粘贴:过度依赖用户频繁复制粘贴LLM输出内容且不进行编辑。
- 专注于任务理解:低依赖用户在与LLM交互前花更多时间理解任务。
- 参考LLM响应的频率:过度依赖用户反复查看LLM响应,而低依赖用户更独立完成任务。
- 粗粒度与精细粒度定位和编辑:过度依赖用户进行粗略导航和编辑,而低依赖用户进行精确编辑。
- 提示前的停顿与犹豫:过度依赖用户在构建后续提示前犹豫,但最终采纳LLM建议。
- 识别了五种行为模式:
- 相较基线的优势: 过程导向的方法捕捉了中间行为和认知策略,而结果导向的方法无法做到这一点。
- 实验/评估:
- 任务包括答题、文章总结和旅行计划,注入错误信息以模拟真实世界中的错误。
- 通过聚类分析行为数据,并结合参与者自我报告和认知解释验证结果。
- 局限性与未来工作:
- 人为注入的错误信息可能无法完全模拟自然发生的LLM幻觉。
- 研究结果局限于特定任务和低风险场景。
- 未来工作应探索高风险任务、实时检测方法,并结合生理测量进行认知验证。
总结
本研究通过分析用户交互行为探讨对话式LLMs的过度依赖问题。在一项包含77名参与者的控制实验中,识别了五种行为模式,揭示了任务理解、编辑精度和对LLM输出依赖程度的差异。提出的聚类框架实现了过度依赖的实时检测,并为自适应缓解策略提供了支持。尽管研究聚焦于特定任务,其发现为改善人机协作在多种应用中的表现奠定了基础。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
当前问题库还没有收录这篇论文的问题与痛点。
- 100%
复数系统:通过模拟社交群体引导大语言模型的系统
CHI '25· 大语言模型(LLM)的人机协作 +2
- 83%
设计负责任的人工智能:适应UX实践以应对负责任的人工智能挑战
CHI '23· 大语言模型(LLM)的人机协作 +2
- 83%
LLM 输出对启发式诱导提示结构的脆弱性
IUI '26· 大语言模型(LLM)的人机协作 +2
- 80%
交互式知识获取中避免过拟合的用户建模方法
IUI '18· 大语言模型(LLM)的人机协作 +1
- 80%
DxHF:通过交互式分解为LLM对齐提供高质量人类反馈
UIST '25· 大语言模型(LLM)的人机协作 +1
- 71%
谁控制对话?用户对生成式AI(LLM)系统提示的看法
CHI '26· 大语言模型(LLM)的人机协作 +3
- 71%
全接受,无拒绝:评估大型语言模型作为「同行」评审者的表现
CHI '26· 大语言模型(LLM)的人机协作 +3
- 71%
使用 GPT 对话智能体模拟人群选择行为与偏见
CHI '26· 大语言模型(LLM)的人机协作 +3
- 71%
跨LLM聊天机器人用户报告风险的表征分析
CHI '26· 大语言模型(LLM)的人机协作 +3
- 71%
AI与我的价值观:用户对LLM从休闲对话中提取、体现和解释人类价值观能力的看法
CHI '26· 大语言模型(LLM)的人机协作 +3
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)
快捷操作
广告推荐
学习 AI 编程到 CodeNow
open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3772318.3790332
一眼看懂
fact_check论文快照
dataset
来源
CHI
calendar_month
年份
2026
emoji_events
奖项
未标记奖项
group
作者
6 位作者
sell
研究子方向
大语言模型(LLM)的人机协作、可解释人工智能(XAI)、AI 伦理、公平与问责
work
职业/产业
AI/ML 研究员与工程师、HCI 研究员
article
内容状态
已索引正文
hub
相关论文
10 篇相关论文