响应延迟和任务类型对人类-LLM 交互与感知的影响
大语言模型(LLM)的人机协作可解释人工智能(XAI)AI 辅助决策与自动化系统AI/ML 研究员与工程师HCI 研究员软件工程师与开发者
文献标题
The Impact of Response Latency and Task Type on Human-LLM Interaction and Perception
出版信息
- 主题领域: 人机交互,聚焦于延迟对基于LLM的知识工作影响。
- 关键词: 响应延迟,人机交互,任务类型,感知质量,交互设计,认知负荷,AI信任,用户行为,积极摩擦,知识工作。
背景与问题
- 问题/挑战: 尽管延迟是LLM用户体验中的关键因素,但其在不同任务类型下对用户行为和感知的细微影响尚未被深入研究。
- 重要性: 理解延迟的影响可以为LLM系统设计提供指导,从而优化用户满意度、信任度和任务效率,特别是在LLM逐渐成为知识工作核心工具的背景下。
- 动机与相关研究: 以往HCI研究将延迟视为需要最小化的成本,主要关注可用性阈值。然而,LLM的对话性和概率性动态为等待时间引入了新的解释维度,例如将延迟拟人化为“思考时间”。本研究旨在填补延迟如何与任务类型交互以影响用户行为和感知的研究空白。
解决方案
- 提出的方法: 设计一个2 × 3的对照实验,研究延迟(2秒、9秒、20秒)和任务类型(创作、建议)对人机交互和感知的影响。
- 创新点:
- 提供实证证据表明任务类型比延迟对交互行为的影响更大,而延迟则影响对响应质量的感知。
- 提出将延迟作为可调节的交互变量,而非仅仅视为需要最小化的成本。
- 开发了一个可复用的实验平台,用于研究LLM交互中的延迟效应。
- 实验流程与关键技术:
- 招募240名参与者完成三项任务(创作或建议类别),与基于GPT-4的助手在固定延迟条件下(2秒、9秒或20秒)进行交互。
- 收集行为数据(如提示提交次数、复制粘贴行为)和主观评分(如清晰度、实用性)。
- 使用统计分析(如ANOVA)和定性反馈的主题编码评估延迟和任务类型的影响。
结果
- 具体发现:
- 创作任务比建议任务引发更多的提示提交(M=6.20 vs. M=5.14),与延迟无关。
- 短延迟(2秒)被评价为不够深思熟虑和实用,相比之下,中等延迟(9秒)和长延迟(20秒)评分更高。
- 中等延迟(9秒)获得最高的实用性评分,而非常长的延迟(20秒)有时会引发可靠性担忧。
- 参与者经常将延迟解读为AI的“深思熟虑”,从而增强了对其思考性的感知。
- 相较基线的优势:
- 证明了延迟效应并非线性,中等延迟相比非常短的等待时间能提升感知质量。
- 突出了任务特定的交互模式,创作任务比建议任务引发更多的迭代提示。
- 实验/评估:
- 设计: 2 × 3被试间实验。
- 数据集: 从先前HCI/AI研究中改编的创作和建议任务。
- 评估指标: 行为日志(如提示次数)、主观评分(如清晰度、实用性)和NASA-TLX工作负荷评分。
- 局限性与未来工作:
- 仅关注首次令牌生成的延迟,未来研究应探索其他时间因素(如流式生成速度、总响应时间)。
- 在受控环境中进行,实际的时间敏感场景可能会产生不同结果。
- 仅限于具有高数字熟悉度的美国参与者,未来研究应考察文化和人口多样性对结果的影响。
总结
本研究探讨了响应延迟和任务类型如何影响用户与LLM的交互行为。交互行为对延迟具有鲁棒性,但在不同任务类型间差异显著,创作任务比建议任务引发更多提示提交。响应质量的感知受延迟影响,中等延迟(9秒)提升了实用性和思考性的感知,而非常短(2秒)和非常长(20秒)的延迟评价较低。这些发现表明,延迟可以作为设计变量而非需要最小化的成本,具有任务特定调整和LLM系统伦理设计的意义。未来研究应探索更复杂的实际场景中的延迟效应。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
当前问题库还没有收录这篇论文的问题与痛点。
- 100%
看不见的破坏者:谄媚型大语言模型在问题解决任务中误导新手
CHI '26· 大语言模型(LLM)的人机协作 +2
- 100%
与我共编还是为我编程?AI 自动化程度提升如何改变开发者工作流
CHI '26· 大语言模型(LLM)的人机协作 +2
- 86%
DiLLS:基于智能体行为分层摘要的LLM多智能体系统交互式诊断
CHI '26· 大语言模型(LLM)的人机协作 +3
- 86%
当帮助变成伤害:AI编码助手的验证负荷与疲劳
CHI '26· 大语言模型(LLM)的人机协作 +3
- 83%
胜任但僵化:识别赋予AI平等参与群体决策能力的差距
CHI '23· 大语言模型(LLM)的人机协作 +1
- 83%
为什么约翰尼不能提示:非AI专家如何尝试(并失败)设计LLM提示
CHI '23· 大语言模型(LLM)的人机协作 +1
- 83%
《你真的确定吗?》理解人类自我信心校准在人工智能辅助决策中的影响
CHI '24· 可解释人工智能(XAI) +1
- 83%
从大规模交互痕迹中自动挖掘宏命令
CHI '24· 大语言模型(LLM)的人机协作 +1
- 83%
多智能体AI系统的交互式调试和引导
CHI '25· 大语言模型(LLM)的人机协作 +2
- 83%
哪些贡献值得认可?人类与AI共同创作中的归属感认知
CHI '25· 大语言模型(LLM)的人机协作 +2
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)
快捷操作
广告推荐
学习 AI 编程到 CodeNow
open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3772318.3790716
一眼看懂
fact_check论文快照
dataset
来源
CHI
calendar_month
年份
2026
emoji_events
奖项
未标记奖项
group
作者
4 位作者
sell
研究子方向
大语言模型(LLM)的人机协作、可解释人工智能(XAI)、AI 辅助决策与自动化系统
work
职业/产业
AI/ML 研究员与工程师、HCI 研究员、软件工程师与开发者
article
内容状态
已索引正文
hub
相关论文
10 篇相关论文