为何及何时基于LLM的助手会出错:基于提示的软件求助交互有效性研究
大型语言模型(LLM)助手,如ChatGPT,已成为帮助用户导航复杂、功能丰富的软件的搜索方法的潜在替代方案。LLM利用来自领域特定文本、软件手册和代码库的大量训练数据来模仿类人交互,提供定制化帮助,包括分步说明。我们通过16名参与者的被试内实验和后续访谈研究了LLM生成的软件指导。我们将基准LLM助手与针对特定软件上下文优化的LLM助手SoftAIBot进行了比较,后者还提供了构建适当提示的指南。我们评估了任务完成度、感知准确性、相关性和信任度。令人惊讶的是,尽管SoftAIBot优于基准LLM,但我们的结果显示有无提示指南和领域上下文集成在LLM使用和用户感知方面没有显著差异。大多数用户难以理解提示文本与LLM响应之间的关系,并经常逐字遵循LLM的建议,即使这些建议是错误的。这导致使用LLM的软件任务建议时遇到困难,任务完成率较低。我们的详细分析还揭示了用户未意识到LLM响应中的不准确之处,这表明他们的软件专业知识不足与评估LLM帮助能力之间存在差距。随着针对特定领域LLM助手设计的需求不断增长,我们强调在LLM中纳入可解释的、上下文感知线索的重要性,以帮助用户理解基于提示的交互、识别偏差并最大化LLM助手的效用。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
- 67%
振动人工微妙表达:通过智能手机振动向用户传达系统的信心水平
CHI '18· 振动反馈与皮肤刺激 +1
- 67%
用于概念图的人机协作编辑工具
CHI '23· 大语言模型(LLM)的人机协作 +1
- 67%
从文本到自我:用户对AIMC工具在人际沟通和自我认知中的感知
CHI '24· 多语言与跨文化语音交互 +2
- 67%
Luminate:大型语言模型在人机协同创作中对设计空间的结构化生成与探索
CHI '24· 大语言模型(LLM)的人机协作 +1
- 67%
促进对大型语言模型的适当依赖:解释、来源和不一致性的角色
CHI '25· 大语言模型(LLM)的人机协作 +1
- 67%
对话智能体设计中的趋势、挑战与流程:基于半结构化访谈的实践者观点探讨
CUI '23· 对话式聊天机器人 +1
- 67%
缓解自由形式对话中LLM驱动智能虚拟体的响应延迟
CUI '25· VR 中的社交与协作 +1
- 67%
PDFChatAnnotator:用于PDF格式目录的人机协作多模态数据标注工具
IUI '24· 大语言模型(LLM)的人机协作 +1
- 67%
FigurA11y:用于撰写科学替代文本的AI辅助工具
IUI '24· 可解释人工智能(XAI) +1
- 67%
AI意识如何影响人机协作设计的探索性研究
IUI '25· 大语言模型(LLM)的人机协作 +1
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)