为何及何时基于LLM的助手会出错:基于提示的软件求助交互有效性研究

大语言模型(LLM)的人机协作可解释人工智能(XAI)软件工程师与开发者UI/UX 设计师HCI 研究员

大型语言模型(LLM)助手,如ChatGPT,已成为帮助用户导航复杂、功能丰富的软件的搜索方法的潜在替代方案。LLM利用来自领域特定文本、软件手册和代码库的大量训练数据来模仿类人交互,提供定制化帮助,包括分步说明。我们通过16名参与者的被试内实验和后续访谈研究了LLM生成的软件指导。我们将基准LLM助手与针对特定软件上下文优化的LLM助手SoftAIBot进行了比较,后者还提供了构建适当提示的指南。我们评估了任务完成度、感知准确性、相关性和信任度。令人惊讶的是,尽管SoftAIBot优于基准LLM,但我们的结果显示有无提示指南和领域上下文集成在LLM使用和用户感知方面没有显著差异。大多数用户难以理解提示文本与LLM响应之间的关系,并经常逐字遵循LLM的建议,即使这些建议是错误的。这导致使用LLM的软件任务建议时遇到困难,任务完成率较低。我们的详细分析还揭示了用户未意识到LLM响应中的不准确之处,这表明他们的软件专业知识不足与评估LLM帮助能力之间存在差距。随着针对特定领域LLM助手设计的需求不断增长,我们强调在LLM中纳入可解释的、上下文感知线索的重要性,以帮助用户理解基于提示的交互、识别偏差并最大化LLM助手的效用。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/iui/139209/2024

广告推荐

学习 AI 编程到 CodeNow

一眼看懂

论文快照

fact_check
dataset
来源
IUI
calendar_month
年份
2024
emoji_events
奖项
未标记奖项
group
作者
3 位作者
sell
研究子方向
大语言模型(LLM)的人机协作、可解释人工智能(XAI)
work
职业/产业
软件工程师与开发者、UI/UX 设计师、HCI 研究员
article
内容状态
仅摘要
hub
相关论文
10 篇相关论文