评估非AI专家与AI的互动:图书馆环境中的一个案例研究
研究背景与问题
-
问题或挑战: 公共图书馆面临着劳动力短缺、预算紧张和员工超负荷的问题,需要24/7的应答解决方案,如会话代理(Conversational Agents, CAs)来协助解决这些问题。然而,当前的CA开发需要专业的AI开发者和编程技能,而图书馆工作人员多数不具备这些能力。另外,图书馆运营环境的特点(如低风险、社区化服务)对AI解决方案提出了定制化的需求,但现有的研究对于非AI专家的CA设计需求和评估仍缺乏深入探索。
-
重要性: 图书馆是社区建设和知识共享的重要场所,例如为数字接入、信息支持、和教育活动提供服务。通过让图书馆专业人员能够创建自己的CA,有助于减轻员工负担、提高服务效率,并强化图书馆的社会责任和价值。
-
研究动机与相关工作: 研究旨在弥补关于非AI专家开发定制化CA的设计需求和评价标准的研究空白。相关研究已探讨会话代理在高风险环境(如医护、应急服务)中的设计,但对于低风险环境(如图书馆)的CA开发仍缺乏解决方案。生成式AI的民主化提供了新的机会,使非AI专家可以使用工具创建CA,同时需要适应社区差异和个性化需求。
解决方案
-
提出的解决方案: 作者设计了一个原型工具 AgentBuilder,它是一个支持非AI专家创建会话代理的无代码开发平台。其目标是满足图书馆专业人员定义、定制和评估CA的需求。
-
创新之处: AgentBuilder支持以下功能模块:
- 边界设定模块: 帮助用户定义CA服务范围和角色,通过上传知识库文件和个性化设置来构建基础服务框架。
- 知识同步模块: 提供知识透明和编辑功能,使图书馆专业人员能够审查和修改CA的回应质量,形成「人机交互学习」。
- 角色模拟评估模块: 使用虚拟角色进行交互模拟,测试CA在多样化用户需求下的适应能力。
-
实施步骤及技术:
- 用户可上传PDF文档以构建知识库。
- 使用自然语言提示定义CA角色和行为,使非AI用户能够通过简单的对话式设置定制代理。
- RAG(检索增强生成)框架用于将用户上传的内容和AI内部知识结合,增强回答的准确性。
- 通过模拟功能,用户可以观察CA与虚拟用户之间的交互,从而迭代地调整和优化CA的行为。
研究成果
-
具体成果:
- 通过两个用户研究(共23名参与者),识别了非AI专家在图书馆环境中创建CA的三大设计目标:
- 目标1: 保留对CA服务范围的控制;
- 目标2: 确保AI回应能通过协同过程与图书馆专业人员的期望对齐;
- 目标3: 应对多样化用户群体并涵盖不同场景需求。
- 确定了图书馆专业人员评估CA的重要标准,包括正确理解用户意图、精准引用知识源、情感表达的契合度、忠实转述原文信息和处理 "未知回答" 的有效性。
- 通过两个用户研究(共23名参与者),识别了非AI专家在图书馆环境中创建CA的三大设计目标:
-
优势与比较: 与现有的商业性CA工具相比,AgentBuilder更加适配非技术用户,允许他们完全掌控定制化过程。同时,这一工具加强了AI对社区需求的灵活性及透明性。
-
实验结果与局限: 用户评价AgentBuilder功能较为直观,但存在一些局限:
- 依赖用户上传文档的内容完整性;部分元素(如图像或不完全描述)可能导致回答失准。
- 为AI设计递归式沟通能力(如后续澄清问题)仍是技术性挑战。
- 用户提示设计过于依赖精准输入,使某些非熟练用户难以有效使用。
-
未来方向:
- 扩展研究范围至其他公共服务领域(如医疗、教育)。
- 提升系统自动化能力,减少用户迭代过程中的时间投入。
- 在角色模拟中增强代理对非正式语言的适应能力,接近真实世界对话。
- 开发专为非AI专家设计的全方位指导工具,如预设模板和提示框架。
通过本研究,作者不仅为图书馆服务设计提出了有效的CA创建工具,还探索了在低风险环境中使用生成式AI的最佳实践,为AI民主化和多领域应用提供了重要指导。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
研究问题
3- 如何支持非AI专家的图书馆工作人员开发定制化的对话代理(CAs)?分类: 知识问答、论文阅读与虚拟助手同类问题arrow_forward
- 图书馆工作人员在开发对话代理时,有哪些关键的设计需求和评估标准?分类: 知识问答、论文阅读与虚拟助手同类问题arrow_forward
- 如何通过无代码工具提升对话代理的透明度和灵活度,以更好地满足社区需求?分类: 知识问答、论文阅读与虚拟助手同类问题arrow_forward
现实痛点
1- 图书馆工作人员难以开发适合其服务需求的对话代理。分类: 知识问答、论文阅读与虚拟助手同类问题arrow_forward
- 67%
对话智能体设计中的趋势、挑战与流程:基于半结构化访谈的实践者观点探讨
CUI '23· 对话式聊天机器人 +1
- 60%
Tap&Say:结合触摸位置的大型语言模型,用于智能手机上的多模态文本校正
CHI '25· 大语言模型(LLM)的人机协作
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)