结果-可行动性差距:理解从业者如何在实际环境中评估 LLM 产品
作者
大语言模型(LLM)的人机协作AI 辅助决策与自动化系统可解释人工智能(XAI)AI/ML 研究员与工程师软件工程师与开发者数据科学家与分析师
文献标题
Results-Actionability Gap: Understanding How Practitioners Evaluate LLM Products in the Wild
发布信息
- 主题领域: 生产环境中基于LLM产品的评估实践。
- 关键词: LLM评估、结果-可操作性差距、生产系统、解释性实践、直觉检查、组织元工作、定性方法、系统化、人机交互、实践者挑战。
背景与问题
- 问题/挑战: 实践者在评估基于LLM的产品时面临显著挑战,这些系统具有不可预测性和上下文依赖性。现有的评估框架和指标通常无法提供可操作的洞察,使得实践者无法将评估结果转化为系统改进。
- 重要性: 随着LLM被集成到医疗、教育和企业软件等关键领域,不充分的评估可能带来商业失败和社会危害等风险。有效的评估对于确保可靠性、安全性和用户满意度至关重要。
- 动机与相关工作: 以往研究记录了LLM评估中的挑战,例如依赖手动测试和传统指标的不足。然而,这些研究主要集中在资源充足的组织或学术环境中,对资源较少的团队如何进行评估的理解仍存在空白。本文通过研究多样化的实践者并识别一种新的挑战——结果-可操作性差距,填补了这一空白。
解决方案
- 提出的方法: 本研究探讨实践者如何评估基于LLM的产品,识别挑战,并提出弥合结果-可操作性差距的策略。研究重点在于支持解释性实践并系统化评估方法。
- 创新点:
- 提供跨多样化组织环境的评估实践经验性描述,扩展了以往仅关注单一组织或学术环境的研究。
- 引入并概念化“结果-可操作性差距”,这一新挑战指评估数据无法转化为可操作的改进。
- 提出通过组织适应而非新指标来弥合结果-可操作性差距的可操作策略。
- 程序与关键技术:
- 对来自多个行业的19位实践者进行半结构化访谈。
- 对评估实践、挑战和组织元工作进行主题分析。
- 识别了十种评估实践和五个关键挑战,包括结果-可操作性差距。
结果
- 具体发现:
- 识别了十种评估实践,包括非正式的直觉检查、用户反馈收集、专家协作以及尝试自动化测试。
- 记录了五个挑战:评估目标的对齐、定义有意义的构念、选择可行的方法、克服技术障碍以及结果-可操作性差距。
- 发现19名参与者中有17名经历了结果-可操作性差距,即评估结果未能转化为可操作的系统改进。
- 相较基线的优势: 与以往将解释性实践视为过渡性方法的研究不同,本研究认为这些实践是对LLM特性必要的适应。研究提供了系统化这些实践的策略,而非替代它们。
- 实验/评估:
- 访谈涵盖多个行业(医疗、教育、企业软件)和角色(数据科学家、设计师、工程师)。
- 分析重点在于评估的执行、设计和组织元工作。
- 局限性与未来工作:
- 样本规模(N = 19)可能无法涵盖完全放弃评估的团队。
- 发现基于自我报告的实践;民族志研究可能提供更深入的洞察。
- 未来工作可探索评估的纵向模式及影响评估的组织因素。
总结
本研究探讨了实践者如何在生产环境中评估基于LLM的产品,识别了十种评估实践和五个挑战。结果-可操作性差距作为核心问题影响了19名参与者中的17名。研究将直觉检查等解释性实践重新定义为对LLM特性必要的适应,而非方法论上的失败。研究提出了包括设计驱动评估、持续意义构建和渐进测试在内的可操作策略,以弥合结果-可操作性差距。这些发现为HCI研究提供了支持实践者系统化评估方法的机会。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
当前问题库还没有收录这篇论文的问题与痛点。
- 100%
DataSpeck:一种人工智能驱动的端到端人机协作系统,用于实现数据转换工作流的自动化
CHI '26· 大语言模型(LLM)的人机协作 +2
- 100%
RAGTrace:理解和改进检索增强生成中的检索-生成动态
UIST '25· 大语言模型(LLM)的人机协作 +2
- 83%
多智能体AI系统的交互式调试和引导
CHI '25· 大语言模型(LLM)的人机协作 +2
- 83%
DIY:帮助人们评估自然语言到SQL系统的正确性
IUI '21· 大语言模型(LLM)的人机协作 +2
- 83%
CoPrompter:面向用户的LM指令对齐评估以改进提示工程
IUI '25· 大语言模型(LLM)的人机协作 +2
- 75%
DirectGPT:与大型语言模型进行交互的直接操作界面
CHI '24· 大语言模型(LLM)的人机协作 +3
- 71%
基于模型的强化学习适应用户界面
CHI '21· 大语言模型(LLM)的人机协作 +2
- 71%
硒石:利用大型语言模型生成的综合概述在线构建意义框架
CHI '24· 大语言模型(LLM)的人机协作 +2
- 71%
Dango:使用大型语言模型的混合发起数据整理系统
CHI '25· 大语言模型(LLM)的人机协作 +2
- 71%
OmniQuery:上下文化增强捕获的多模态记忆以实现个人问题回答
CHI '25· 大语言模型(LLM)的人机协作 +2
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)
快捷操作
广告推荐
学习 AI 编程到 CodeNow
open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3772318.3791069
一眼看懂
fact_check论文快照
dataset
来源
CHI
calendar_month
年份
2026
emoji_events
奖项
未标记奖项
group
作者
6 位作者
sell
研究子方向
大语言模型(LLM)的人机协作、AI 辅助决策与自动化系统、可解释人工智能(XAI)
work
职业/产业
AI/ML 研究员与工程师、软件工程师与开发者、数据科学家与分析师
article
内容状态
已索引正文
hub
相关论文
10 篇相关论文