结果-可行动性差距:理解从业者如何在实际环境中评估 LLM 产品

大语言模型(LLM)的人机协作AI 辅助决策与自动化系统可解释人工智能(XAI)AI/ML 研究员与工程师软件工程师与开发者数据科学家与分析师

文献标题

Results-Actionability Gap: Understanding How Practitioners Evaluate LLM Products in the Wild

发布信息

  • 主题领域: 生产环境中基于LLM产品的评估实践。
  • 关键词: LLM评估、结果-可操作性差距、生产系统、解释性实践、直觉检查、组织元工作、定性方法、系统化、人机交互、实践者挑战。

背景与问题

  • 问题/挑战: 实践者在评估基于LLM的产品时面临显著挑战,这些系统具有不可预测性和上下文依赖性。现有的评估框架和指标通常无法提供可操作的洞察,使得实践者无法将评估结果转化为系统改进。
  • 重要性: 随着LLM被集成到医疗、教育和企业软件等关键领域,不充分的评估可能带来商业失败和社会危害等风险。有效的评估对于确保可靠性、安全性和用户满意度至关重要。
  • 动机与相关工作: 以往研究记录了LLM评估中的挑战,例如依赖手动测试和传统指标的不足。然而,这些研究主要集中在资源充足的组织或学术环境中,对资源较少的团队如何进行评估的理解仍存在空白。本文通过研究多样化的实践者并识别一种新的挑战——结果-可操作性差距,填补了这一空白。

解决方案

  • 提出的方法: 本研究探讨实践者如何评估基于LLM的产品,识别挑战,并提出弥合结果-可操作性差距的策略。研究重点在于支持解释性实践并系统化评估方法。
  • 创新点:
    1. 提供跨多样化组织环境的评估实践经验性描述,扩展了以往仅关注单一组织或学术环境的研究。
    2. 引入并概念化“结果-可操作性差距”,这一新挑战指评估数据无法转化为可操作的改进。
    3. 提出通过组织适应而非新指标来弥合结果-可操作性差距的可操作策略。
  • 程序与关键技术:
    • 对来自多个行业的19位实践者进行半结构化访谈。
    • 对评估实践、挑战和组织元工作进行主题分析。
    • 识别了十种评估实践和五个关键挑战,包括结果-可操作性差距。

结果

  • 具体发现:
    • 识别了十种评估实践,包括非正式的直觉检查、用户反馈收集、专家协作以及尝试自动化测试。
    • 记录了五个挑战:评估目标的对齐、定义有意义的构念、选择可行的方法、克服技术障碍以及结果-可操作性差距。
    • 发现19名参与者中有17名经历了结果-可操作性差距,即评估结果未能转化为可操作的系统改进。
  • 相较基线的优势: 与以往将解释性实践视为过渡性方法的研究不同,本研究认为这些实践是对LLM特性必要的适应。研究提供了系统化这些实践的策略,而非替代它们。
  • 实验/评估:
    • 访谈涵盖多个行业(医疗、教育、企业软件)和角色(数据科学家、设计师、工程师)。
    • 分析重点在于评估的执行、设计和组织元工作。
  • 局限性与未来工作:
    • 样本规模(N = 19)可能无法涵盖完全放弃评估的团队。
    • 发现基于自我报告的实践;民族志研究可能提供更深入的洞察。
    • 未来工作可探索评估的纵向模式及影响评估的组织因素。

总结

本研究探讨了实践者如何在生产环境中评估基于LLM的产品,识别了十种评估实践和五个挑战。结果-可操作性差距作为核心问题影响了19名参与者中的17名。研究将直觉检查等解释性实践重新定义为对LLM特性必要的适应,而非方法论上的失败。研究提出了包括设计驱动评估、持续意义构建和渐进测试在内的可操作策略,以弥合结果-可操作性差距。这些发现为HCI研究提供了支持实践者系统化评估方法的机会。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/chi/222094/2026

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3772318.3791069
一眼看懂

论文快照

fact_check
dataset
来源
CHI
calendar_month
年份
2026
emoji_events
奖项
未标记奖项
group
作者
6 位作者
sell
研究子方向
大语言模型(LLM)的人机协作、AI 辅助决策与自动化系统、可解释人工智能(XAI)
work
职业/产业
AI/ML 研究员与工程师、软件工程师与开发者、数据科学家与分析师
article
内容状态
已索引正文
hub
相关论文
10 篇相关论文