设计LLM的分阶段评估工作流程:整合领域专家、普通用户和模型生成的评估标准
作者
大语言模型(LLM)的人机协作AI 辅助决策与自动化系统用户研究方法(访谈、调查、观察)原型设计与用户测试AI/ML 研究员与工程师HCI 研究员数据科学家与分析师
文献标题
Designing Staged Evaluation Workflows for LLMs: Integrating Domain Experts, Lay Users, and Model-Generated Evaluation Criteria
出版信息
- 主题领域: 面向特定领域任务的大型语言模型(LLMs)评估工作流。
- 关键词: 大型语言模型,评估标准,领域专家,普通用户,人机协作,分阶段工作流,标准漂移,可用性测试,自然语言处理,LLM-as-a-Judge。
背景与问题
- 问题/挑战: 现有的LLM评估方法往往未能充分考虑多样化来源(领域专家、普通用户和LLMs)的独特贡献,以及评估标准在不同评估阶段的演变过程。当前方法在成本、可扩展性以及与领域特定标准的对齐方面存在局限性。
- 重要性: 有效评估LLMs对于确保其准确性、可靠性以及与终端用户需求的对齐至关重要,尤其是在医疗和教育等高风险领域,错误可能带来重大后果。
- 动机与相关工作: 先前研究集中于LLM评估的工具和系统(如EvalLM、EvalAssist)以及人机协作的角色。然而,对于不同来源如何贡献评估标准以及如何设计有效整合这些视角的工作流,仍存在研究空白。
解决方案
- 提出的方法: 一个分阶段的评估工作流,整合领域专家、普通用户和LLMs,以利用其在创建和优化评估标准方面的互补优势。
- 创新点:
- 对领域专家、普通用户和LLMs在两个阶段(a priori 和 a posteriori)创建的评估标准进行实证分析。
- 识别评估过程中标准漂移和收敛的模式。
- 提供分阶段评估工作流的设计指南,以平衡质量、成本和可扩展性。
- 过程和关键技术:
- 参与者(领域专家和普通用户)以及LLMs为营养学和数学教学领域的提示生成评估标准。
- 标准分两个阶段创建:a priori(基于提示)和a posteriori(在审阅输出后)。
- 使用三种LLMs(GPT-4o、Claude 3.5 Sonnet、Gemini 1.5 Flash)生成输出。
- 通过定性编码和主题分析,对标准在各阶段的相似性、差异性及演变进行分析。
结果
- 具体发现:
- 领域专家创建了详细的、基于知识的标准,与专业标准对齐,注重长期结果。
- 普通用户强调可用性、清晰性和呈现方式,反映了即时的实际需求。
- LLMs生成了与提示或输出紧密相关的通用标准,但缺乏深度和上下文意识。
- 观察到标准漂移,领域专家和普通用户在发现输出中的缺陷或错误后引入了新标准,而LLMs的适应性有限。
- 在a posteriori阶段出现了标准收敛,所有来源均聚焦于输出中的可观察特征。
- 相较基线的优势: 分阶段工作流利用了领域专家、普通用户和LLMs的互补优势,克服了依赖单一来源或单一阶段的现有评估方法的局限性。
- 实验/评估:
- 在营养学和数学教学领域的案例研究,每个领域包括五名领域专家和五名普通用户。
- 针对每个领域的三个场景,使用三种LLMs生成输出。
- 通过定性编码和主题分析,对a priori和a posteriori阶段的标准进行分析。
- 局限性与未来工作:
- 样本量较小,限制了研究的普适性;未来研究应包括更大规模的参与者和更多领域。
- 提议的工作流的实际应用尚未测试。
- 需评估LLM-as-a-Judge系统中标准的可靠性,并探索相关提示的泛化能力。
总结
本研究提出了一种分阶段的LLM评估工作流,整合领域专家、普通用户和LLMs以创建和优化评估标准。领域专家贡献了与专业标准对齐的知识型标准,普通用户强调了可用性和清晰性,而LLMs提供了通用的基线标准。研究识别了标准漂移和收敛模式,强调了在早期引入人类判断的重要性,以确保质量并减少强化有缺陷输出的风险。本文提供了设计指南,以在评估工作流中平衡成本、可扩展性和质量,并对改进实际应用中的LLM评估系统具有重要意义。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
当前问题库还没有收录这篇论文的问题与痛点。
- 100%
将互补特征集整合用于人类-AI决策
IUI '26· 大语言模型(LLM)的人机协作 +3
- 86%
从叙事到数字:利用大语言模型评估调查问卷
IUI '26· 大语言模型(LLM)的人机协作 +2
- 86%
Rationalizer:利用大语言模型支持用户为Likert量表问卷评分提供理由
IUI '26· 大语言模型(LLM)的人机协作 +2
- 75%
DALL:基于数据编程和大型语言模型增强的主动学习进行数据标注
CHI '26· 大语言模型(LLM)的人机协作 +3
- 75%
Perspectra:选择专家增强多智能体研究创意生成中的批判性思维
CHI '26· 大语言模型(LLM)的人机协作 +3
- 75%
Evalet: 通过功能碎片化评估大型语言模型
CHI '26· 大语言模型(LLM)的人机协作 +3
- 75%
数据与提示词协同演化:通过扩展测试集优化大语言模型行为
CHI '26· 大语言模型(LLM)的人机协作 +3
- 75%
居于循环之中:面向提示的快速运行时反馈
CHI '26· 大语言模型(LLM)的人机协作 +3
- 71%
AI of Oz:利用人工智能辅助人工Moderator增强人机交互中的Wizard of Oz研究
CHI '26· 大语言模型(LLM)的人机协作 +2
- 71%
EvalAssist:任务特定评估与 AI 辅助判断策略偏好的见解
UIST '25· 大语言模型(LLM)的人机协作 +1
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)
快捷操作
广告推荐
学习 AI 编程到 CodeNow
open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3772318.3790897
一眼看懂
fact_check论文快照
dataset
来源
CHI
calendar_month
年份
2026
emoji_events
奖项
未标记奖项
group
作者
5 位作者
sell
研究子方向
大语言模型(LLM)的人机协作、AI 辅助决策与自动化系统、用户研究方法(访谈、调查、观察)、原型设计与用户测试
work
职业/产业
AI/ML 研究员与工程师、HCI 研究员、数据科学家与分析师
article
内容状态
已索引正文
hub
相关论文
10 篇相关论文