LLM作为评判者方法在专家知识任务评估中的局限性

大语言模型(LLM)的人机协作AI 辅助决策与自动化系统精神科医生与心理咨询师AI/ML 研究员与工程师

使用大型语言模型自身来评估LLM输出为评估各种上下文中的模型性能提供了一种有前景的方法。之前的研究表明,LLM作为评判者在通用指令遵循背景下与人类评判者表现出强相关性。然而,对于需要专业知识的指令,使用LLM作为评判者的有效性仍不确定。在本研究中,团队采用了混合方法,进行成对比较,由领域专家(SMEs)和LLM评估特定领域任务的输出。研究聚焦两个不同领域:营养学(由注册营养师专家)和心理健康(由临床心理学家专家)。结果显示,在评估整体偏好时,营养学领域 SME 与 LLM 评判者的一致率为68%,心理健康领域为64%。此外,结果还表明在特定领域方面问题上的 SME-LLM 一致性存在差异。研究强调了将人类专家保留在评估过程中的重要性,因为LLM可能无法提供复杂专业知识任务所需的理解深度。研究还探讨了LLM评估在不同领域的影响,并讨论了这些见解如何为设计确保交互系统中人类专家与LLM更好对齐的评估工作流程提供信息。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/iui/195769/2025

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3708359.3712091
一眼看懂

论文快照

fact_check
dataset
来源
IUI
calendar_month
年份
2025
emoji_events
奖项
未标记奖项
group
作者
6 位作者
sell
研究子方向
大语言模型(LLM)的人机协作、AI 辅助决策与自动化系统
work
职业/产业
精神科医生与心理咨询师、AI/ML 研究员与工程师
article
内容状态
仅摘要
hub
相关论文
10 篇相关论文