LLM作为评判者方法在专家知识任务评估中的局限性
作者
大语言模型(LLM)的人机协作AI 辅助决策与自动化系统精神科医生与心理咨询师AI/ML 研究员与工程师
使用大型语言模型自身来评估LLM输出为评估各种上下文中的模型性能提供了一种有前景的方法。之前的研究表明,LLM作为评判者在通用指令遵循背景下与人类评判者表现出强相关性。然而,对于需要专业知识的指令,使用LLM作为评判者的有效性仍不确定。在本研究中,团队采用了混合方法,进行成对比较,由领域专家(SMEs)和LLM评估特定领域任务的输出。研究聚焦两个不同领域:营养学(由注册营养师专家)和心理健康(由临床心理学家专家)。结果显示,在评估整体偏好时,营养学领域 SME 与 LLM 评判者的一致率为68%,心理健康领域为64%。此外,结果还表明在特定领域方面问题上的 SME-LLM 一致性存在差异。研究强调了将人类专家保留在评估过程中的重要性,因为LLM可能无法提供复杂专业知识任务所需的理解深度。研究还探讨了LLM评估在不同领域的影响,并讨论了这些见解如何为设计确保交互系统中人类专家与LLM更好对齐的评估工作流程提供信息。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
help
研究问题
3- LLM(大语言模型)的评估结果在复杂任务中与领域专家的评价结果相比有多大一致性?分类: 医疗模拟训练与沟通支持同类问题arrow_forward
- 哪些关键因素导致LLM与领域专家评估结果的差异?分类: 医疗模拟训练与沟通支持同类问题arrow_forward
- 模拟“专家人格”是否能提高LLM在领域专业评估中的一致性?分类: 医疗模拟训练与沟通支持同类问题arrow_forward
lightbulb
现实痛点
1- 医疗和心理支持等领域专家评估成本高且难以稳定一致。分类: 医疗模拟训练与沟通支持同类问题arrow_forward
- 67%
探索用于心理治疗中治疗作业支持的可定制交互工具
CHI '26· 大语言模型(LLM)的人机协作 +2
- 67%
当人工智能提供建议:评估人工智能与人类对在线幸福咨询的响应
CHI '26· 大语言模型(LLM)的人机协作 +2
- 67%
将诊前体验数字化:影响与设计建议
CHI '26· 大语言模型(LLM)的人机协作 +2
- 67%
迈向更优质的健康对话:情境寻求的益处
CHI '26· 大语言模型(LLM)的人机协作 +2
- 67%
角色分配:人机协作决策中大语言模型角色原型研究
CHI '26· 大语言模型(LLM)的人机协作 +2
- 60%
人类与AI交互中沟通方向性和AI代理差异的影响
CHI '21· 大语言模型(LLM)的人机协作 +1
- 60%
人工智能知识:通过人类赋能提升人工智能委托
CHI '23· 大语言模型(LLM)的人机协作 +1
- 60%
在人工智能中介沟通中比较句子层面的建议和消息层面的建议
CHI '23· 大语言模型(LLM)的人机协作 +1
- 60%
数据分析师如何回应AI辅助?一项巫师实验研究
CHI '24· 大语言模型(LLM)的人机协作 +1
- 60%
VAL:使用GPT对话解析进行交互式任务学习
CHI '24· 大语言模型(LLM)的人机协作 +1
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)
快捷操作
广告推荐
学习 AI 编程到 CodeNow
open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3708359.3712091
一眼看懂
fact_check论文快照
dataset
来源
IUI
calendar_month
年份
2025
emoji_events
奖项
未标记奖项
group
作者
6 位作者
sell
研究子方向
大语言模型(LLM)的人机协作、AI 辅助决策与自动化系统
work
职业/产业
精神科医生与心理咨询师、AI/ML 研究员与工程师
article
内容状态
仅摘要
hub
相关论文
10 篇相关论文