学术问答系统中大语言模型错误评估的专家模式
作者
大语言模型(LLM)的人机协作可解释人工智能(XAI)用户研究方法(访谈、调查、观察)大学教授与研究人员HCI 研究员AI/ML 研究员与工程师
文献标题
An Expert Schema for Evaluating Large Language Model Errors in Scholarly Question-Answering Systems
出版信息
- 主题领域: 学术问答任务中大型语言模型错误的评估。
- 关键词: 大型语言模型,学术问答,错误分类,专家评估,幻觉,综合问题,领域特定评估,检索增强生成,上下文探究,人机协作。
背景与问题
- 问题/挑战: 当前针对大型语言模型的自动化评估指标缺乏学术问答任务所需的上下文细微差别,无法反映领域专家的评估策略。
- 重要性: 可靠的学术问答系统对于管理日益增长的科学文献量以及帮助研究人员导航复杂的领域特定信息至关重要。
- 动机与相关工作: 之前的研究主要集中在自动化指标和基准上,这些方法通常无法捕捉领域特定错误、综合失败和幻觉等问题。尽管人工评估仍然是必要的,但缺乏结构化框架来支持专家驱动的评估。本论文通过开发一个基于领域专家反馈的错误评估框架来填补这一空白。
解决方案
- 提出的方法: 开发并验证一个专家驱动的框架,用于评估学术问答中的大型语言模型错误,涵盖七个类别中的20种错误模式。
- 创新点:
- 创建一个针对学术问答任务的细粒度错误分类框架。
- 使用两阶段方法,邀请领域专家识别并验证错误模式。
- 分析专家评估策略及其对混合评估方法的影响。
- 将错误模式映射到问题类型,突出学术问答中的具体挑战。
- 流程与关键技术:
- 第一阶段: 与三位领域专家和研究人员合作,分析基于检索增强生成(RAG)系统的68个问答对,开发框架。
- 第二阶段: 使用上下文探究和结构化清单,邀请10位额外领域专家验证框架,评估120个问答对。
- 确定七个顶级错误类别:错误答案、幻觉、不完整答案、问题理解、综合问题、格式问题和系统故障。
- 将11种问题类型(如方法论探究、批判性评估)映射到错误类别,以了解错误分布。
结果
- 具体发现:
- 确定了七个类别中的20种错误模式,包括幻觉(如虚构引用)、综合失败和不完整答案。
- 专家自然能够识别正确性和完整性方面的错误,但在没有结构化指导的情况下容易忽略细微的幻觉和引用错误。
- 高阶问题(如方法论探究)比事实验证问题暴露更多错误。
- 相较基线的优势:
- 该框架能够系统性地识别自动化指标和基准无法捕捉的错误,例如领域特定的综合失败和细微的幻觉。
- 基于框架的结构化评估工具提高了专家检测细微错误的能力。
- 实验/评估:
- 两阶段研究中,13位领域专家评估了188个问答对。
- 使用检索增强生成系统生成基于学术论文的答案。
- 分析专家反馈和问题特征以优化框架并识别错误检测中的模式。
- 局限性与未来工作:
- 样本量较小(验证阶段N=10),且集中于STEM领域;框架可能需要针对人文学科和社会科学进行调整。
- 所用RAG系统的技术局限性可能无法推广到更大的专有模型。
- 未来工作包括测试框架在不同学科中的通用性、自动化错误检测以及开发混合评估工作流程。
摘要
本文通过与领域专家合作,提出了一个用于评估学术问答中大型语言模型错误的框架。该框架识别了七个类别中的20种错误模式,解决了自动化指标的局限性,捕捉了领域特定问题如幻觉和综合失败。通过10位专家验证发现,基于框架的结构化评估工具提高了错误检测能力,尤其是针对细微问题。研究结果强调了结合自动化预筛选与专家监督的混合评估方法的必要性,以及支持领域特定错误识别的个性化工具需求。该框架为提高大型语言模型在学术环境中的可靠性以及适应不同学科的评估框架提供了基础。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
当前问题库还没有收录这篇论文的问题与痛点。
- 86%
Criticality:基于交互式批判性思维与循证推理痕迹的决策支持脚手架
IUI '26· 大语言模型(LLM)的人机协作 +3
- 71%
HCI中LLM集成系统的报告与评审:挑战与考量
CHI '26· 大语言模型(LLM)的人机协作 +2
- 71%
探究时间约束下LLM使用对批判性思维的影响:访问时机与时间可用性
CHI '26· 大语言模型(LLM)的人机协作 +2
- 71%
大语言模型还是人类?研究摘要的信任与质量感知研究
CHI '26· 大语言模型(LLM)的人机协作 +2
- 71%
Minor Revisions接受:AI辅助科学写作的价值
IUI '26· 大语言模型(LLM)的人机协作 +2
- 71%
交互式机器学习中可控性与认知负荷的多模态研究
IUI '26· 大语言模型(LLM)的人机协作 +2
- 71%
通过交互式解释接口提升人类对大语言模型推理的验证能力
IUI '26· 大语言模型(LLM)的人机协作 +2
- 67%
Cody:基于AI的系统,用于定性研究的半自动化编码
CHI '21· 大语言模型(LLM)的人机协作 +1
- 67%
交互式知识获取中避免过拟合的用户建模方法
IUI '18· 大语言模型(LLM)的人机协作 +1
- 67%
ReviewFlow:支持学术同行评审的智能脚手架系统
IUI '24· 大语言模型(LLM)的人机协作 +1
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)
快捷操作
广告推荐
学习 AI 编程到 CodeNow
open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3772318.3791843
一眼看懂
fact_check论文快照
dataset
来源
CHI
calendar_month
年份
2026
emoji_events
奖项
未标记奖项
group
作者
5 位作者
sell
研究子方向
大语言模型(LLM)的人机协作、可解释人工智能(XAI)、用户研究方法(访谈、调查、观察)
work
职业/产业
大学教授与研究人员、HCI 研究员、AI/ML 研究员与工程师
article
内容状态
已索引正文
hub
相关论文
10 篇相关论文