PaperTrail:用于在基于LLM的学术问答中追溯 provenance 的声明-证据界面
大语言模型(LLM)的人机协作可解释人工智能(XAI)用户研究方法(访谈、调查、观察)原型设计与用户测试大学教授与研究人员HCI 研究员统计学家与数据科学家
文献标题
PaperTrail: A Claim-Evidence Interface for Grounding Provenance in LLM-based Scholarly Q&A
出版信息
- 主题领域: 利用大型语言模型(LLMs)增强学术问答系统的信任与验证。
- 关键词: LLMs, 学术问答, 溯源, 主张-证据匹配, 信任校准, 论证结构, 用户研究, 认知负荷, 可用性, 验证。
背景与问题
- 问题/挑战: 基于LLM的学术问答系统常出现错误,例如不支持的主张和遗漏。现有的溯源机制(如来源引用)缺乏细粒度,难以进行严格的验证。
- 重要性: LLM输出中的错误可能在高风险学术环境中传播错误信息,削弱学术工作流程中的信任和可靠性。
- 动机与相关研究: 之前的研究主要集中在粗粒度的归因和解释,但这些方法通常无法促进适当的信任或可操作的验证。本文通过引入一个与学术论证结构相一致的系统来解决这一空白。
解决方案
- 提出的方法: PaperTrail系统将LLM答案和来源文档分解为主张和证据,并将其映射以实现学术问答中的细粒度溯源。
- 创新点:
- 设计并实现了一个用于学术问答的主张-证据界面。
- 后端架构结合了基于LLM、基于相似性和检索增强生成(RAG)方法进行主张-证据提取。
- 提供了主张-证据溯源对信任校准影响的实证证据。
- 识别了在时间和认知限制下,用户对LLM依赖的信任行为差距。
- 过程与关键技术:
- 后端: 一个三阶段的主张和证据提取管道:
- 使用基于LLM的方法进行离线的论文级主张-证据提取。
- 从LLM生成的回答中实时提取答案级主张和证据。
- 使用RAG进行实时主张-证据匹配以生成溯源指标。
- 前端: 一个三面板界面,提供主张覆盖指标、交互式主张卡片以及协调视图以支持验证工作流程。
- 后端: 一个三阶段的主张和证据提取管道:
结果
- 具体发现:
- 使用PaperTrail时对LLM输出的信任显著降低(平均值=3.68),相比基线(平均值=4.22,p=0.015)。
- 对LLM生成文本的依赖没有显著差异(PaperTrail: 0.75,基线: 0.73,p=0.313)。
- 对任务输出的信心在两种条件下相似(PaperTrail: 4.05,基线: 4.27,p=0.525)。
- 相较基线的优势:
- PaperTrail提供了细粒度的主张-证据溯源,鼓励用户对LLM信任保持谨慎,而基线界面仅基于引用。
- 实验/评估:
- 一项包含26名研究人员的被试内研究,参与者完成两项学术编辑任务。
- 评价指标:信任(TXAI量表)、依赖(Levenshtein编辑距离)、信心、可用性(SUPR-Q)和认知负荷(NASA-TLX)。
- 任务:使用火星探索语料库进行多论文综合和“魔鬼代言人”审查。
- 局限性与未来工作:
- 系统延迟较高以及界面复杂性降低了可用性。
- 任务持续时间较短限制了用户对溯源功能的深入使用。
- 未来工作应探索自适应溯源、纵向研究以及任务特定的验证工作流程。
总结
PaperTrail提出了一种新颖的主张-证据界面,用于基于LLM的学术问答,通过将LLM生成的主张与来源文档证据匹配,实现细粒度溯源。一项用户研究表明,PaperTrail降低了对LLM输出的信任,但未显著改变依赖行为,揭示了在时间和认知限制下的信任行为差距。尽管参与者认可细致溯源的概念,但可用性挑战限制了其实际影响。该系统的后端架构也展示了作为评估LLM在学术环境中可信度框架的潜力。未来工作应集中于改善可用性、自适应溯源以及实际部署场景。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
当前问题库还没有收录这篇论文的问题与痛点。
- 75%
从劳作到思考:系统性文献综述中战略性探索与负责任 AI 的设计
IUI '26· 可解释人工智能(XAI) +3
- 75%
Criticality:基于交互式批判性思维与循证推理痕迹的决策支持脚手架
IUI '26· 大语言模型(LLM)的人机协作 +3
- 71%
基于大语言模型的临界论文阅读现场思考交流
IUI '26· 大语言模型(LLM)的人机协作 +2
- 71%
DiscipLink:通过人机协同探索促进跨学科信息寻求过程
UIST '24· 大语言模型(LLM)的人机协作 +2
- 67%
LAPS:使用大型语言模型自动化公共调查的假设驱动统计分析
CHI '26· 大语言模型(LLM)的人机协作 +4
- 63%
CollabCoder:一种使用大型语言模型进行归纳性协作定性分析的低门槛严格工作流程
CHI '24· 大语言模型(LLM)的人机协作 +2
- 63%
InterFlow:设计无干扰人工智能以赋能半结构化访谈中的访谈者
CHI '26· 大语言模型(LLM)的人机协作 +3
- 63%
学术问答系统中大语言模型错误评估的专家模式
CHI '26· 大语言模型(LLM)的人机协作 +2
- 63%
通过交互式解释接口提升人类对大语言模型推理的验证能力
IUI '26· 大语言模型(LLM)的人机协作 +2
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)
快捷操作
广告推荐
学习 AI 编程到 CodeNow
open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3772318.3791101
一眼看懂
fact_check论文快照
dataset
来源
CHI
calendar_month
年份
2026
emoji_events
奖项
未标记奖项
group
作者
4 位作者
sell
研究子方向
大语言模型(LLM)的人机协作、可解释人工智能(XAI)、用户研究方法(访谈、调查、观察)、原型设计与用户测试
work
职业/产业
大学教授与研究人员、HCI 研究员、统计学家与数据科学家
article
内容状态
已索引正文
hub
相关论文
9 篇相关论文