超越准确性:专家视AI事实核查为准确但不太有用

可解释人工智能(XAI)虚假信息与事实核查大语言模型(LLM)的人机协作事实核查员记者与编辑AI/ML 研究员与工程师

文献标题

Beyond Accuracy: Experts See AI Fact-Checks as Accurate but Less Useful

出版信息

  • 主题领域: 媒体专家对大型语言模型(LLM)生成的事实核查报告的评估。
  • 关键词: 大型语言模型,事实核查,虚假信息,媒体专家,准确性,实用性,逻辑性,信任,启发-系统模型,AI生成内容。

背景与问题

  • 问题/挑战: 尽管LLM在自动化事实核查任务中展现了潜力,但其生成可靠且有用的事实核查报告的能力仍不确定。此前的研究主要关注分类准确性,但对LLM生成报告的专家评估尚未深入探讨。
  • 重要性: 理解专家的看法对于设计能够有效支持专业人士应对虚假信息的AI工具至关重要,而虚假信息是一个日益严重的社会问题。
  • 动机与相关工作: 现有的事实核查方法严重依赖人工编辑,成本高且难以扩展。此前的研究探讨了LLM在检测虚假信息方面的准确性,但未涉及专家对其推理、实用性和可信度的评估。本研究通过聚焦媒体专业人士的评估填补了这一空白。

解决方案

  • 提出的方法: 进行一项2x2被试间在线实验,评估由人类和LLM生成的事实核查报告,并考虑是否披露来源。
  • 创新点:
    1. 关注专家评估,而非普通用户的看法。
    2. 分析LLM生成报告的多个维度(准确性、实用性、逻辑性、幻觉、参与度、相关性)。
    3. 应用启发-系统模型(HSM)理解专家信任动态。
    4. 将定性洞察与定量发现相结合。
  • 流程与关键技术:
    • 参与者(N=274)被随机分配到四种条件之一(人类/LLM来源,披露/未披露)。
    • 参与者使用7点Likert量表对八份事实核查报告的六个维度进行评分。
    • 报告由GPT-4 Turbo生成,并被提示模仿PolitiFact的风格。
    • 研究后问卷收集定性反馈和人口统计数据。
    • 混合效应回归模型分析定量数据,主题编码分析定性反馈。

结果

  • 具体发现:
    • LLM生成的报告在准确性(M=5.45)和逻辑性(M=5.40)上与人类撰写的报告(准确性M=5.60,逻辑性M=5.58)相当。
    • LLM生成的报告被认为显著不如人类撰写的报告有用(M=5.40 vs. M=5.71,p<.05)。
    • 政党倾向影响了对逻辑性的感知,共和党和民主党在信任动态上存在差异。
  • 相较基线的优势: LLM生成的报告在准确性和逻辑性上与人类报告相当,但在实用性上有所欠缺,突出了改进空间。
  • 实验/评估:
    • 数据集: 120份关于健康、公民事务、科学和政治的事实核查报告,真伪均衡。
    • 评价指标: 准确性、实用性、逻辑性、幻觉、参与度、相关性。
    • 工具: 使用零样本提示的GPT-4 Turbo。
  • 局限性与未来工作:
    • 由于样本集中于美国专家且人类报告条件固定,研究的普适性有限。
    • 存在潜在的提示效应以及LLM能力的演进(如GPT-5)。
    • 未来研究应探索更先进的LLM设计、界面透明性以及跨文化评估。

总结

本研究评估了媒体专家对比LLM生成与人类撰写的事实核查报告的看法。尽管LLM报告在准确性和逻辑性上与人类报告相当,但在实用性上显著逊色,尤其是在未披露来源的情况下。政党倾向影响了对逻辑性的感知,定性反馈突出了对来源真实性、推理能力和AI局限性的担忧。这些发现强调了改进LLM设计和透明性以建立专业人士信任的必要性。该研究为将AI整合到事实核查工作流中以及推进人机协作提供了可操作的见解。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/chi/222272/2026

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3772318.3791625
一眼看懂

论文快照

fact_check
dataset
来源
CHI
calendar_month
年份
2026
emoji_events
奖项
未标记奖项
group
作者
6 位作者
sell
研究子方向
可解释人工智能(XAI)、虚假信息与事实核查、大语言模型(LLM)的人机协作
work
职业/产业
事实核查员、记者与编辑、AI/ML 研究员与工程师
article
内容状态
已索引正文
hub
相关论文
3 篇相关论文