超越准确性:专家视AI事实核查为准确但不太有用
作者
可解释人工智能(XAI)虚假信息与事实核查大语言模型(LLM)的人机协作事实核查员记者与编辑AI/ML 研究员与工程师
文献标题
Beyond Accuracy: Experts See AI Fact-Checks as Accurate but Less Useful
出版信息
- 主题领域: 媒体专家对大型语言模型(LLM)生成的事实核查报告的评估。
- 关键词: 大型语言模型,事实核查,虚假信息,媒体专家,准确性,实用性,逻辑性,信任,启发-系统模型,AI生成内容。
背景与问题
- 问题/挑战: 尽管LLM在自动化事实核查任务中展现了潜力,但其生成可靠且有用的事实核查报告的能力仍不确定。此前的研究主要关注分类准确性,但对LLM生成报告的专家评估尚未深入探讨。
- 重要性: 理解专家的看法对于设计能够有效支持专业人士应对虚假信息的AI工具至关重要,而虚假信息是一个日益严重的社会问题。
- 动机与相关工作: 现有的事实核查方法严重依赖人工编辑,成本高且难以扩展。此前的研究探讨了LLM在检测虚假信息方面的准确性,但未涉及专家对其推理、实用性和可信度的评估。本研究通过聚焦媒体专业人士的评估填补了这一空白。
解决方案
- 提出的方法: 进行一项2x2被试间在线实验,评估由人类和LLM生成的事实核查报告,并考虑是否披露来源。
- 创新点:
- 关注专家评估,而非普通用户的看法。
- 分析LLM生成报告的多个维度(准确性、实用性、逻辑性、幻觉、参与度、相关性)。
- 应用启发-系统模型(HSM)理解专家信任动态。
- 将定性洞察与定量发现相结合。
- 流程与关键技术:
- 参与者(N=274)被随机分配到四种条件之一(人类/LLM来源,披露/未披露)。
- 参与者使用7点Likert量表对八份事实核查报告的六个维度进行评分。
- 报告由GPT-4 Turbo生成,并被提示模仿PolitiFact的风格。
- 研究后问卷收集定性反馈和人口统计数据。
- 混合效应回归模型分析定量数据,主题编码分析定性反馈。
结果
- 具体发现:
- LLM生成的报告在准确性(M=5.45)和逻辑性(M=5.40)上与人类撰写的报告(准确性M=5.60,逻辑性M=5.58)相当。
- LLM生成的报告被认为显著不如人类撰写的报告有用(M=5.40 vs. M=5.71,p<.05)。
- 政党倾向影响了对逻辑性的感知,共和党和民主党在信任动态上存在差异。
- 相较基线的优势: LLM生成的报告在准确性和逻辑性上与人类报告相当,但在实用性上有所欠缺,突出了改进空间。
- 实验/评估:
- 数据集: 120份关于健康、公民事务、科学和政治的事实核查报告,真伪均衡。
- 评价指标: 准确性、实用性、逻辑性、幻觉、参与度、相关性。
- 工具: 使用零样本提示的GPT-4 Turbo。
- 局限性与未来工作:
- 由于样本集中于美国专家且人类报告条件固定,研究的普适性有限。
- 存在潜在的提示效应以及LLM能力的演进(如GPT-5)。
- 未来研究应探索更先进的LLM设计、界面透明性以及跨文化评估。
总结
本研究评估了媒体专家对比LLM生成与人类撰写的事实核查报告的看法。尽管LLM报告在准确性和逻辑性上与人类报告相当,但在实用性上显著逊色,尤其是在未披露来源的情况下。政党倾向影响了对逻辑性的感知,定性反馈突出了对来源真实性、推理能力和AI局限性的担忧。这些发现强调了改进LLM设计和透明性以建立专业人士信任的必要性。该研究为将AI整合到事实核查工作流中以及推进人机协作提供了可操作的见解。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
当前问题库还没有收录这篇论文的问题与痛点。
快捷操作
广告推荐
学习 AI 编程到 CodeNow
open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3772318.3791625
一眼看懂
fact_check论文快照
dataset
来源
CHI
calendar_month
年份
2026
emoji_events
奖项
未标记奖项
group
作者
6 位作者
sell
研究子方向
可解释人工智能(XAI)、虚假信息与事实核查、大语言模型(LLM)的人机协作
work
职业/产业
事实核查员、记者与编辑、AI/ML 研究员与工程师
article
内容状态
已索引正文
hub
相关论文
3 篇相关论文