大语言模型还是人类?研究摘要的信任与质量感知研究

大语言模型(LLM)的人机协作可解释人工智能(XAI)AI辅助写作与文本生成大学教授与研究人员HCI 研究员AI/ML 研究员与工程师

文献标题

LLM or Human? Perceptions of Trust and Quality in Research Summaries

出版信息

  • 主题领域: 对比LLM生成与人工撰写学术摘要的信任与质量感知。
  • 关键词: 大型语言模型、学术写作、信任、质量评估、披露、人机协作、科学传播、摘要生成、读者感知、AI辅助写作。

背景与问题

  • 问题与挑战: 读者难以区分LLM生成与人工撰写的摘要,且LLM参与对信任与质量感知的影响尚不明确。同时,关于学术写作中LLM使用的披露规范尚无共识。
  • 重要性: 理解LLM生成内容的感知方式对于指导披露政策、促进科学传播中的信任以及确保对AI辅助写作的公平评估至关重要。
  • 动机与相关研究: 先前研究显示AI披露对信任与质量判断的影响存在分歧,读者常常错误分类AI生成内容。然而,关于LLM参与及其披露如何影响学术环境中的感知,系统性证据仍然有限。

解决方案

  • 提出的方法: 采用混合方法的问卷实验,评估读者对人工撰写、LLM生成和LLM编辑摘要的感知,并比较披露与未披露LLM参与情况的影响。
  • 创新点:
    1. 对读者检测摘要中LLM参与情况的能力进行实证评估。
    2. 分析实际与感知的LLM参与如何影响信任与质量判断。
    3. 识别三种不同的读者对LLM辅助写作的态度。
    4. 提供关于披露对AI辅助内容感知影响的洞察。
  • 流程与关键技术:
    • 参与者(N=69,机器学习领域专家)在两种条件下评估摘要:披露作者身份(信息条件)与未披露(猜测条件)。
    • 摘要分为人工撰写、LLM生成和LLM编辑三类。
    • 参与者使用Likert量表对摘要的信任度、清晰度、全面性、吸引力和简洁性进行评分。
    • 通过摘要选择任务评估行为信任。
    • 对参与者关于LLM生成内容的推理和态度进行定性分析。

结果

  • 具体发现:
    • 参与者无法可靠区分人工撰写、LLM生成和LLM编辑的摘要(分类准确率接近随机水平)。
    • LLM编辑的摘要在清晰度和可信度评分中最高,而LLM生成的摘要评分最低。
    • 披露LLM参与情况提高了所有摘要类型的信任评分。
  • 相较基线的优势:
    • 在披露作者身份的情况下,55%的参与者更偏好LLM编辑的摘要,而人工撰写和LLM生成的摘要分别仅获得27%-28%的偏好。
    • 披露减少了猜测带来的怀疑,使参与者能够专注于内容质量而非作者身份。
  • 实验与评估:
    • 参与者评估了150篇摘要(每种类型50篇),这些摘要来自arXiv上的机器学习论文。
    • 测量包括Likert量表评分、行为信任(摘要选择)和定性推理分析。
    • 统计模型控制了参与者和任务层面的影响。
  • 局限性与未来工作:
    • 对非专家群体及其他学术领域的适用性有限。
    • 仅研究了单一LLM(Llama 3.1 8B)和固定提示词。
    • 未来研究应探索多样化人群、多种LLM、纵向影响以及现实行为(如引用选择)。

总结

本研究探讨了读者对人工撰写、LLM生成和LLM编辑摘要的信任与质量感知。参与者无法可靠识别LLM参与情况,但更偏好LLM编辑的摘要,认为其更清晰且更值得信赖,尤其是在披露作者身份的情况下。披露LLM使用提高了所有摘要类型的信任评分,挑战了关于AI披露会带来负面影响的假设。研究识别了三种读者态度——披露倡导者、务实怀疑者和乐观主义者,揭示了对LLM辅助写作的多样化观点。这些发现为披露政策和AI工具设计提供了指导,以增强科学传播中的信任与质量。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/chi/222979/2026

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3772318.3793386
一眼看懂

论文快照

fact_check
dataset
来源
CHI
calendar_month
年份
2026
emoji_events
奖项
未标记奖项
group
作者
6 位作者
sell
研究子方向
大语言模型(LLM)的人机协作、可解释人工智能(XAI)、AI辅助写作与文本生成
work
职业/产业
大学教授与研究人员、HCI 研究员、AI/ML 研究员与工程师
article
内容状态
已索引正文
hub
相关论文
10 篇相关论文