大语言模型还是人类?研究摘要的信任与质量感知研究
作者
大语言模型(LLM)的人机协作可解释人工智能(XAI)AI辅助写作与文本生成大学教授与研究人员HCI 研究员AI/ML 研究员与工程师
文献标题
LLM or Human? Perceptions of Trust and Quality in Research Summaries
出版信息
- 主题领域: 对比LLM生成与人工撰写学术摘要的信任与质量感知。
- 关键词: 大型语言模型、学术写作、信任、质量评估、披露、人机协作、科学传播、摘要生成、读者感知、AI辅助写作。
背景与问题
- 问题与挑战: 读者难以区分LLM生成与人工撰写的摘要,且LLM参与对信任与质量感知的影响尚不明确。同时,关于学术写作中LLM使用的披露规范尚无共识。
- 重要性: 理解LLM生成内容的感知方式对于指导披露政策、促进科学传播中的信任以及确保对AI辅助写作的公平评估至关重要。
- 动机与相关研究: 先前研究显示AI披露对信任与质量判断的影响存在分歧,读者常常错误分类AI生成内容。然而,关于LLM参与及其披露如何影响学术环境中的感知,系统性证据仍然有限。
解决方案
- 提出的方法: 采用混合方法的问卷实验,评估读者对人工撰写、LLM生成和LLM编辑摘要的感知,并比较披露与未披露LLM参与情况的影响。
- 创新点:
- 对读者检测摘要中LLM参与情况的能力进行实证评估。
- 分析实际与感知的LLM参与如何影响信任与质量判断。
- 识别三种不同的读者对LLM辅助写作的态度。
- 提供关于披露对AI辅助内容感知影响的洞察。
- 流程与关键技术:
- 参与者(N=69,机器学习领域专家)在两种条件下评估摘要:披露作者身份(信息条件)与未披露(猜测条件)。
- 摘要分为人工撰写、LLM生成和LLM编辑三类。
- 参与者使用Likert量表对摘要的信任度、清晰度、全面性、吸引力和简洁性进行评分。
- 通过摘要选择任务评估行为信任。
- 对参与者关于LLM生成内容的推理和态度进行定性分析。
结果
- 具体发现:
- 参与者无法可靠区分人工撰写、LLM生成和LLM编辑的摘要(分类准确率接近随机水平)。
- LLM编辑的摘要在清晰度和可信度评分中最高,而LLM生成的摘要评分最低。
- 披露LLM参与情况提高了所有摘要类型的信任评分。
- 相较基线的优势:
- 在披露作者身份的情况下,55%的参与者更偏好LLM编辑的摘要,而人工撰写和LLM生成的摘要分别仅获得27%-28%的偏好。
- 披露减少了猜测带来的怀疑,使参与者能够专注于内容质量而非作者身份。
- 实验与评估:
- 参与者评估了150篇摘要(每种类型50篇),这些摘要来自arXiv上的机器学习论文。
- 测量包括Likert量表评分、行为信任(摘要选择)和定性推理分析。
- 统计模型控制了参与者和任务层面的影响。
- 局限性与未来工作:
- 对非专家群体及其他学术领域的适用性有限。
- 仅研究了单一LLM(Llama 3.1 8B)和固定提示词。
- 未来研究应探索多样化人群、多种LLM、纵向影响以及现实行为(如引用选择)。
总结
本研究探讨了读者对人工撰写、LLM生成和LLM编辑摘要的信任与质量感知。参与者无法可靠识别LLM参与情况,但更偏好LLM编辑的摘要,认为其更清晰且更值得信赖,尤其是在披露作者身份的情况下。披露LLM使用提高了所有摘要类型的信任评分,挑战了关于AI披露会带来负面影响的假设。研究识别了三种读者态度——披露倡导者、务实怀疑者和乐观主义者,揭示了对LLM辅助写作的多样化观点。这些发现为披露政策和AI工具设计提供了指导,以增强科学传播中的信任与质量。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
当前问题库还没有收录这篇论文的问题与痛点。
- 100%
Minor Revisions接受:AI辅助科学写作的价值
IUI '26· 大语言模型(LLM)的人机协作 +2
- 71%
作者身份漂移:LLM辅助写作中自我效能感与信任的演变
CHI '26· 大语言模型(LLM)的人机协作 +2
- 71%
HCI中LLM集成系统的报告与评审:挑战与考量
CHI '26· 大语言模型(LLM)的人机协作 +2
- 71%
DraftMarks:通过交互式拟物化过程痕迹增强人机协作写作透明度
CHI '26· 大语言模型(LLM)的人机协作 +2
- 71%
从使用到监督:心理模型如何影响用户行为和人工智能写作助手的输出
CHI '26· 大语言模型(LLM)的人机协作 +2
- 71%
学术问答系统中大语言模型错误评估的专家模式
CHI '26· 大语言模型(LLM)的人机协作 +2
- 71%
交互式机器学习中可控性与认知负荷的多模态研究
IUI '26· 大语言模型(LLM)的人机协作 +2
- 71%
通过交互式解释接口提升人类对大语言模型推理的验证能力
IUI '26· 大语言模型(LLM)的人机协作 +2
- 67%
交互式知识获取中避免过拟合的用户建模方法
IUI '18· 大语言模型(LLM)的人机协作 +1
- 67%
DxHF:通过交互式分解为LLM对齐提供高质量人类反馈
UIST '25· 大语言模型(LLM)的人机协作 +1
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)
快捷操作
广告推荐
学习 AI 编程到 CodeNow
open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3772318.3793386
一眼看懂
fact_check论文快照
dataset
来源
CHI
calendar_month
年份
2026
emoji_events
奖项
未标记奖项
group
作者
6 位作者
sell
研究子方向
大语言模型(LLM)的人机协作、可解释人工智能(XAI)、AI辅助写作与文本生成
work
职业/产业
大学教授与研究人员、HCI 研究员、AI/ML 研究员与工程师
article
内容状态
已索引正文
hub
相关论文
10 篇相关论文