快速思考,缓慢思考,批判性思考:设计一个自动宣传检测工具

大语言模型(LLM)的人机协作可解释人工智能(XAI)虚假信息与事实核查事实核查员政府官员与公务员HCI 研究员

文献标题

Think Fast, Think Slow, Think Critical: Designing an Automated Propaganda Detection Tool

文献信息

  • 主题领域: 人机交互、数字新闻中的宣传检测与批判性思维
  • 关键词: 双系统思维, 宣传检测, 数字环境, 数字提示, 大语言模型, 新闻消费, 网页插件, 批判性阅读

研究背景与问题

背景描述

随着互联网发展,数字新闻的快速消费成为常态,个人面临越来越多的带有偏见、误导性或宣传性质的信息。这种环境会危害批判性思维的培养,而批判性思维是民主社会的重要支柱。宣传泛滥现象,例如俄乌战争中的宣传内容,使人们难以辨别信息的真实性和目的性。

核心问题

  1. 难以识别宣传内容: 宣传内容包含复杂的语言技巧,通常富有隐蔽性,使普通人难以在阅读新闻时迅速识别这种内容。
  2. 快速而不加批判的新闻消费: 快速消费新闻导致读者倾向于基于情感或直觉(“系统1”)形成判断,而缺乏深入反思(“系统2”),从而便于宣传对其观点和认知的操纵。

研究动机

作者基于上述问题提出了开发一种名为“ClarifAI”的自动化宣传检测工具的可行性方案,其设计借鉴了双系统理论、数字提示和大语言模型(LLMs)技术,以帮助用户从直觉型新闻消费转变为批判性新闻阅读。

解决方案

方法概述

  1. 工具设计: 提出了一款名为ClarifAI的浏览器扩展工具,在用户浏览新闻的过程中实时高亮可能含有宣传技术的段落,并生成解释说明。
  2. 设计科学研究方法: 采用设计科学研究方法(DSRM),包括问题识别、目标定义、设计与开发、原型演示、验证和成果传播。
  3. 技术手段: 使用 GPT-4 模型实现实时宣传检测和附加解释,生成用户友好的新闻分析工具。

创新之处

  1. 技术层面: 将LLMs用于宣传检测,结合了富有透明度的结果解释,与现有技术相比增强了用户信任感和理解能力。
  2. 设计层面: 通过引入数字提示(digital nudges,如颜色标注等),实现了对用户新闻消费习惯的非侵入式引导。
  3. 认知切入: 整合了卡尼曼的“双系统理论”,将设计目标分为“直观互动”(快速帮助用户识别)和“深入反思”(提供解释以增加批判性分析)。

实施步骤及关键技术

  1. 定义目标:
    • DG1: 直观互动,快速识别宣传。
    • DG2: 批判分析,深入理解新闻内容。
  2. 数字提示与功能实现:
    • 数字提示(DN): 包括自动检测、高亮显示、实时警报、交互式解释等。
    • 功能实现(IF): 包括浏览器扩展(嵌入自然的阅读环境)、自动检测与内容标记、生成上下文相关的解释。
  3. 实验与测评:
    • 设计一个包括实验组和对照组的在线实验测试,验证工具对用户阅读行为与批判性思维的影响。
    • 使用专家评估方法验证工具的功能及生成解释的准确性。

研究成果

具体成果

  1. 用户实验结果:

    • 使用 ClarifAI 的组别显示出显著更高的宣传意识(Full 版本的用户中96%更强意识)。
    • 用户对新闻内容的批判性分析能力显著提高,特别是在包含解释的 Full 版本中。
    • 阅读时间统计显示,含解释的版本(Full)显著延长了阅读时长(199秒 vs Basic 的150秒),表明其促进了更加深入的思考。
    • 双系统变量分析:Full 版本显著增强用户对新闻的“慢思考”(即批判性分析)的倾向。
  2. 专家评价结果:

    • 对107条检测实例的分析表明,ClarifAI 的检测正确率为68.2%,尤其在可信性(64%的评分为“好”)和清晰度(62%的评分为“好”)方面表现优异。
  3. 用户满意度:

    • Net Promoter Score(NPS)方面,Full 版本获得了正向评价(12 分的 NPS,相较于 Light 版本的 -26 分),反映出解释生成对用户体验的积极影响。

优势对比

与现有的新闻验证工具相比,ClarifAI 的优势在于:

  1. 提供实时、上下文相关的宣传检测。
  2. 附加的宣传技术解释增强了用户对复杂新闻技巧的理解。
  3. 工具设计符合用户阅读自然习惯,操作便利,无需额外的学习成本。

局限性与未来方向

  1. 主观性问题: 当前实验结果基于自我报告,未来可结合眼动追踪等更客观的评估方式。
  2. 长期效果研究缺失: 尚未覆盖 ClarifAI 对用户长期新闻消费行为及批判性思维能力的作用。
  3. 算法局限性: LLM 的生成可能存在偶发的迷幻现象(hallucination)或政治偏向,未来需探索更为鲁棒的模型。
  4. 生态有效性: 实验环境与真实新闻消费中的生态场景可能存在差异。
  5. 商业化可行性: GPT-4 的使用成本可能限制了工具的大规模推广,未来可探索更经济的开源模型或商业化资助模式。

附加信息

作者通过实验与专家审查,验证了宣传检测工具对批判性新闻阅读的积极作用。这一研究不仅拓展了人工智能技术在新闻领域的应用,也为通过设计科学方法促进数字时代的批判性思维提供了新的见解。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/chi/147239/2024

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3613904.3642805
一眼看懂

论文快照

fact_check
dataset
来源
CHI
calendar_month
年份
2024
emoji_events
奖项
未标记奖项
group
作者
5 位作者
sell
研究子方向
大语言模型(LLM)的人机协作、可解释人工智能(XAI)、虚假信息与事实核查
work
职业/产业
事实核查员、政府官员与公务员、HCI 研究员
article
内容状态
已索引正文
hub
相关论文
1 篇相关论文