生成式AI如何赋能攻击者和防御者:信任与安全全景分析

生成式AI(文本、图像、音乐、视频)AI 伦理、公平与问责隐私设计与用户控制深度伪造与合成媒体检测在线骚扰与反制工具网络安全工程师隐私政策制定者内容治理与平台合规团队HCI 研究员

文献标题

How Generative AI Empowers Attackers and Defenders Across the Trust & Safety Landscape

出版信息

  • 主题领域: 生成式人工智能对信任与安全的双重影响,重点探讨其在攻击者和防御者中的应用。
  • 关键词: 生成式人工智能,信任与安全,内容审核,网络犯罪,虚假信息,诈骗,暴力极端主义,儿童安全,仇恨言论,对抗叙事。

背景与问题

  • 问题 / 挑战: 生成式人工智能(GenAI)正在改变信任与安全领域,使攻击者能够扩大和增强有害活动规模,而防御者则难以调整现有系统来应对这些威胁。
  • 重要性: GenAI的快速发展对在线安全构成重大风险,包括有害内容、诈骗和虚假信息的扩散,同时也提供了潜在的防御和缓解工具。
  • 动机与相关研究: 之前的研究主要关注防止人工智能滥用的技术措施,但未充分探讨攻击者和防御者之间不断演变的社会技术动态。本论文在现有研究基础上,通过与领域专家合作,深入探讨GenAI在五个关键信任与安全领域的具体影响。

解决方案

  • 提出的方法: 通过定性研究,开展参与式研讨会,涉及来自五个领域的43位信任与安全专家:儿童安全、选举诚信、仇恨与骚扰、诈骗以及暴力极端主义。
  • 创新点:
    1. 对GenAI如何同时赋能攻击者和防御者进行领域特定分析。
    2. 阐明信任与安全操作中的结构性差异及实际影响。
    3. 提出一个战略框架,用于在防御中利用GenAI,同时应对其风险。
    4. 提供关于攻击者和防御者能力在GenAI时代共同演变的洞察。
  • 过程与关键技术:
    • 在亚洲、欧洲和北美举办了六小时的参与式研讨会。
    • 参与者包括来自民间社会、行业和学术界的专家。
    • 活动包括记忆体验卡、变化卡和未来故事,用于探讨GenAI的影响。
    • 数据通过反思性主题分析进行分析,以识别跨领域和领域特定的主题。

结果

  • 具体发现:
    • GenAI使攻击者能够扩大有害内容的规模,降低进入门槛,并创建复杂且个性化的攻击。
    • 防御者可以利用GenAI进行内容审核、调查、对抗叙事以及用户支持。
    • GenAI的双重用途特性引发了攻击者与防御者之间的“军备竞赛”。
  • 相较基线的优势:
    • GenAI为防御者提供了应对长期和新兴威胁的新工具,例如自动化内容审核和改进调查工作流程。
    • 然而,攻击者目前更有效地利用GenAI,超越了现有的防御措施。
  • 实验 / 评估:
    • 通过五个领域的43位专家参与的研讨会,提供了关于GenAI影响的定性洞察。
    • 参与者强调了领域特定的挑战和机遇,例如儿童安全领域的结构性变革需求以及选举诚信的细化政策需求。
  • 局限性与未来工作:
    • 研究结果受限于所研究的特定领域和参与者的背景。
    • 快速发展的GenAI技术可能会随着时间改变专家的观点。
    • 未来工作应探索跨行业合作,并开发GenAI在信任与安全领域应用的标准化基准。

总结

本文探讨了生成式人工智能如何重塑信任与安全领域,同时赋能攻击者和防御者。通过对五个领域的43位专家进行定性研究,作者揭示了GenAI如何提升攻击规模和复杂性,同时提供新的防御能力。主要贡献包括领域特定挑战的洞察、攻击者与防御者策略的共同演变,以及信任与安全操作中结构性变革的必要性。研究结果强调了负责任地利用GenAI以创造更安全的在线环境,同时解决其固有风险的紧迫性。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/chi/222347/2026

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3772318.3791363
一眼看懂

论文快照

fact_check
dataset
来源
CHI
calendar_month
年份
2026
emoji_events
奖项
未标记奖项
group
作者
5 位作者
sell
研究子方向
生成式AI(文本、图像、音乐、视频)、AI 伦理、公平与问责、隐私设计与用户控制、深度伪造与合成媒体检测
work
职业/产业
网络安全工程师、隐私政策制定者、内容治理与平台合规团队、HCI 研究员
article
内容状态
已索引正文
hub
相关论文
0 篇相关论文