红队测试LLM作为社会技术实践:从探索与数据创建到评估

荣誉提名
可解释人工智能(XAI)AI 伦理、公平与问责算法透明度与可审计性AI/ML 研究员与工程师HCI 研究员数据科学家与分析师

文献标题

Red Teaming LLMs as Socio-Technical Practice: From Exploration and Data Creation to Evaluation

出版信息

  • 主题领域: 针对大型语言模型(LLMs)的红队测试,用于安全性和可靠性评估。
  • 关键词: 红队测试,对抗性数据集,大型语言模型,人工智能安全,社会技术实践,评估指标,危害分类法,人机交互,风险评估,数据集创建。

背景与问题

  • 问题/挑战: 当前针对LLMs的红队测试工作主要集中于技术基准和攻击成功率,忽视了定义、创建和评估对抗性数据集所涉及的社会技术实践。
  • 重要性: 对抗性数据集是评估LLM漏洞和潜在危害的重要工具,对模型对齐和安全性改进具有深远影响。理解这些数据集的构建和评估方式对于解决更广泛的社会影响至关重要。
  • 动机与相关工作: 红队测试起源于安全领域,现已成为人工智能评估的核心,尤其是针对LLMs。此前的研究强调了偏见、有害或误导性输出的风险,但未充分探讨数据集创建和评估的社会技术维度。

解决方案

  • 提出的方法: 通过对AI从业者进行半结构化访谈的实证研究,以了解对抗性数据集的概念化、开发和评估过程。
  • 创新性:
    1. 提供关于从业者如何概念化红队测试和数据集创建的实证证据。
    2. 识别红队测试实践中在上下文、交互类型和用户特异性方面的差距。
    3. 提出扩展红队测试评估以反映社会技术维度的建议。
  • 过程与关键技术:
    • 对来自学术界、工业界和开源社区的22位AI从业者进行了半结构化访谈。
    • 对访谈记录进行主题分析,识别数据集创建、风险定义和评估实践中的模式。
    • 突出红队测试中的三个关键时刻:任务定义、数据集开发和评估。

结果

  • 具体发现:
    • 从业者将红队测试概念化为探索(寻找攻击案例)或分类(检测预定义的有害内容)。
    • 对抗性数据集的创建有三种方法:重新利用现有数据集、从零开始创建数据集或从人类与LLM的交互中派生数据集。
    • 评估方法主要依赖自动分类器和LLM评审,但人类评估对于细致判断仍然至关重要。
  • 相较基线的优势:
    • 识别了当前红队测试实践中的社会技术差距,例如忽视上下文、交互类型和用户特异性需求。
    • 提出了可操作性建议以解决这些差距,强调跨学科合作和参与式方法的重要性。
  • 实验/评估:
    • 访谈涵盖了多样化的从业者背景,包括博士研究生、研究人员和来自八个国家的工程师。
    • 分析揭示了定义危害、评估对抗性输出以及确保数据集多样性方面的挑战。
  • 局限性与未来工作:
    • 研究样本中行业从业者的代表性有限。
    • 未来工作应探索参与式方法,以吸引终端用户和领域专家参与红队测试评估。

摘要

本研究通过分析从业者如何定义任务、开发对抗性数据集以及评估模型漏洞,探讨了LLMs红队测试的社会技术实践。研究发现,有害性是通过嵌入数据集创建和评估中的文化规范和技术决策构建的。研究指出了在处理上下文、交互类型和用户特异性需求方面的差距,并为HCI研究人员设计更具包容性和上下文意识的红队测试方法提供了建议。这些见解通过将社会技术维度整合到红队测试实践中,为推动人工智能安全评估提供了重要贡献。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/chi/222348/2026

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3772318.3790792
一眼看懂

论文快照

fact_check
dataset
来源
CHI
calendar_month
年份
2026
emoji_events
奖项
荣誉提名
group
作者
4 位作者
sell
研究子方向
可解释人工智能(XAI)、AI 伦理、公平与问责、算法透明度与可审计性
work
职业/产业
AI/ML 研究员与工程师、HCI 研究员、数据科学家与分析师
article
内容状态
已索引正文
hub
相关论文
10 篇相关论文