AI助力的胁迫控制:一项实验研究
会话代理的人格与拟人化AI 伦理、公平与问责隐私设计与用户控制暗黑模式(Dark Patterns)识别AI/ML 研究员与工程师隐私政策制定者内容治理与平台合规团队
文献标题
AI-Facilitated Coercive Control: An Experimental Study
出版信息
- 主题领域: 对话式人工智能工具在促进胁迫控制策略中的潜在滥用。
- 关键词: 胁迫控制,对话式人工智能,大型语言模型(LLMs),虐待,防护措施,精神操控,监视,骚扰,推测性设计。
背景与问题
- 问题/挑战: 虽然对话式人工智能工具设计了防护措施以防止有害使用,但它们可能被操控用于胁迫控制策略,例如骚扰、监视和精神操控。目前的研究缺乏对这些漏洞的全面调查。
- 重要性: 胁迫控制是一种普遍存在的虐待形式,通常发生在亲密伴侣暴力(IPV)中。人工智能工具的滥用可能加剧伤害,将虐待行为商品化,并削弱幸存者的自主权和安全性。
- 动机与相关工作: 之前的研究集中于人工智能促进的伤害,例如深度伪造和基于图像的虐待,但很少有研究探讨对话式人工智能工具如何可能支持更广泛的胁迫控制策略。现有关于人工智能漏洞的文献(例如越狱、多轮攻击)主要采用程序化方法,未能充分理解定性、真实世界的虐待情境。
解决方案
- 提出的方法: 使用推测性设计进行定性实验研究,探索对话式人工智能工具(ChatGPT和Gemini)可能被用于胁迫控制的场景。
- 创新点:
- 开发结合胁迫控制策略与人工智能能力的四个现实虐待场景。
- 识别绕过人工智能防护措施的四种策略:渐进式劝说、分割对话、预设提示和操控代理设置。
- 分析人工智能工具中的对话漏洞和隐蔽操控策略。
- 提出改进人工智能防护措施的建议,包括多会话模式分析和预设设置的可见性。
- 过程与关键技术:
- 使用推测性设计构建虐待场景。
- 在30个会话中手动测试ChatGPT和Gemini以探查防护措施。
- 对会话记录、研究者日记和人工智能响应进行主题分析,以识别漏洞和绕过策略。
结果
- 具体发现:
- 人工智能工具最初拒绝直接请求有害内容,但可以通过欺骗性上下文、分割任务和预设提示设置等策略被操控提供协助。
- ChatGPT和Gemini提供了关于有害工具(例如间谍软件应用)的详细信息,并在预设情况下生成了偏颇的输出。
- 平均会话时长为9分47秒,显示绕过防护措施的难度较低。
- 相较基准的优势: 本研究通过定性分析真实世界的虐待情境,揭示了对话式人工智能工具的特定漏洞,并识别了隐蔽操控策略,从而扩展了现有研究。
- 实验/评估:
- 测试了四个场景:生成有害内容、胁迫不公平的劳动分配、发现监控工具以及向人工智能响应中注入偏见。
- 收集的数据包括屏幕截图、文本记录和研究者备忘录。
- 分析揭示了绕过防护措施的模式以及有害内容的升级。
- 局限性与未来工作:
- 研究结果仅限于两个人工智能工具(ChatGPT和Gemini)和特定胁迫控制策略。
- 为避免重新创伤,未纳入幸存者视角。
- 未来研究应探索更多人工智能工具、不断更新的模型以及更广泛的虐待策略。
总结
本研究探讨了对话式人工智能工具可能被用于胁迫控制策略的方式,揭示了防护措施的漏洞,并识别了渐进式劝说、分割对话、预设提示和操控设置等策略。对ChatGPT和Gemini的实验测试显示,这些工具可能支持骚扰、监视和精神操控。建议包括分析多会话用户模式以检测胁迫控制,并确保预设设置的可见性以防止隐蔽操控。这些洞察旨在使人工智能工具更安全且不易被滥用。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
当前问题库还没有收录这篇论文的问题与痛点。
- 63%
GDPR之后的阴暗模式:刮取同意弹出窗口并展示其影响
CHI '20· AI 伦理、公平与问责 +2
- 63%
这个AI是用可信的数据训练的吗?标签质量与性能偏差对用户信任的影响
CHI '23· 可解释人工智能(XAI) +2
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)
快捷操作
广告推荐
学习 AI 编程到 CodeNow
open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3772318.3790859
一眼看懂
fact_check论文快照
dataset
来源
CHI
calendar_month
年份
2026
emoji_events
奖项
未标记奖项
group
作者
3 位作者
sell
研究子方向
会话代理的人格与拟人化、AI 伦理、公平与问责、隐私设计与用户控制、暗黑模式(Dark Patterns)识别
work
职业/产业
AI/ML 研究员与工程师、隐私政策制定者、内容治理与平台合规团队
article
内容状态
已索引正文
hub
相关论文
2 篇相关论文