大规模欺骗:大语言模型生成的 1000 个电子商务组件中的欺骗性设计
作者
AI 伦理、公平与问责暗黑模式(Dark Patterns)识别大语言模型(LLM)的人机协作AI/ML 研究员与工程师UI/UX 设计师电商平台运营者
文献标题
Deception at Scale: Deceptive Designs in 1K LLM-Generated E-Commerce Components
出版信息
- 主题领域: 大型语言模型(LLMs)与电子商务界面中的欺骗性设计模式。
- 关键词: LLMs, 欺骗性设计, 黑暗模式, 电子商务, 界面干扰, 用户中心设计, 商业激励, 人类价值观, 提示工程, 前端代码。
背景与问题
- 问题/挑战: LLM生成的前端代码通常嵌入欺骗性设计,可能无意间扩大有害实践的规模。
- 重要性: 欺骗性设计可能对用户造成经济损害、侵犯隐私并增加认知负担,其自动化生成可能导致广泛部署而缺乏监督。
- 动机与相关研究: 先前研究记录了人工设计界面中的欺骗性设计,并发现了LLM生成代码中存在黑暗模式的初步证据。然而,关于LLM输出中欺骗性设计的频率、策略和缓解措施的系统性大规模调查仍然缺乏。
解决方案
- 提出的方法: 对LLM生成的电子商务组件进行大规模审计,以识别欺骗性设计,评估影响因素,并测试减少其频率的策略。
- 创新点:
- 首次对LLM生成的前端代码中的欺骗性设计进行大规模审计。
- 引入设计理由以推断意图和交互假设。
- 测试利益相关者兴趣提示和用户中心策略以缓解欺骗性设计。
- 开发了一个包含1,296个注释电子商务组件的数据集。
- 程序与关键技术:
- 研究1:使用四种LLM在三种利益相关者兴趣条件(商业、用户、基线)下生成15种电子商务类型的1,080个组件。根据Gray等人的分类法对设计进行注释。
- 研究2:测试三种新的用户中心提示策略(直接缓解、欺骗定义、人类价值观)在六个组件上使用两种LLM。比较输出以减少欺骗性设计的频率。
结果
- 具体发现:
- 55.8%的组件至少包含一个欺骗性设计,30.6%的组件包含两个或更多。
- 界面干扰是主要策略(占63.2%的实例),其次是强制行为(15.3%)和社会工程(14.0%)。
- 商业兴趣提示使欺骗性设计增加了15.8个百分点,而用户兴趣提示减少了5.8个百分点。
- 人类价值观提示相比基线减少了15.3个百分点的欺骗性设计。
- 相较基线的优势:
- DeepSeek-V3生成的欺骗性设计显著较少(46.3%),相比之下Gemini 2.5 Pro(60.7%)、Grok 3 Beta(60.4%)和GPT-4.1(55.9%)的比例更高。
- 人类价值观提示是最有效的缓解策略,优于直接缓解和欺骗定义策略。
- 实验/评估:
- 研究1:采用因子设计测试15个组件、4种LLM和3种利益相关者兴趣条件。对1,080个输出进行人工注释。
- 研究2:对6个组件和2种模型在3种新的用户中心策略下进行分层抽样。对216个输出进行人工注释。
- 局限性与未来工作:
- 仅关注电子商务组件,其他领域可能表现出不同的模式。
- 静态组件排除了基于JavaScript的动态行为。
- 一些注释分歧突显了需要改进标准并进一步研究有争议案例的必要性。
摘要
本文首次对LLM生成的电子商务组件中的欺骗性设计进行了大规模审计,发现超过一半的输出至少包含一个黑暗模式。研究确定界面干扰是主要策略,并显示商业兴趣提示显著增加了欺骗性设计,而人类价值观提示是减少欺骗性设计最有效的策略。通过引入设计理由和测试缓解策略,本文突出了LLM辅助代码生成中的系统性风险,并为开发者和提供者提出了嵌入保障措施和人类价值观的可操作性建议,以改进未来系统。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
当前问题库还没有收录这篇论文的问题与痛点。
快捷操作
广告推荐
学习 AI 编程到 CodeNow
open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3772318.3791063
一眼看懂
fact_check论文快照
dataset
来源
CHI
calendar_month
年份
2026
emoji_events
奖项
未标记奖项
group
作者
5 位作者
sell
研究子方向
AI 伦理、公平与问责、暗黑模式(Dark Patterns)识别、大语言模型(LLM)的人机协作
work
职业/产业
AI/ML 研究员与工程师、UI/UX 设计师、电商平台运营者
article
内容状态
已索引正文
hub
相关论文
2 篇相关论文