用户驱动的价值观对齐:理解用户对AI伴侣中偏见和歧视性陈述的看法及应对策略
作者
研究背景与问题
-
发现的问题或挑战: 作者发现基于大型语言模型(LLM)创建的AI伙伴(AI companions)在日常互动中可能生成偏见、歧视性以及有害的语句。这些问题带来了心理伤害、社会刻板印象的加深,尤其是对边缘化群体有潜在的负面影响。同时,现有由技术专家主导的价值对齐框架(如“帮助、诚实和无害”原则)的通用性有限,难以完全满足用户在实际交互中的具体需求。
-
重要性: AI伙伴已从普通聊天机器人转变为用户的虚拟朋友、伴侣甚至家庭成员,形成一种情感连接。这种情感依赖使人们在面对AI生成的歧视性内容时感到强烈的情绪困惑和伤害。因此,在动态的现实用户与AI互动场景中,需要引入一种新的价值对齐途径来避免和缓解这些问题。
-
研究动机与相关工作: 作者提出了用户主导价值对齐(User-Driven Value Alignment)的概念,旨在探索用户如何通过交互主动识别并纠正AI系统的有害行为。同时,这种方法寻求扩展用户在与AI系统对齐其价值和伦理标准过程中的主动性,与过去的技术专家主导方法或用户算法审计方法相比具有创新性。
解决方案
-
提出的方法或解决方案: 作者引入了“用户主导价值对齐”的概念,强调用户在日常互动中对AI输出的偏见识别、质疑以及矫正,通过多种策略重新引导AI行为,使其反映个人或社区价值。这些策略分为技术策略(如重生成或回退)、论证策略(例如表达愤怒或说理劝导)以及角色策略(例如修改AI角色设置)。
-
创新之处:
- 用户主动参与:从传统的用户仅反馈训练数据转变为实时主动的价值调整过程。
- 实际环境适配:对齐过程直接基于用户在真实生活中的个体化交互场景进行。
- 强调个性与社区需求:比通用性框架更好地反映了用户的特异性期望、价值及社会文化。
- 重视长期迭代优化:用户通过连续的交互和反馈逐步调整AI表现,从而推动其行为改善。
-
实施步骤与关键技术:
- 从多种社交媒体平台(如Reddit、抖音等)收集用户提交的77条关于AI伙伴歧视性语句的投诉帖子。
- 招募20位在AI伙伴应用中有经验的用户,进行半结构化访谈,调查用户对抗AI偏见的策略及其对AI行为的理解。
- 使用反思性主题分析方法对访谈和帖子数据进行编码,揭示用户感知的歧视性语句类别、对AI行为的概念化,以及用户采用的对齐策略。
研究成果
-
具体成果:
- 识别了六种用户感知的常见歧视类型,包括性别歧视(misogyny)、LGBTQ+偏见、外貌偏见、能力歧视(ableism)、种族歧视和社会经济偏见。
- 用户将AI行为概念化为三种形态:机器(Machine)、需要教导的婴儿(Baby)以及扮演角色的Cosplayer。
- 总结了七种用户对齐策略,并分类为技术、论证和角色三种高级类别。
- 用户对这些策略的短期效果感知表明对齐过程中仍存在现实与期望之间的落差。
-
与现有解决方案的优势: 相较于技术专家主导的方法,用户主导的价值对齐更强调用户的参与性和自主性,能够更好地在复杂多变的现实场景中适配个体和社区的需求。此外,它通过迭代交互建立更加长期有效的行为改进机制。
-
实验或评估结果: 在短期评估中,技术性策略常常无法完全解决问题,而论证类策略虽然有效但可能对用户情绪造成负担。角色策略则通常适用于短期纠正,但无法解决更深层次的偏见问题。
-
局限性与未来方向:
- 研究基于自我报告数据,可能存在情感和叙述偏差。
- 样本量较小,主要以定性方法为主,难以广泛推广。
- 仅集中研究AI伙伴中的偏见问题,未来可扩展至其他类型的AI系统与价值对齐领域。
- 尚未测试这些策略的长期有效性,可开展更具针对性的大规模实验或纵向研究。
总结
本文为探索用户主导价值对齐现象迈出了重要一步。通过分析用户对AI伙伴偏见的感知、行为概念化及对齐策略的使用,作者提出了适应性更强、更具用户自主性的价值对齐路径,并指出现有设计的改进方向。未来可进一步量化策略效果,并扩展该概念的适用范围,以更好地支持人与AI系统的共同发展。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
研究问题
3- 用户感知到的AI伴侣偏见存在哪些类型?分类: 算法污名化与社会伤害同类问题arrow_forward
- 用户如何通过交互主动调整AI伴侣的价值观以反映其个人或社区价值?分类: 算法污名化与社会伤害同类问题arrow_forward
- 用户驱动的价值观调整策略在真实场景中有何短期效果和局限性?分类: 算法污名化与社会伤害同类问题arrow_forward
现实痛点
1- AI伴侣的偏见和有害内容可能对用户造成心理伤害与社会影响。分类: 算法污名化与社会伤害同类问题arrow_forward
- 100%
超越专业知识和角色:一个框架来描述可解释机器学习的利益相关者及其需求
CHI '21· 可解释人工智能(XAI) +2
- 83%
解释模型:一项关于解释如何影响公平性判断的实证研究
IUI '19· 可解释人工智能(XAI) +2
- 83%
解释对人类-AI决策公平性的影响:保护特征与代理特征
IUI '24· 可解释人工智能(XAI) +2
- 80%
每个人都想做模型工作,而不是数据工作:高风险人工智能中的数据级联
CHI '21· 可解释人工智能(XAI) +1
- 80%
走向实践中的公平性:评估公平机器学习工具包的实践者导向标准
CHI '21· AI 伦理、公平与问责 +1
- 80%
陪审团学习:将不同意见整合到机器学习模型中
CHI '22· AI 伦理、公平与问责 +1
- 80%
有能力但不道德?比较AI和人类专家在道德决策中的合作
CHI '22· AI 伦理、公平与问责 +1
- 80%
文本分类中的公平性评估:机器学习从业者对个体和群体公平性的看法
CHI '23· 可解释人工智能(XAI) +1
- 80%
脱离上下文:调查“人工智能作为服务”的偏见和公平性问题
CHI '23· AI 伦理、公平与问责 +1
- 80%
这目前是杂乱无章的:考察AI/ML从业者在负责任的AI价值观共同生产过程中的挑战
CHI '23· AI 伦理、公平与问责 +1
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)