用户驱动的价值观对齐:理解用户对AI伴侣中偏见和歧视性陈述的看法及应对策略

可解释人工智能(XAI)AI 伦理、公平与问责算法公平与偏见AI/ML 研究员与工程师HCI 研究员

研究背景与问题

  • 发现的问题或挑战: 作者发现基于大型语言模型(LLM)创建的AI伙伴(AI companions)在日常互动中可能生成偏见、歧视性以及有害的语句。这些问题带来了心理伤害、社会刻板印象的加深,尤其是对边缘化群体有潜在的负面影响。同时,现有由技术专家主导的价值对齐框架(如“帮助、诚实和无害”原则)的通用性有限,难以完全满足用户在实际交互中的具体需求。

  • 重要性: AI伙伴已从普通聊天机器人转变为用户的虚拟朋友、伴侣甚至家庭成员,形成一种情感连接。这种情感依赖使人们在面对AI生成的歧视性内容时感到强烈的情绪困惑和伤害。因此,在动态的现实用户与AI互动场景中,需要引入一种新的价值对齐途径来避免和缓解这些问题。

  • 研究动机与相关工作: 作者提出了用户主导价值对齐(User-Driven Value Alignment)的概念,旨在探索用户如何通过交互主动识别并纠正AI系统的有害行为。同时,这种方法寻求扩展用户在与AI系统对齐其价值和伦理标准过程中的主动性,与过去的技术专家主导方法或用户算法审计方法相比具有创新性。


解决方案

  • 提出的方法或解决方案: 作者引入了“用户主导价值对齐”的概念,强调用户在日常互动中对AI输出的偏见识别、质疑以及矫正,通过多种策略重新引导AI行为,使其反映个人或社区价值。这些策略分为技术策略(如重生成或回退)、论证策略(例如表达愤怒或说理劝导)以及角色策略(例如修改AI角色设置)。

  • 创新之处:

    • 用户主动参与:从传统的用户仅反馈训练数据转变为实时主动的价值调整过程。
    • 实际环境适配:对齐过程直接基于用户在真实生活中的个体化交互场景进行。
    • 强调个性与社区需求:比通用性框架更好地反映了用户的特异性期望、价值及社会文化。
    • 重视长期迭代优化:用户通过连续的交互和反馈逐步调整AI表现,从而推动其行为改善。
  • 实施步骤与关键技术:

    1. 从多种社交媒体平台(如Reddit、抖音等)收集用户提交的77条关于AI伙伴歧视性语句的投诉帖子。
    2. 招募20位在AI伙伴应用中有经验的用户,进行半结构化访谈,调查用户对抗AI偏见的策略及其对AI行为的理解。
    3. 使用反思性主题分析方法对访谈和帖子数据进行编码,揭示用户感知的歧视性语句类别、对AI行为的概念化,以及用户采用的对齐策略。

研究成果

  • 具体成果:

    1. 识别了六种用户感知的常见歧视类型,包括性别歧视(misogyny)、LGBTQ+偏见、外貌偏见、能力歧视(ableism)、种族歧视和社会经济偏见。
    2. 用户将AI行为概念化为三种形态:机器(Machine)、需要教导的婴儿(Baby)以及扮演角色的Cosplayer。
    3. 总结了七种用户对齐策略,并分类为技术、论证和角色三种高级类别。
    4. 用户对这些策略的短期效果感知表明对齐过程中仍存在现实与期望之间的落差。
  • 与现有解决方案的优势: 相较于技术专家主导的方法,用户主导的价值对齐更强调用户的参与性和自主性,能够更好地在复杂多变的现实场景中适配个体和社区的需求。此外,它通过迭代交互建立更加长期有效的行为改进机制。

  • 实验或评估结果: 在短期评估中,技术性策略常常无法完全解决问题,而论证类策略虽然有效但可能对用户情绪造成负担。角色策略则通常适用于短期纠正,但无法解决更深层次的偏见问题。

  • 局限性与未来方向:

    1. 研究基于自我报告数据,可能存在情感和叙述偏差。
    2. 样本量较小,主要以定性方法为主,难以广泛推广。
    3. 仅集中研究AI伙伴中的偏见问题,未来可扩展至其他类型的AI系统与价值对齐领域。
    4. 尚未测试这些策略的长期有效性,可开展更具针对性的大规模实验或纵向研究。

总结

本文为探索用户主导价值对齐现象迈出了重要一步。通过分析用户对AI伙伴偏见的感知、行为概念化及对齐策略的使用,作者提出了适应性更强、更具用户自主性的价值对齐路径,并指出现有设计的改进方向。未来可进一步量化策略效果,并扩展该概念的适用范围,以更好地支持人与AI系统的共同发展。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/chi/188861/2025

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://dl.acm.org/doi/10.1145/3706598.3713477
一眼看懂

论文快照

fact_check
dataset
来源
CHI
calendar_month
年份
2025
emoji_events
奖项
未标记奖项
group
作者
7 位作者
sell
研究子方向
可解释人工智能(XAI)、AI 伦理、公平与问责、算法公平与偏见
work
职业/产业
AI/ML 研究员与工程师、HCI 研究员
article
内容状态
已索引正文
hub
相关论文
10 篇相关论文