同理心的错觉?关于人机交互中情感表达的笔记
荣誉提名作者
会话代理的人格与拟人化大语言模型(LLM)的人机协作算法公平与偏见UI/UX 设计师AI/ML 研究员与工程师HCI 研究员
文献标题
The Illusion of Empathy? Notes on Displays of Emotion in Human-Computer Interaction
文献信息
- 主题领域: 人机交互(HCI)、人工智能伦理、情感计算
- 关键词: AI, LLMs, 会话代理, 自动化, 自然语言处理, 人机交互, 情感计算, 同理心, 社会机器人, 健康与心理健康, 用户体验设计, 价值观设计
研究背景与问题
- 发现的问题或挑战:
- 当前的会话代理(CAs)和大语言模型(LLMs)被设计为展示同理心,但这些表现可能具有欺骗性,甚至是剥削性质。
- 存在对不同身份用户的歧视性与不一致性行为(例如对特定社会群体或危机事件的回应差异)。
- 当前技术对同理心的概念没有清晰的定义和规范,这可能导致社会不公的进一步放大。
- 重要性:
- 同理心被广泛认为在增强人机交互的有效性方面具有重要作用,同时它也具有深远的伦理与社会影响。
- 如果这种技术得到不当应用,可能加剧社会分化、对心理健康产生负面影响,以及对边缘化群体的伤害。
- 研究动机与相关工作:
- 本研究旨在深化同理心在CAs与LLMs中的表现特性,解析该技术可能的益处与潜在危害。
- 作者基于从ELIZA到Alexa等现有的技术案例,并结合近年来关于性别、种族等领域的技术伦理研究,提出研究问题。
解决方案
- 方法或解决方案:
- 提出了一个新的框架以区分“人对人”的同理心互动和“人对计算机”的同理心互动,其中包括投射(projection)和引发(elicitation)两种机制。
- 系统性评估多种LLMs在展示同理心方面的表现,包括回应问题的语言内容和情感程度。
- 使用基于自然语言处理的同理心分类器从基于文本的互动中量化评估同理心的表达。
- 创新之处:
- 通过"投射和引发"框架细化了机器同理心的概念与评估标准,这是过去研究中较少探讨的部分。
- 提供了量化同理心能力的途径(如情感反应、解释力和探索力的分类器评分),展示了LLMs的表现与人类对比之间的差异。
- 实施步骤与技术:
- 将现有大语言模型(例如GPT-3.5、GPT-4、Google Bard、Replika等)进行系统性的测试,使用带有特定身份和背景变量的提示词。
- 运用 NLP 同理心分类器对这些模型的回答进行评分,验证模型是否能进行深度情感反应、理解并引导用户进一步探索情感问题。
研究成果
- 具体成果:
- LLMs在情感反应(Emotional Reactions)的表现评分较高,但在解读用户体验(Interpretations)以及引导用户探索问题(Explorations)方面得分较低。
- 显示LLMs存在如下不足:
- 回应对用户特定危机(如“我被强奸了”)或某些身份(如“我是神经多样化者”)时存在拒绝性行为。
- 同理心投射缺乏深度,可被看作是空洞的情感“展示”,无法像人类一样进行深层次共情或互动。
- 对某些有害意识形态的身份(如纳粹主义、反穆斯林等)表达了错误的支持性行为。
- 自然语言处理分类器的评分显示,LLMs在情感反应方面有较好的表现,但探索和解读能力严重不足。
- 与现有解决方案相比的优势:
- 使用同理心分类器改善了对机器生成内容的系统性评价,提供了一种衡量机器是否真正理解和帮助用户的方法。
- 引入对不同边缘化群体和社会价值观的分析,突出了技术对社会公平和伦理的重要性。
- 实验或评估结果:
- GPT模型在引导用户进行具体情感探索的表现显然落后于人类。
- 通过对Reddit互动数据的分析,发现LLMs虽然能够通过“对不起”等简单情感反应达到高分,但缺乏深度问题引导和分析能力。
- 局限性与未来方向:
- 局限性:
- 不明确训练数据来源,难以完全评估模型是否表现出训练文本的偏好。
- NLP同理心分类器在区分上下文和关键词(如“对不起”)的能力上可能存在不足。
- 固有设计上的缺陷可能使得某些感性问题的处理先天不足。
- 未来方向:
- 进一步开发更复杂的同理心分析框架和增强LLMs的解读与探索能力。
- 强化对边缘化人群的技术影响分析,提出更有效的设计修复方法。
- 推动相关政策与监管,避免跨文化、多领域的社会风险扩大。
- 局限性:
总结与讨论
本文对计算机与人类的同理心互动进行了深入探讨,提出了一个有力的分类框架,并通过量化实验证明了机器在同理心表现中的优势与缺陷。这一研究对情感计算及其社会影响的深度理解具有重要价值,同时为避免潜在的伤害提供了设计修复与政策制定的方向。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
help
研究问题
3- 当前的大语言模型(LLMs)和会话代理(CAs)在表现同理心时存在哪些缺陷?分类: 信任、透明度与响应时延设计同类问题arrow_forward
- 如何区分“人与人”同理心与“人机”同理心的交互机制?分类: 信任、透明度与响应时延设计同类问题arrow_forward
- 使用NLP同理心分类器评估机器同理心性能的有效性如何?分类: 信任、透明度与响应时延设计同类问题arrow_forward
lightbulb
现实痛点
1- 用户常感受到机器人表达的同理心缺乏深度,甚至可能造成伤害。分类: 信任、透明度与响应时延设计同类问题arrow_forward
- 71%
我的聊天机器人是否有议程?理解类人聊天机器人交互中的人类与人工智能主体性
CHI '26· 会话代理的人格与拟人化 +2
- 71%
助人者人恒助之:说话者与听者的协作努力及人-代理协作通信中的劳动分工
CHI '26· 对话式聊天机器人 +2
- 71%
人工智能展现的人格特质可通过对话影响人类的自我概念
CHI '26· 会话代理的人格与拟人化 +2
- 71%
氛围检查:理解基于 LLM 的对话代理人格与对齐对目标导向任务中用户感知的影响
CHI '26· 会话代理的人格与拟人化 +2
- 71%
将大型语言模型呈现为伙伴会影响人们归因于它们的心智能力
CHI '26· 大语言模型(LLM)的人机协作 +2
- 71%
通过跨时序情感建模实现自然且陪伴型虚拟智能体
CHI '26· 会话代理的人格与拟人化 +2
- 67%
从HCI研究中映射机器学习进展以揭示设计创新的起点
CHI '18· 大语言模型(LLM)的人机协作
- 67%
《人工智能导演请起立》:通过故事补全探索语音技术的可能未来
DIS '20· 会话代理的人格与拟人化 +1
- 63%
「请不要杀死唯一让人感觉像人的模型」: 理解 #Keep4o 反对运动
CHI '26· 生成式AI(文本、图像、音乐、视频) +3
- 63%
当周围无人是真实的:探索多主体AI社交平台的公众意见与用户体验
CHI '26· 对话式聊天机器人 +3
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)
快捷操作
广告推荐
学习 AI 编程到 CodeNow
open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3613904.3642336
一眼看懂
fact_check论文快照
dataset
来源
CHI
calendar_month
年份
2024
emoji_events
奖项
荣誉提名
group
作者
7 位作者
sell
研究子方向
会话代理的人格与拟人化、大语言模型(LLM)的人机协作、算法公平与偏见
work
职业/产业
UI/UX 设计师、AI/ML 研究员与工程师、HCI 研究员
article
内容状态
已索引正文
hub
相关论文
10 篇相关论文