大语言模型在人类机器人交互中的心智理论能力:一种幻觉?
大语言模型在各种自然语言生成任务中展现了卓越的生成能力。然而,对其拟人化倾向和失败案例的宽容态度推动了关于大语言模型新兴能力的讨论,特别是心智理论(ToM)能力。虽然存在多种错误信念测试来验证推断和维持他人心理模型的能力,但我们研究了一种更高风险且可能产生不可逆后果的ToM应用:人类机器人交互。在这项工作中,我们探索感知行为识别任务,其中机器人使用大语言模型以类似于人类观察者的方式评估其生成的行为。我们关注四种行为类型:可解释性、可读性、可预测性和模糊性行为,这些行为已被广泛用于合成可解释的机器人行为。大语言模型的目标是作为人类在循环中的代理,回答人类会如何感知某个智能体行为的问题。我们进行了一项人类受试者研究,以验证用户在五个领域的特定情境(机器人设置和计划)中能够正确回答此类问题。对信念测试的初步分析显示出极其积极的结果, inflate了人们对大语言模型具备ToM能力的期望。然后,我们提出并执行了一套扰动测试,揭示了这一幻觉,即不一致信念、无信息上下文和信念测试。我们得出结论,大语言模型在普通提示下的高分展示了其在人机交互设置中的潜在用途,但要真正具备心智理论能力,需要对上下文中琐碎或无关的扰动保持不变,而这正是大语言模型所缺乏的。我们报告了在GPT-4和GPT-3.5-turbo上的结果。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
- 63%
汽车中的情感感知设计:利用技术进步提升人车交互
CHI '25· 脑机接口(BCI)与神经反馈 +1
- 63%
基于LLM的搜索对决策制定的影响:速度、准确性和过度依赖
CHI '25· 大语言模型(LLM)的人机协作 +2
- 63%
理解配置AI在用户体验工作实践中的非使用情况的社会技术因素
CHI '25· 大语言模型(LLM)的人机协作 +2
- 63%
探索主动生成式AI智能体在时间紧迫的协作问题解决任务中的影响
CHI '26· 大语言模型(LLM)的人机协作 +2
- 63%
我的聊天机器人是否有议程?理解类人聊天机器人交互中的人类与人工智能主体性
CHI '26· 会话代理的人格与拟人化 +2
- 63%
迈向AI作为同事:多智能体系统改进结构化创意构思流程
CHI '26· 大语言模型(LLM)的人机协作 +2
- 63%
情境化、动态化与主观化:与行业从业者共同构想心智理论赋能的日常AI设计
CHI '26· 脑机接口(BCI)与神经反馈 +2
- 63%
DuetUI:面向任务导向接口的人机协同生成双向上下文循环
CHI '26· 大语言模型(LLM)的人机协作 +2
- 63%
氛围检查:理解基于 LLM 的对话代理人格与对齐对目标导向任务中用户感知的影响
CHI '26· 会话代理的人格与拟人化 +2
- 63%
机器之眼:具身化大型语言模型的关系性交互设计
CHI '26· 大语言模型(LLM)的人机协作 +2
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)